✏️ 课后小测
完成以下题目,检验你对分词知识的掌握程度~
1
为什么中文需要分词技术?
单选题
A 中文和英文一样,单词之间天然有空格
B 中文词语之间没有空格,计算机需要分词来理解文本
C 分词只是为了排版美观,没有实际意义
D 分词是中文特有的标点符号处理方式
✅ 正确答案:B
中文与英文不同,词语之间没有天然的空格分隔。计算机要理解中文文本,必须先将其切分成一个个有意义的词语——这就是中文分词的作用。比如"我们在实验室学习"→"我们 / 在 / 实验室 / 学习"。
2
最大匹配法的核心思想是什么?
单选题
A 每次匹配最短的词语,尽可能多切分
B 从句子中间开始随机匹配
C 每次匹配最长的词语(贪心策略),逐步切分
D 把所有可能的切分都列出来再选择
✅ 正确答案:C
最大匹配法的核心是贪心策略——从左到右(正向)或从右到左(逆向)扫描句子,每次尽可能匹配最长的词语。例如"我们在实验室",正向最大匹配会先匹配到"实验室"(3字词,比"我们""在"更长),从而提高匹配效率。
3
关于正向最大匹配和逆向最大匹配,哪种说法正确?
单选题
A 正向一定比逆向好,应该只使用正向
B 逆向一定比正向好,应该只使用逆向
C 正向和逆向结果总是完全相同
D 扫描方向不同,结果可能不同,通常逆向更准
✅ 正确答案:D
正向和逆向只是扫描方向不同,对同一句子可能产生不同的分词结果。实验证明,逆向最大匹配通常更准确,因为中文的语义重心往往在句子后部。但两者都不是完美的——所以才有了双向匹配法来综合判断。
4
最大匹配法能够完美处理所有中文分词问题,是一个十全十美的算法。
判断题
✅ 正确答案:错误 ✗
最大匹配法有明显的局限性:① 依赖词典质量,新词(未登录词)无法识别;② 贪心策略不保证全局最优,可能陷入局部最优;③ 无法处理真正的语义歧义。现代系统多用统计方法或深度学习方法来改进。
5
双向匹配法综合正向和逆向的结果,选择更合理的分词方案,是解决歧义的常用策略。
判断题
✅ 正确答案:正确 ✓
双向匹配法是解决分词歧义的实用策略:同时使用正向和逆向进行分词,然后根据规则选择更合理的结果——比如选择词数更少的方案(更符合"词越长越好"的原则),如果词数相同则选单字词更少的方案,还相同则选逆向结果。