机器评分靠不靠谱,官方披露过哪些准确度数据
官方培训资料披露的引擎指标
在面向高校教师的操作培训资料中,开发方给出过一组评阅引擎指标:
| 指标 | 数值 |
|---|---|
| 人评机评一致性 | 90% |
| 纠错准确率 | 98% |
| 纠错召回率 | 70% |
三个数字含义不同:一致性指机器评分与人工评分的接近程度;准确率指机器报出的错误里有多少是真错;召回率指作文里实际存在的错误有多少被找了出来。召回率相对偏低说明机器可能漏报部分错误——这也是设计上把"机器初批 + 教师复核"组合起来用的原因。
满意度调研
同一份培训资料还记录了一次面向院校教师的问卷调研:邀请 100 所院校的 266 位教师参与,对象集中在大一至大三的大学英语课程,也包括学术写作、商务英语等课程。结果为:
- 评分准确性满意度 81.97%
- 语法纠错准确性满意度 85.25%
- 语法纠错无遗漏满意度 75.41%
以上数字来自官方教师培训资料的公开版本,统计时间与口径以原始资料为准;引擎会持续迭代,当前版本的实际表现可能与早年数据有差异。
怎么理性使用这些数字
- 机评分适合作为初稿的参考基准:先按机器反馈改一轮,效率更高。
- 关键作业(期末、考试模拟)以教师评分为准,机器分供师生对照。
- 逐句纠错建议合理采纳:机器对搭配、用词的建议有价值,但涉及论证内容的判断,最终以人和写作要求为准。
与语料库的关系
评阅引擎的底层支撑是语料库与数据分析。据官网介绍,平台拥有包括 COCA、BNC、NOW 以及学习者语料库在内的语料资源,内容评价依托联想词库进行。想了解语料库在写作练习中的用法,见四维批改详解。