TOEFL 口语评分系列 · Delivery
LingoLeap Research Team · 2026 年 9 月
速览结论
在所报告的 LingoLeap AI 分档中,较高分档的 Delivery 平均信号也较高:从 2 分档到 4.5 分档,流利度约 50→81,语调 67→81,语速约 83→135 wpm,答题长度 58→91 词。零停顿分桶平均分最低,但受到短答与截断作答的混杂。这些是相关关系,不是因果评分规则。
这是 TOEFL 口语评分系列 的 Delivery 分册。系列主报告回答“口语是怎么评分的”,这一册只看三大维度里最“可听见”的一项:答案听起来是否流利、清晰、有节奏。
数据来自 LingoLeap 上真实、自愿的 TOEFL 2026 Take an Interview 练习作答,经匿名化并按每条答案的 AI 分档聚合。Delivery 计时信号来自自动语音评估(Azure),其余为 LingoLeap 的 AI 评分。这些是映射到公开评分维度名称的 AI 信号,不是 ETS 官方评分。只发布聚合结果,不含录音、转写、用户 ID 或单条作答。低于 2.0 的分档因短答案造成语速假象而从主分析中剔除。
流利度、语调、发音、准确度都随分档单调上升,其中流利度(fluency)的跨度最大。
四项里,流利度(fluency)在所报告分档间的跨度最大(约 50→81)。相比之下,语调(prosody)从 67 到 81、准确度(accuracy)从 70 到 91,跨度较小。这里比较的是分档均值差异,不代表流利度对分数有更强的因果作用。
语速与平均分并不是线性关系。按语速分桶后,平均分在 140–159 wpm 分桶最高(约 3.5),更快的分桶均值下降。作答长度、清晰度、熟练度和识别质量都可能造成混杂,因此这不是推荐语速。
更长的答案分桶也对应更高的平均分,但这不能确定理想长度或因果效果;完整度、熟练度、题目难度等因素都可能同时影响长度与分数。
停顿数与分数不是“越少越好”:零停顿分桶的平均分最低,但该分桶受到短答和截断作答的明显混杂影响。
这正是只看单一相关就会误导的例子:原始停顿数与长度高度混杂——没停顿往往因为没说几句。所以我们不把“少停顿”当成建议,而用流利度、语速、长度来刻画 Delivery,把停顿数单列为一个诚实的旁证。
这份观察性数据不能给出单一的练习处方,但它明确不支持把“说快、别停”当成评分捷径。练习时应结合内容完整度、清晰度和个体反馈。
LingoLeap Research Team(2026)。TOEFL 口语不同分档的 Delivery 差异。 LingoLeap Research,版本 1.0。
https://lingoleap.ai/zh-TW/research/toefl-speaking-fluency
样本:14,884 次练习中的 55,614 条作答。
Delivery 指答案“听起来怎么样”——流利度与语速、节奏与语调(prosody)、以及清晰的发音。它是 TOEFL 口语三大评分维度之一,另外两个是 Language Use(语言运用)和 Topic Development(内容展开)。在 LingoLeap 的数据里,Delivery 信号是最能拉开分档的。
这份数据不能证明改变语速会导致分数变化。140–159 wpm 分桶的平均分最高,更快分桶的均值较低,但作答长度、清晰度、熟练度和识别质量都可能造成混杂。
数据不支持把“少停顿”当作评分规则。零停顿分桶的平均分最低,但受到短答和截断作答的明显混杂;不能把停顿数本身解释为导致高分或低分。
在这份数据里,更长的作答分桶平均 AI 分数更高,但分析不能确定理想长度或因果效果。长度也可能反映完整度、熟练度、题目难度等其他因素。