LingoLeap Research Team · 2026 年 9 月
听后重复看起来简单得似乎没有什么可研究的:听一句,再原样说出来。不需要组织观点,也没有模板可套。但当我们查看真实练习时,同样的问题不断出现——句子越长,后半段越容易丢词、吞词尾,节奏也开始断裂。
我们想知道,这究竟是真实规律,还是少数令人印象深刻的个案。于是,我们汇总了 2026 年 1 月至 9 月 LingoLeap 上 23,390 次练习中的 152,218 条单句评分作答。
最明显的规律来自句子长度。6 词及以内的句子,学习者平均能复述 78.8%;到了 16 词以上,只剩 50.0%。数据还显示,一小组音素反复得低分,词尾 -s 经常消失,而检测到的停顿越多,平台均分越低。
下面我们会先说明数据是如何处理的,再逐一解释五个规律,以及这些规律对实际练习意味着什么。
句子负荷
≤6 → 16+ 词
需要保留的内容增加
复述完整度
78.8% → 50.0%
能复述出的内容减少
表达流畅度
停顿 5+ 次:2.22/5
停顿越多,均分越低
细节保留
11.4% 词尾 -s 被漏掉
微小词尾更容易消失
我们刻意把问题限定得很窄。这些数据可以显示 LingoLeap 练习中反复出现的规律,但不能单独证明规律背后的原因。
数据集包含 23,390 次真实练习和 152,218 条单句评分作答。每段录音经过自动发音评估,得到单词时间戳以及 0–100 的单词、音素准确度;每句话同时得到一个 0–5 的 LingoLeap 平台分数。
本页把「复述完整度」定义为学习者实际复述出的目标句比例,通过目标文本与识别单词对齐后计算。「停顿」指相邻单词之间超过 250ms 的静音。
需要注意:一条作答不等于一名学习者。一次练习包含多个句子,同一名学习者也可能练习多次。当前页面使用的聚合数据没有独立学习者数和独立题目数,因此不能把 152,218 条作答理解为 152,218 名考生。
另有 11,512 条没有识别到语音的记录,不参与内容层面的计算。下文报告样本量、比例、组间差值和平均分,但不报告显著性和置信区间,因为重复学习者和重复题目并不是相互独立的观察值。
这是数据中最清晰的规律。短句平均复述完整度为 78.8%,最长句降至 50.0%,平台均分也随之下降。
更值得注意的是没有明显变化的指标:从最短组到最长组,平均发音准确度只从 84.8 变为 84.5,但复述完整度相差 28.8 个百分点。换句话说,学习者不一定把保留下来的每个词都读得明显更差,而是没有把整句话完整带回来。
工作记忆和处理负荷增加是一种合理解释 [1],但本数据无法把它单独分离出来:长句也可能包含更难的词汇、句法或音素组合。这是练习记录中反复出现的相关规律,不是控制句长后的实验结果。
| 句子长度 | 作答数 | 平均分 | 分差 | 复述完整度 | 完整度差 |
|---|---|---|---|---|---|
| ≤6 词 | 18,892 | 3.74 | 0.00 | 78.8% | 0.0 pp |
| 7–9 词 | 47,733 | 3.51 | -0.23 | 73.7% | -5.1 pp |
| 10–12 词 | 49,501 | 3.15 | -0.59 | 65.8% | -13.0 pp |
| 13–15 词 | 23,034 | 2.79 | -0.95 | 57.2% | -21.6 pp |
| 16+ 词 | 13,058 | 2.61 | -1.13 | 50.0% | -28.8 pp |
在所有测量音素中,/θ/(thin 中的 “th”)自动评估得分最低,平均为 61.6/100;在 17,575 次测量中,有 37.6% 低于服务商定义的 60 分阈值。
| 音素 | 测量次数 | 平均准确度 | 低于 60 |
|---|---|---|---|
| /θ/ | 17,575 | 61.6 | 37.6% |
| /ŋ/ | 61,203 | 69.8 | 27.2% |
| /z/ | 188,178 | 74.3 | 23.0% |
| /oʊ/ | 83,991 | 75.2 | 25.0% |
| /s/ | 286,021 | 79.3 | 18.8% |
| /d/ | 212,537 | 80.7 | 16.5% |
| /w/ | 94,081 | 81 | 14.9% |
| /t/ | 401,948 | 81.5 | 16.3% |
| /h/ | 60,167 | 81.6 | 17.3% |
| /n/ | 409,462 | 81.8 | 16.4% |
这个差距足以成为练习线索,但也很容易被过度解释。这些是自动评估结果,不是语音学家的人工判断。微软把 AccuracyScore 定义为发音与母语者模型的声学接近程度,并把单词准确度低于 60 分标记为读音错误 [3]。
母语可能是原因之一——跨语言语音研究预测了音素层面的差异 [2]——但本页没有检验这一假设。大多数练习没有可用的第一语言信息,因此母语对比会放在独立研究中。
第一语言差异
最难的音可能随学习者第一语言而变化。中文界面学习者与其他学习者之间的差异将在 中国学习者发音对比研究中单独分析。
在 237,757 个带词尾 -s 的单词中,11.4% 的词尾没有出现在识别结果里。
这种错误很容易被耳朵忽略。主体单词还在,整句听起来似乎正确,但一个很小的语法信号已经消失。即使词尾被保留下来,末尾擦音的平均准确度也只有 74.3/100。现有数据无法判断每一次遗漏究竟来自记忆负荷、发音动作还是语音识别误差。词尾丢失会改变语法:closes 变成 close,weekends 变成 weekend。
目标句
The reading room closes at nine on weekends.
常见遗漏
The reading room closes at nine on weekends.
-s 分析中所统计现象的可视化示例。平均分随着停顿次数增加而逐级下降:没有检测到停顿的作答平均为 3.68/5,停顿 5 次以上时降至 2.22/5。
| 停顿次数 | 作答数 | 平均分 | 相对无停顿 |
|---|---|---|---|
| 无停顿 | 66,778 | 3.68 | 0.00 |
| 1 | 42,342 | 3.11 | -0.57 |
| 2 | 25,452 | 2.78 | -0.90 |
| 3 | 11,930 | 2.55 | -1.13 |
| 4 | 4,270 | 2.41 | -1.27 |
| 5+ | 1,446 | 2.22 | -1.46 |
这个近乎逐级下降的趋势很明显,但它并不是对“每次停顿扣多少分”的估计。能力较弱或复述不完整的学习者,可能同时更容易停顿,也更容易得到低分。
影响比我们预想的更小。在标注断点处停顿的平均分为 2.82,短语中间停顿为 2.73。这个差距不足以支持“停顿位置决定分数”的强结论。
包含较难音素或辅音组合的实义词得分最低,例如 turned(41/100)和 loaner(44/100)。
| 单词 | 测量次数 | 平均准确度 |
|---|---|---|
| turned | 61 | 41 |
| loaner | 104 | 44 |
| portraits | 189 | 54.2 |
| closed | 391 | 61.3 |
| sightlines | 314 | 62.7 |
| known | 149 | 63.3 |
| rollers | 263 | 65.5 |
| turnstiles | 315 | 67.2 |
| brochures | 74 | 68 |
| counters | 91 | 68.6 |
这些结果描述了两个可以观察的维度:一边是复述完整度和停顿行为,另一边是自动发音评估。工作记忆研究让“处理负荷”成为解释句长规律的一种合理假设 [1];语言测评研究则提醒我们,自动语音评分仍需要针对具体测量构念进行验证 [4]。这些都是解释,不是本数据已经证明的原因。
对学习者来说,这些描述性结果仍然给出了具体的诊断目标:比较自己在短句和长句上的表现,检查句尾是否完整保留,再找出反复得低分的音素。配套方法页会把这些观察转化为练习步骤,但不应把这些建议理解为已经经过实验估计的提分效果。
上面的每个数字都是数千次作答的平均结果。接下来的 sample 页面会回到具体句子:展示目标句、如何分块、哪些词更容易被漏掉,以及学习者通常在哪里停顿。可以先从下面这个例子开始:
听后重复并不是以一种神秘方式让学习者失分。练习记录指向几个同时发生的小问题:句子变长后复述变得不完整,少数音素持续不稳定,语法词尾消失,而更多停顿伴随着更低的平台分数。
我们目前最合理的解释是,记忆压力与发音动作会相互影响,但这仍然只是一种解释。下一步更有价值的研究,是追踪同一名学习者在同一句子上的多次表现,验证针对性练习是否真正改变结果。
现阶段最实际的用法是把数据当作诊断工具:找到自己的复述从哪个句长开始崩,检查末尾单词和词尾是否保留,再单独练习反复得低分的音。配套的 听后重复分块方法页 会把这些检查变成可执行的练习流程。
LingoLeap Research Team(2026)。152,218 次 TOEFL 听后重复作答告诉了我们什么。LingoLeap Research,版本 1.0。
https://lingoleap.ai/zh-TW/research/listen-and-repeat
本研究覆盖 LingoLeap 上 23,390 次真实听后重复练习,共包含 152,218 条单句评分作答,数据始于 2026 年 1 月。
/θ/(thin 中的 th)在自动发音评估中得分最低,平均为 61.6/100;其 17,575 次测量中有 37.6% 低于 60 分阈值。
在本数据集中,6 词及以内句子的平均复述保留率为 78.8%,16 词以上降至 50.0%;同期 LingoLeap 平台均分从 3.74 降至 2.61。该观察性数据不能证明句子长度是唯一原因。
不是。文中的 0–5 分是 LingoLeap 单句平台评分,发音数据来自自动语音评估;这些结果描述平台练习中的规律,不等同于 ETS 官方考试成绩。