LingoLeap

152,218 次 TOEFL 听后重复作答告诉了我们什么

LingoLeap Research Team · 2026 年 9 月

听后重复看起来简单得似乎没有什么可研究的:听一句,再原样说出来。不需要组织观点,也没有模板可套。但当我们查看真实练习时,同样的问题不断出现——句子越长,后半段越容易丢词、吞词尾,节奏也开始断裂。

我们想知道,这究竟是真实规律,还是少数令人印象深刻的个案。于是,我们汇总了 2026 年 1 月至 9 月 LingoLeap 上 23,390 次练习中的 152,218 条单句评分作答。

最明显的规律来自句子长度。6 词及以内的句子,学习者平均能复述 78.8%;到了 16 词以上,只剩 50.0%。数据还显示,一小组音素反复得低分,词尾 -s 经常消失,而检测到的停顿越多,平台均分越低。

下面我们会先说明数据是如何处理的,再逐一解释五个规律,以及这些规律对实际练习意味着什么。

01

句子负荷

≤6 → 16+ 词

需要保留的内容增加

02

复述完整度

78.8% → 50.0%

能复述出的内容减少

03

表达流畅度

停顿 5+ 次:2.22/5

停顿越多,均分越低

04

细节保留

11.4% 词尾 -s 被漏掉

微小词尾更容易消失

本页分析的四个信号;箭头仅表示阅读顺序,不代表已经证实的因果关系。
Section 1

我们想弄清楚什么

我们刻意把问题限定得很窄。这些数据可以显示 LingoLeap 练习中反复出现的规律,但不能单独证明规律背后的原因。

  • 句子变长时,复述完整度和平台分数如何变化?
  • 哪些音素和词尾反复得到较低的自动发音评估结果?
  • 学习者停顿次数增加时,平台分数如何变化?
Section 2

数据是怎么处理的

数据集包含 23,390 次真实练习和 152,218 条单句评分作答。每段录音经过自动发音评估,得到单词时间戳以及 0–100 的单词、音素准确度;每句话同时得到一个 0–5 的 LingoLeap 平台分数。

本页把「复述完整度」定义为学习者实际复述出的目标句比例,通过目标文本与识别单词对齐后计算。「停顿」指相邻单词之间超过 250ms 的静音。

需要注意:一条作答不等于一名学习者。一次练习包含多个句子,同一名学习者也可能练习多次。当前页面使用的聚合数据没有独立学习者数和独立题目数,因此不能把 152,218 条作答理解为 152,218 名考生。

另有 11,512 条没有识别到语音的记录,不参与内容层面的计算。下文报告样本量、比例、组间差值和平均分,但不报告显著性和置信区间,因为重复学习者和重复题目并不是相互独立的观察值。

Section 3

规律 1:句子越长,能复述出的内容越少

这是数据中最清晰的规律。短句平均复述完整度为 78.8%,最长句降至 50.0%,平台均分也随之下降。

0%25%50%75%100%79%≤6 3.74/574%7–9 3.51/566%10–12 3.15/557%13–15 2.79/550%16+ 2.61/5柱:复述比例 · 下方:平均分LingoLeap Research
图 1. 不同句长下目标句的平均复述比例(n = 152,218 条作答);横轴下方为各组平均分。 LingoLeap Research · 2026

更值得注意的是没有明显变化的指标:从最短组到最长组,平均发音准确度只从 84.8 变为 84.5,但复述完整度相差 28.8 个百分点。换句话说,学习者不一定把保留下来的每个词都读得明显更差,而是没有把整句话完整带回来。

为什么会这样?

工作记忆和处理负荷增加是一种合理解释 [1],但本数据无法把它单独分离出来:长句也可能包含更难的词汇、句法或音素组合。这是练习记录中反复出现的相关规律,不是控制句长后的实验结果。

句子长度作答数平均分分差复述完整度完整度差
≤6 词18,8923.740.0078.8%0.0 pp
7–9 词47,7333.51-0.2373.7%-5.1 pp
10–12 词49,5013.15-0.5965.8%-13.0 pp
13–15 词23,0342.79-0.9557.2%-21.6 pp
16+ 词13,0582.61-1.1350.0%-28.8 pp
表 1. 按句子长度分组的作答数、平均分与复述完整度。 LingoLeap Research · 2026
Section 4

规律 2:少数音素明显更难

在所有测量音素中,/θ/(thin 中的 “th”)自动评估得分最低,平均为 61.6/100;在 17,575 次测量中,有 37.6% 低于服务商定义的 60 分阈值。

020406080100/θ/ thin61.6/ŋ/ sing69.8/z/ zoo74.3// goat75.2/s/ see79.3/d/ day80.7/w/ way81/t/ tea81.5/h/ hat81.6/n/ no81.8LingoLeap Research
图 2. 十个平均准确度最低的音素(0–100);虚线表示 60 分阈值。 LingoLeap Research · 2026
音素测量次数平均准确度低于 60
/θ/17,57561.637.6%
/ŋ/61,20369.827.2%
/z/188,17874.323.0%
/oʊ/83,99175.225.0%
/s/286,02179.318.8%
/d/212,53780.716.5%
/w/94,0818114.9%
/t/401,94881.516.3%
/h/60,16781.617.3%
/n/409,46281.816.4%
表 2. 十个平均得分最低的音素、出现次数及低于 60 分的比例。 LingoLeap Research · 2026

这个差距足以成为练习线索,但也很容易被过度解释。这些是自动评估结果,不是语音学家的人工判断。微软把 AccuracyScore 定义为发音与母语者模型的声学接近程度,并把单词准确度低于 60 分标记为读音错误 [3]。

母语是原因吗?

母语可能是原因之一——跨语言语音研究预测了音素层面的差异 [2]——但本页没有检验这一假设。大多数练习没有可用的第一语言信息,因此母语对比会放在独立研究中。

第一语言差异

最难的音可能随学习者第一语言而变化。中文界面学习者与其他学习者之间的差异将在 中国学习者发音对比研究中单独分析。

Section 5

规律 3:单词还在,词尾却消失了

237,757 个带词尾 -s 的单词中,11.4% 的词尾没有出现在识别结果里。

这种错误很容易被耳朵忽略。主体单词还在,整句听起来似乎正确,但一个很小的语法信号已经消失。即使词尾被保留下来,末尾擦音的平均准确度也只有 74.3/100。现有数据无法判断每一次遗漏究竟来自记忆负荷、发音动作还是语音识别误差。词尾丢失会改变语法:closes 变成 closeweekends 变成 weekend

目标句

The reading room closes at nine on weekends.

常见遗漏

The reading room closes at nine on weekends.

词尾 -s 分析中所统计现象的可视化示例。
Section 6

规律 4:停顿越多,平均分越低

平均分随着停顿次数增加而逐级下降:没有检测到停顿的作答平均为 3.68/5,停顿 5 次以上时降至 2.22/5。

2.02.53.03.54.03.6803.1112.7822.5532.4142.225+检测到的停顿次数
图 3. 按检测停顿次数统计的 LingoLeap 平台平均分(n = 152,218 条评分作答)。 LingoLeap Research · 2026
停顿次数作答数平均分相对无停顿
无停顿66,7783.680.00
142,3423.11-0.57
225,4522.78-0.90
311,9302.55-1.13
44,2702.41-1.27
5+1,4462.22-1.46
表 3. 按停顿次数统计的平均分(停顿定义为相邻单词间超过 250ms 的静音)。 LingoLeap Research · 2026

这个近乎逐级下降的趋势很明显,但它并不是对“每次停顿扣多少分”的估计。能力较弱或复述不完整的学习者,可能同时更容易停顿,也更容易得到低分。

停顿位置重要吗?

影响比我们预想的更小。在标注断点处停顿的平均分为 2.82,短语中间停顿为 2.73。这个差距不足以支持“停顿位置决定分数”的强结论。

Section 7

规律 5:少数单词反复得到低分

包含较难音素或辅音组合的实义词得分最低,例如 turned41/100)和 loaner44/100)。

turned41loaner44portraits54.2closed61.3sightlines62.7known63.3
图 4. 筛选后数据中六个平均自动发音准确度最低的单词。 LingoLeap Research · 2026
单词测量次数平均准确度
turned6141
loaner10444
portraits18954.2
closed39161.3
sightlines31462.7
known14963.3
rollers26365.5
turnstiles31567.2
brochures7468
counters9168.6
表 4. 至少出现 50 次的单词中,平均准确度最低的十个。 LingoLeap Research · 2026
Section 8

这些规律可能如何关联

这些结果描述了两个可以观察的维度:一边是复述完整度和停顿行为,另一边是自动发音评估。工作记忆研究让“处理负荷”成为解释句长规律的一种合理假设 [1];语言测评研究则提醒我们,自动语音评分仍需要针对具体测量构念进行验证 [4]。这些都是解释,不是本数据已经证明的原因。

对学习者来说,这些描述性结果仍然给出了具体的诊断目标:比较自己在短句和长句上的表现,检查句尾是否完整保留,再找出反复得低分的音素。配套方法页会把这些观察转化为练习步骤,但不应把这些建议理解为已经经过实验估计的提分效果。

Section 9

从整体规律回到真实句子

上面的每个数字都是数千次作答的平均结果。接下来的 sample 页面会回到具体句子:展示目标句、如何分块、哪些词更容易被漏掉,以及学习者通常在哪里停顿。可以先从下面这个例子开始:

Section 10

最后的想法

听后重复并不是以一种神秘方式让学习者失分。练习记录指向几个同时发生的小问题:句子变长后复述变得不完整,少数音素持续不稳定,语法词尾消失,而更多停顿伴随着更低的平台分数。

我们目前最合理的解释是,记忆压力与发音动作会相互影响,但这仍然只是一种解释。下一步更有价值的研究,是追踪同一名学习者在同一句子上的多次表现,验证针对性练习是否真正改变结果。

现阶段最实际的用法是把数据当作诊断工具:找到自己的复述从哪个句长开始崩,检查末尾单词和词尾是否保留,再单独练习反复得低分的音。配套的 听后重复分块方法页 会把这些检查变成可执行的练习流程。

Section 11

数据集说明

LingoLeap Research Team(2026)。152,218 次 TOEFL 听后重复作答告诉了我们什么。LingoLeap Research,版本 1.0。

https://lingoleap.ai/zh-TW/research/listen-and-repeat

Section 12

注释与资料来源

  1. [1] Baddeley, A., Gathercole, S., & Papagno, C. (1998). The phonological loop as a language learning device. Psychological Review, 105(1), 158–173.
  2. [2] Saito, K. (2019). Effects of second language pronunciation teaching revisited. Language Learning, 69(3), 652–708.
  3. [3] Microsoft. (2026). Use pronunciation assessment. Microsoft Learn.
  4. [4] Xi, X. (2023). Examining the validity of automated speech scoring systems. Journal of the Acoustical Society of Japan, 79(3), 170–176.
Section 13

学习者经常问的问题

这项研究分析了多少次 TOEFL 听后重复作答?

本研究覆盖 LingoLeap 上 23,390 次真实听后重复练习,共包含 152,218 条单句评分作答,数据始于 2026 年 1 月。

TOEFL 听后重复中最难发的英语音是什么?

/θ/(thin 中的 th)在自动发音评估中得分最低,平均为 61.6/100;其 17,575 次测量中有 37.6% 低于 60 分阈值。

句子长度会影响听后重复表现吗?

在本数据集中,6 词及以内句子的平均复述保留率为 78.8%,16 词以上降至 50.0%;同期 LingoLeap 平台均分从 3.74 降至 2.61。该观察性数据不能证明句子长度是唯一原因。

这些分数是 ETS 官方 TOEFL 分数吗?

不是。文中的 0–5 分是 LingoLeap 单句平台评分,发音数据来自自动语音评估;这些结果描述平台练习中的规律,不等同于 ETS 官方考试成绩。