TOEFLIELTS
한국어
LingoLeap 리서치

템플릿은 토플 점수를 깎을까? 답안 3,692개를 측정했습니다.

거의 모든 토플 대비 사이트가 AI 채점이 템플릿 표현을 감지해 감점한다고 주장하지만, 수치를 공개한 곳은 없습니다. 저희는 1,467개 문제에 걸친 아카데믹 디스커션 답안 3,692개를 채점하고 실제로 확인했습니다.

LingoLeap 리서치, 2026년 9월 17일. 방법론, 데이터 처리 방식, 모든 한계를 이 페이지에 공개합니다.

핵심 결과

템플릿 도입부는 0-30점 만점에서 +0.04점과 연관됩니다. 95% 신뢰구간은 -0.12에서 +0.20입니다.

이것은 귀무 결과이며, 검정력이 뒷받침된 귀무 결과입니다. 이 연구는 0.23점 차이를 탐지할 검정력 80%를 갖췄고, 신뢰구간은 0.12점보다 큰 감점을 배제합니다. 템플릿이 도움이 된다는 뜻은 아닙니다. 여기 나온 양의 수치는 모두 채점기의 분해능보다 작습니다. 모두가 주장하는 감점이 나타나지 않았다는 뜻입니다.

인용하기 전에 반드시 읽어주세요

이 점수는 저희 AI 채점기의 결과이며, ETS의 e-rater가 아닙니다.

이 연구의 점수는 LingoLeap이 자체적으로 루브릭 학습시킨 AI 채점기가 산출한 것입니다. 아카데믹 디스커션 루브릭으로 학습된 AI 채점 시스템이 답안 3,692개를 채점하면 어떤 결과가 나오는지 보여준 것입니다. ETS가 사용하는 엔진은 검증하지 않았고, ETS 외부의 누구도 검증할 수 없습니다. e-rater가 템플릿을 감지한다고 주장하는 사이트들 역시 근거 데이터가 없습니다. 차이가 있다면 저희는 그 사실을 밝힌다는 점입니다.

템플릿 도입부는 얼마나 흔한가

답안의 36.2%(3,692개 중 1,337개)가 정형화된 표현으로 시작하며, 55.8%(3,692개 중 2,060개)는 본문 어딘가에 정형 표현을 최소 한 개 포함합니다. 템플릿 사용은 일부의 편법이 아니라 일반적인 행동입니다. 템플릿이 위험 신호라고 말하는 페이지는 응시자 세 명 중 한 명 이상에게 당신의 평범한 글쓰기가 위험 신호라고 말하는 셈입니다.

이 표에서 두 번째로 드러난 사실은, 대비 사이트들이 경고하는 바로 그 표현들을 실제 학습자는 쓰지 않는다는 점입니다. There are several reasons는 3,692개 답안 중 도입부로 두 번 등장합니다. It is widely acknowledged도 두 번입니다. I could not agree more는 0회이며, 이는 사전에 양성 사례로 검증한 탐지기가 내놓은 진짜 0입니다. 실제 템플릿 어휘는 의견 표명 표현이며, 상위 두 표현만으로 전체 도입부의 24%를 차지합니다.

표현도입부%본문 전체%
In my opinion48513.1%66217.9%
From / In my perspective38810.5%55315.0%
I firmly / strongly believe1413.8%44812.1%
When it comes to752.0%1123.0%
From my point of view611.7%792.1%
Personally speaking / Personally, I541.5%671.8%
As far as I am concerned / know521.4%912.5%
I wholeheartedly concur / agree511.4%722.0%
I strongly agree511.4%812.2%
In my view270.7%1153.1%
With the development / advent of100.3%1082.9%
In today's society / world50.1%340.9%
There are several / many reasons20.1%130.4%
It is widely acknowledged / believed20.1%310.8%
I could not agree more00.0%00.0%
정형 표현 전체1,33736.2%2,06055.8%

표 1. 정형 표현 15종의 사용 빈도, n = 3,692. 도입부는 답안의 첫 90자 안에서 해당 표현이 일치한 경우입니다.

점수 차이는 +0.04점

템플릿으로 시작하는 답안의 평균은 0-30점 만점에 25.198점, 그렇지 않은 답안은 25.158점입니다. 차이는 +0.040점이며 95% 신뢰구간은 -0.119에서 +0.199, t = +0.49입니다. 어느 방향으로도 탐지 가능한 효과가 없습니다.

이 표본 크기에서 검정력 80%, 양측 유의수준 0.05 기준 최소 탐지 가능 효과는 0.232점입니다. 큰 효과를 놓친 검정력 부족한 귀무 결과가 아닙니다. 0.25점 이상의 감점이 있었다면 드러났을 것이고, 드러나지 않았습니다.

집단n평균 점수 (0-30)
템플릿 도입부 있음1,33725.198
템플릿 도입부 없음2,35525.158

반대 방향에서 본 같은 결과

채점기가 템플릿에 불이익을 준다면 고득점 구간에서 템플릿 사용 비율이 낮아야 합니다. 그렇지 않습니다. 고득점자도 전체 코퍼스와 사실상 같은 비율로 템플릿 도입부를 사용합니다.

구간n템플릿 도입부 사용 비율
28점 이상44735.8%
27점 이상1,29035.6%
전체 코퍼스3,69236.2%
22점 이하75334.8%

사용량에 따른 반응

답안에 포함된 서로 다른 정형 표현 개수별 평균은 0개 25.18점(n = 1,632), 1개 25.19점(n = 1,705), 2개 25.20점(n = 306), 3개 이상 24.45점(n = 49)입니다. 2개까지는 평평하며, 3개 이상 구간은 답안 49개뿐이어서 결론을 내릴 수 없습니다.

세부 점수는 통념과 반대 방향을 가리킨다

각 답안에는 0-5점짜리 세부 점수가 세 개 있습니다. 이는 검색 결과들이 주장하는 구체적 기제, 즉 정형화된 표현에 대한 언어 항목 감점을 직접 검증합니다. 템플릿 언어가 정형적이라는 이유로 감지된다면, 관련성은 그대로인 채 언어 사용 점수만 떨어져야 합니다.

항목템플릿비템플릿차이95% 신뢰구간t
관련성 및 논의 기여4.3984.372+0.025±0.027+1.81
명료성 및 논지 전개3.9003.874+0.026±0.027+1.84
언어 사용 및 문법3.7753.759+0.016±0.030+1.03

표 2. 세부 점수 평균. 각 항목별 템플릿 1,335개, 비템플릿 2,348개입니다.

실제로 관측된 패턴은 그 반대 순서입니다. 언어 사용이 셋 중 가장 변화가 없고, 어느 항목도 음수가 아닙니다. 과대 해석하기 쉬우니 주의해서 읽어야 합니다. 세 차이 모두 양수이지만 세 값 모두 사실상 0입니다. 0.5점 단위로 부여되는 5점 척도에서 0.025점 차이는 채점기가 줄 수 있는 최소 단위의 20분의 1입니다. 템플릿이 도움이 된다는 뜻은 전혀 아닙니다. 주장된 기제가 나타나지 않는다는 뜻입니다.

길이를 통제한 뒤에도 그림은 같습니다. 관련성 beta = +0.029(t = 2.09), 명료성 beta = +0.030(t = 2.17), 언어 사용 beta = +0.018(t = 1.16)입니다. 세 항목을 동시에 검정했으므로 t 값이 2 부근인 것은 한계적 수준으로 읽어야 하며, 효과 크기 자체가 작아 논쟁의 실익이 없습니다.

교란 변수와 견고성

명백한 대안 설명을 배제해야만 수치가 방어 가능합니다. 다섯 가지를 배제했습니다.

길이

길이는 실제로 점수를 예측합니다. n = 3,692에서 r(길이, 점수) = +0.134이고, OLS에서 길이의 로그 1포인트는 +1.99점의 가치가 있습니다(t = +12.8). 템플릿 사용자는 오히려 약간 더 짧게 씁니다. 158.2단어 대 161.2단어로 차이는 -3.0 ± 2.7이므로, 교란이 있다면 템플릿에 불리한 방향입니다. 통제해도 결과는 바뀌지 않습니다. 길이 5분위 내 통합 차이는 +0.024, 95% 신뢰구간 ±0.154이며 분위별 부호는 +0.25, +0.22, -0.14, +0.13, -0.24로 번갈아 나타납니다. 이는 0 주변의 잡음이 보이는 전형적인 모습입니다. 점수를 템플릿과 로그 단어 수에 회귀시키면 템플릿 beta = +0.059, SE = 0.081, t = +0.73입니다.

문제 난이도

점수는 문제에 따라 달라질 수 있습니다. 템플릿 답안과 비템플릿 답안을 모두 가진 260개 문제(답안 2,165개)로 한정해 문제 내 차이를 통합하면 +0.235, 95% 신뢰구간 +0.004에서 +0.468이 나옵니다(문제 단위 부트스트랩 4,000회). 이 연구에서 0과 한계적으로 구별되는 유일한 추정치이며, 부호는 양수로 감점과는 반대 방향입니다. 코퍼스의 59%와 문제의 6분의 1만 사용하므로 세 추정치 중 가장 약합니다. 빼면 선택적 보고가 되므로 그대로 보고합니다.

처리 정의

처리를 도입부가 아니라 답안 어디에든 정형 표현이 있는 경우로 정의하면(2,060개 대 1,632개) 전체 차이는 -0.005 ± 0.159이며, 관련성 +0.006, 명료성 +0.007, 언어 사용 -0.012입니다. 모든 항목에서 여전히 귀무입니다.

인터페이스 언어

레코드의 88%는 인터페이스 언어가 cn입니다. 이는 UI 언어이지 답안 언어가 아닙니다. cn 레코드 3,247개 중 답안 본문에 CJK 문자가 5%를 넘는 것은 0개로, 두 집단 모두 답안이 영어임이 확인됩니다. 그럼에도 나누어 보면 cn 차이는 -0.012 ± 0.168(n = 1,183 / 2,057), en 차이는 +0.428 ± 0.495(n = 151 / 293)입니다. 둘 다 귀무이며 en 셀은 표본이 작습니다.

중복 답안

답안 3,692개 중 3,629개는 서로 다른 텍스트이며, 63개(1.7%)가 다른 답안과 완전히 동일합니다. 중복을 제거해도 결과는 바뀌지 않습니다. 사용 빈도 36.4%, 차이 +0.037, 95% 신뢰구간 -0.123에서 +0.197(n = 1,320 / 2,309)입니다.

유일한 예외: When it comes to

15개 표현 중 9개는 도입부로 30회 이상 등장해 개별 검정이 가능했습니다. 그중 8개는 기준선과 구별되지 않으며, 차이는 -0.08에서 +0.57 사이이고 신뢰구간이 0을 포함하거나 거의 포함합니다. 하나만 다릅니다.

When it comes to로 시작하는 답안(n = 75)의 평균은 23.573점으로, 비템플릿 기준선 25.158점보다 1.585 ± 0.512점 낮습니다. 이 효과는 모든 통제를 견딥니다. 해당 답안들은 기준선보다 길지만(209.8단어 대 161.2단어) 점수는 더 낮아, 길이를 보정하면 격차가 -2.20으로 벌어집니다(SE 0.286, t = -7.7). 56개 서로 다른 문제에 퍼져 있고 한 문제가 기여한 답안은 최대 7개이므로 특정 문제의 문제가 아닙니다. 9개 표현을 검정했지만 본페로니 기준으로도 여유 있게 유의합니다. 이 표현을 처리 집단에서 빼면 주요 대비는 +0.136 ± 0.160이 되며, 여전히 귀무입니다.

도입 표현n평균기준선 25.158 대비
When it comes to…7523.573-1.585 ± 0.512
In my opinion48525.388+0.229 ± 0.222
From / In my perspective38825.134-0.024 ± 0.254
I firmly / strongly believe14125.248+0.090 ± 0.378
From my point of view6125.557+0.399 ± 0.470
I wholeheartedly concur / agree5125.725+0.567 ± 0.574
I strongly agree5125.686+0.528 ± 0.514
Personally speaking / Personally, I5425.352+0.193 ± 0.611
As far as I am concerned / know5225.077-0.081 ± 0.686

표 3. n >= 30인 도입 표현 9종의 표현별 평균. 비템플릿 기준선 25.158점과 비교했습니다.

말할 수 있는 것과 없는 것

말할 수 있는 것은 이 도입 표현이 낮은 점수 답안의 표지라는 사실입니다. 말할 수 없는 것은 그 표현이 낮은 점수를 유발한다는 인과입니다. 하락 폭은 세 항목에 고르게 나타나며(관련성 -0.246, 명료성 -0.234, 언어 사용 -0.246), 이는 표현 단위의 언어 감점이 아니라 전반적으로 약한 글쓰기의 특징입니다. 근거는 상관관계이고 n = 75입니다. 규칙이 아니라 참고 신호로 다루십시오.

방법론

모집단
LingoLeap 문제 레지스트리에 있는 비레거시 아카데믹 디스커션 문제 전체(1,480개)와 그 대표 샘플 슬러그 전부, 총 3,729개의 서로 다른 슬러그입니다. 아카데믹 디스커션은 2026 포맷 중 실제 코퍼스가 존재하는 유일한 과제라서 모집단으로 삼았습니다.
수집
각 샘플은 평가 샘플 엔드포인트에서 동시 작업자 8개와 HTTP 503에 대한 지수 백오프 재시도로 수집했습니다. 백엔드는 대략 동시 읽기 8개를 넘으면 속도를 제한합니다. 제한 없이 작업자 16개로 돌린 첫 시도에서는 503으로 슬러그 784개를 놓쳤지만, 재시도에서 전부 회수되었으므로 이는 데이터 누락이 아니라 수집 과정의 산물입니다. 최종적으로 레코드 3,723개를 수집했고, 하드 404는 6개, 미회수는 0개입니다.
두 개의 필드, 그리고 그 차이
레코드에는 content 필드와 markdown 필드가 들어 있으며 둘은 서로 다른 것입니다. content 필드는 학습자의 답안이고, 템플릿 언어 측정은 전부 이 필드에서만 이루어집니다. markdown 필드는 채점자의 코멘트로, cn 로케일 레코드(코퍼스의 88%)에서는 대부분 중국어로 작성되고 모범 답안 재작성본을 포함합니다. markdown 필드에 정규식을 돌리면 학습자가 아니라 채점자의 문장을 측정하게 됩니다. 이 필드는 점수를 읽는 데에만 사용했습니다.
점수 필드
숫자 점수 필드는 3,258개 레코드에 존재합니다. 나머지 465개는 markdown에서 점수를 파싱했습니다. 두 값이 모두 있는 2,459개 레코드에서 2,459개 전부(100%)가 일치하며, 이것이 파싱 값을 대체값으로 쓰는 근거입니다. 항목별 세부 점수는 3,723개 중 3,703개(99.5%)에서 markdown으로부터 파싱됩니다.
제외 기준과 분석 대상
답안 본문이 없는 레코드 13개와, 총점 0점에 세 세부 항목이 모두 0.0인 레코드 8개(답안이 아니라 채점 실패)를 제외했습니다. 분석 대상은 1,467개 서로 다른 문제에 걸친 답안 3,692개입니다. 평균 점수 25.17점(SD 2.42), 중앙값 26점, 사분위 범위 24-27점입니다. 평균 길이는 160단어, 중앙값은 154단어입니다.
처리 정의
정형 표현 15종은 가정한 것이 아니라 데이터에서 도출했습니다. 모든 답안의 첫 120자를 토큰화해 앞쪽 3·4·5단어 연쇄를 코퍼스 전체에서 집계한 뒤, 반복되는 정형 표현을 대소문자 무시 정규식으로 작성했습니다. 첫 90자 안에서 정형 표현이 하나라도 일치하면 템플릿 도입부로 분류합니다.
양성 사례 사전 검증
집계에 앞서 As far as I am concerned, I firmly believe that으로 시작하는 답안에 탐지기를 돌려 일치를 확인했고, 정형적이지 않은 도입부에는 일치하지 않음을 확인했습니다. 둘 다 예상대로 작동했으므로, 표 1의 모든 0은 양성 사례에서 작동이 입증된 탐지기가 내놓은 0입니다.
표본 추출
이 표본은 문제 레지스트리의 대표 샘플 슬러그로 문제당 최대 약 3개이며, 전체 아카데믹 디스커션 답안 16,479개에서 무작위 추출한 것이 아닙니다. 공개된 샘플 페이지라는 기준으로 선정되었으므로 잘 작성된 답안이 과대표집되었을 수 있습니다. 선정 기준 자체는 템플릿 사용과 상관이 없지만, 모집단은 전체 제출물이 아니라 공개 샘플입니다.

재현 방법

이 페이지의 모든 수치는 코퍼스를 다시 수집해 각 값을 재출력하는 단일 분석 스크립트에서 나옵니다. 모집단, 수집 방법, 필드 구분, 제외 기준, 처리 정의를 기자나 경쟁사가 검증할 수 있을 만큼 위에 상세히 밝혀 두었습니다.

이 데이터가 말하지 않는 것

주장을 가장 강하게 표현하는 순간 틀리기 시작합니다. 이 연구가 입증하지 않는 여섯 가지입니다.

  1. 1

    ETS의 e-rater나 SpeechRater에 대한 근거가 아닙니다

    여기의 점수는 LingoLeap이 자체적으로 루브릭 학습시킨 AI 채점기가 산출했습니다. 아카데믹 디스커션 루브릭으로 학습된 AI 채점 시스템이 템플릿을 어떻게 다루는지를 측정한 것입니다. ETS가 사용하는 엔진은 검증하지 않았고, ETS 외부의 누구도 검증할 수 없습니다.

  2. 2

    템플릿이 도움이 된다는 근거가 아닙니다

    이 연구의 양수 값은 모두 채점기의 분해능보다 작습니다. 올바른 결론은 탐지 가능한 효과가 없다는 것이며, 템플릿이 안전하다거나 효과가 있다는 결론이 아닙니다.

  3. 3

    스피킹은 다루지 않습니다

    아카데믹 디스커션은 라이팅입니다. 스피킹 템플릿에 대한 주장은 여기서 검증되지 않았습니다.

  4. 4

    모든 토플 답안으로 일반화되지 않습니다

    모집단은 비레거시 아카데믹 디스커션 문제에 대한 LingoLeap의 공개 샘플 답안이며, 문제당 최대 약 3개입니다.

  5. 5

    내용 템플릿에 대해서는 아무 말도 하지 않습니다

    저희가 측정한 것은 도입부 정형 표현입니다. 암기한 예시 문단, 지어낸 통계, 미리 써 둔 본론 논거는 이 연구가 살펴보지 않았습니다. 에세이 전체를 암기하는 것은 전혀 다른 행위입니다.

  6. 6

    템플릿과 템플릿 사용자를 분리하지 못합니다

    이 연구는 관찰 연구입니다. 누구에게도 템플릿을 무작위 배정하지 않았습니다. 문제 내 추정치와 길이 5분위 내 추정치는 교란을 줄이지만 제거하지는 못합니다.

자주 묻는 질문

토플 템플릿을 쓰면 점수가 깎이나요?
AI 채점된 아카데믹 디스커션 답안 3,692개를 측정한 결과, 템플릿 도입부는 0-30점 만점에서 +0.04점과 연관되며 95% 신뢰구간은 -0.12에서 +0.20입니다. 어느 방향으로도 탐지 가능한 효과가 없으며, 이 연구는 0.23점 차이를 탐지할 검정력 80%를 갖췄습니다. 이 점수는 LingoLeap의 루브릭 학습 AI 채점기의 결과이며, ETS 외부의 누구도 검증할 수 없는 e-rater의 결과가 아닙니다.
AI 채점은 템플릿 표현에 감점을 주나요?
저희 데이터에서는 그렇지 않으며, 세부 점수는 오히려 통념과 반대 방향을 가리킵니다. 템플릿 언어가 정형적이라는 이유로 감지된다면 언어 사용 및 문법 세부 점수가 떨어져야 합니다. 그러나 이 항목은 5점 만점에서 +0.016(t = 1.03)으로 세 항목 중 가장 변화가 없고, 관련성은 +0.025, 명료성은 +0.026입니다. 감점되는 항목은 없으며, 세 차이 모두 사실상 0입니다.
실제로 얼마나 많은 응시자가 템플릿을 쓰나요?
답안 3,692개 중 36.2%가 정형 표현으로 시작하고, 55.8%는 본문 어딘가에 최소 한 개를 포함합니다. 가장 흔한 도입 표현은 의견 표명형으로, In my opinion(도입부 기준 13.1%)과 From 또는 In my perspective(10.5%)입니다. 대비 사이트들이 흔히 경고하는 표현은 오히려 드뭅니다. There are several reasons는 3,692개 중 도입부로 두 번 나옵니다.
점수가 낮은 것과 상관관계가 있는 도입 표현이 있나요?
하나 있습니다. When it comes to로 시작하는 답안(n = 75)의 평균은 23.573점으로, 비템플릿 기준선 25.158점보다 1.585 ± 0.512점 낮으며 길이를 보정하면 -2.20까지 벌어집니다. 하락은 세 세부 항목에 고르게 나타나는데, 이는 표현에 대한 감점이 아니라 전반적으로 약한 글쓰기의 특징입니다. 근거는 상관관계이므로 규칙이 아니라 참고 신호로 다루십시오.
답안이 길수록 점수가 높나요? 그것이 결과를 설명하나요?
길이는 실제로 점수를 예측하며 r = +0.134이고, OLS에서 길이의 로그 1포인트는 +1.99점의 가치가 있습니다. 하지만 이것이 결과를 설명하지는 않습니다. 템플릿 사용자는 오히려 약간 더 짧게 쓰므로(158.2단어 대 161.2단어) 교란은 템플릿에 불리한 방향입니다. 길이 5분위 내 통합 차이는 +0.024 ± 0.154이고, 로그 단어 수를 통제한 OLS의 템플릿 계수는 +0.059(SE 0.081, t = +0.73)입니다.
그럼 템플릿을 써도 되나요?
모두가 주장하는 감점이 채점된 답안 3,692개에서 나타나지 않았다는 뜻입니다. 템플릿이 도움이 된다는 뜻은 아닙니다. 여기의 양수 값은 모두 채점기의 분해능보다 작습니다. 또한 암기한 본론 문단, 지어낸 통계, 미리 써 둔 논거에 대해서는 아무것도 말하지 않습니다. 저희가 측정한 것은 도입부 정형 표현뿐이기 때문입니다. 자신의 논리를 담는 틀로서의 템플릿과 통째로 암기한 에세이는 같지 않습니다.

내 답안을 직접 채점받아 보세요

이 연구에 쓰인 채점기가 바로 여러분의 연습 답안을 채점하는 그 채점기입니다. 아카데믹 디스커션 답안을 작성하고 세 가지 세부 점수를 직접 확인해 보세요.

무료로 연습 시작하기