Haeminway haemin/way
English
7 분 분량

3원짜리 해설서와 290원짜리 해설서: 같은 영어 지문을 AI 7개에게 맡겨 봤습니다

직접 쓴 영어 지문 하나를 AI 7개에게 주고 같은 틀의 3쪽 해설서를 받았습니다. 가장 싼 Luna는 한 부 약 3원에 2.92점, Claude Opus는 약 290원에 4.83점이었습니다. 같은 문장을 어떻게 다르게 옮겼는지, 선생님 상황별로 어떤 AI가 맞는지 정리합니다.

한 부에 3원 드는 해설서와 290원 드는 해설서. 값은 100배 가까이 차이 났고, 점수는 5점 만점에 2.92점과 4.83점이었습니다.

같은 영어 지문 하나를 AI 7개에게 주고 3쪽짜리 해설서를 한 부씩 받았습니다. 결론부터 말씀드리면 고칠 곳이 가장 적었던 건 ClaudeClaude 클로드 Anthropic이 만든 AI 모델 이름. 크기에 따라 Opus·Sonnet·Haiku로 나뉩니다. OpusOpus 오퍼스 Claude 중 가장 크고 똑똑한 모델. 가장 꼼꼼하지만 비싸고 느린 편입니다.였고, 값까지 따지면 한 부 약 17원에 4.00점을 받은 Claude HaikuHaiku 하이쿠 Claude 중 가장 작고 저렴한 모델. 빠르고 값이 쌉니다.가 가장 실속 있었습니다. 가장 싼 GPTGPT 지피티 OpenAI가 만든 AI 모델 이름. ChatGPT 안에서 돌아가는 모델입니다. LunaLuna 루나 OpenAI GPT 계열의 가볍고 저렴한 모델. 이 블로그의 해설서 도구가 쓰는 모델입니다.는 22초 만에 해설서를 내놨지만, 한 문장의 뜻을 어긋나게 옮겼습니다.

지문은 기출도 교과서도 아닌, 제가 직접 쓴 세 단락짜리 이야기 글입니다. 할머니가 손님마다 좋아하는 음식과 못 먹는 것을 적어 둔 공책 이야기입니다. 일곱 AI 모두 공개 해설서 도구와 똑같은 지시문으로 만들었고, 같은 검사를 적용해 같은 판형으로 찍었습니다.

Claude Opus가 만든 해설서 1쪽. 지문을 다섯 구간으로 나누고 구간마다 제목과 요약을 세로 노선도처럼 이어 놓았다

1쪽은 글의 흐름을 지하철 노선도처럼 이은 개요, 2쪽은 구간별 정리, 3쪽은 본문 해설과 참/거짓 문제입니다.

3원과 290원 사이

채점은 Claude Opus와 GPT SolSol 솔 OpenAI GPT 계열의 상위 모델 중 하나. 깊게 생각하는 작업에 강합니다. 두 AI가 했습니다. 누가 만든 해설서인지 이름을 가린 채 해석 정확도, 구간 나누기, 구문 설명, 어휘, 참/거짓, 바로 나눠 줄 수 있는지 여섯 항목을 5점 만점으로 매겼습니다. 점수는 두 채점자의 평균입니다.

AI점수(5점)한 부 추정 비용AI 응답 시간
Claude Opus 5.54.83약 290원79초
GPT AstraAstra 아스트라 OpenAI GPT 계열 모델 중 하나. 이 블로그 비교에서는 점수 2위였습니다.4.42약 365원86초
GPT Sol 6.14.33약 75원107초
Claude Haiku 5.54.00약 17원90초
GeminiGemini 제미나이 Google이 만든 AI 모델 이름. Flash는 그중 빠르고 저렴한 쪽입니다. 3.8 Flash3.50약 55원69초
Claude SonnetSonnet 소넷 Claude의 중간 크기 모델. 성능과 속도·가격의 균형형입니다. 5.53.33약 80원29초
GPT Luna2.92약 3원22초

GPT는 ChatGPT를 만드는 OpenAI 쪽 모델모델 model AI의 '두뇌' 하나하나를 부르는 말. 같은 회사도 크기·성능별로 여러 모델을 냅니다.입니다. 비용은 각 AI가 쓴 분량(토큰토큰 token AI가 글을 세는 단위. 대략 영어 단어 하나가 1~2토큰이고, 요금은 토큰 수로 매겨집니다.)에 회사가 공개한 사용 단가를 곱한 추정치입니다. 넣는 지시문 분량은 모두 같게 잡았고, 1달러는 1,450원으로 계산했습니다. 응답 시간은 AI가 답을 내기까지의 시간이고, 검사·판형 작업 시간은 뺐습니다.

가장 비싼 Astra(약 365원)는 1등이 아니었고, Haiku는 Sonnet보다 싸면서 점수가 더 높았습니다. 비싸다고 늘 이기지는 않았습니다.

같은 문장, 다르게 옮긴 두 AI

점수 차이는 문장 하나를 나란히 놓으면 바로 보입니다.

원문잘 옮긴 쪽어긋난 쪽
Over five decades, the notebook had grown into a quiet record of almost everyone who had ever sat at her table.Opus: “50년에 걸쳐 그 공책은 할머니의 식탁에 한 번이라도 앉았던 거의 모든 사람에 대한 조용한 기록으로 자라났다.”Luna: “오십 년이 넘는 세월 동안 그 공책은…”
After she passed away, the family gathered at her house, and no one quite knew what to cook.Opus: “무엇을 요리해야 할지 제대로 아는 사람이 아무도 없었다.”Sonnet: “무엇을 요리해야 할지 아는 사람은 거의 없었다.”

Over five decades는 문맥상 “50년에 걸쳐”가 자연스럽습니다. Luna는 over를 “~이 넘는”으로 읽어 “오십 년이 넘는”으로 옮겼습니다. 문법적으로 아예 안 되는 해석은 아니지만, 두 채점자 모두 원문 뜻에서 벗어났다고 봤습니다. 더 분명한 실수는 다음 문장입니다. no one quite knew는 “제대로 아는 사람이 아무도 없었다”인데, Sonnet은 “거의 없었다”로 읽었습니다. 채점자는 Sonnet이 “이 오류를 구문 노트와 참거짓 해설에까지 반복했다”고 적었습니다. 이번에는 해석의 오류가 구문 노트와 참/거짓 해설에도 반복됐습니다. 참/거짓 정답 자체는 맞았습니다.

같은 지문의 3쪽 비교. 왼쪽 Claude Opus는 출제 포인트에 지문 속 구조를 적었고, 오른쪽 GPT Luna는 지문에 없는 whose+명사를 출제 포인트로 넣었다

3쪽 맨 위의 출제 포인트도 비교해 보세요. 왼쪽 Opus는 what to cook(의문사+to부정사), 명사 뒤에서 꾸미는 chopping 같은 지문 속 구조를 꼽았습니다. 오른쪽 Luna는 지문에 한 번도 나오지 않는 whose를 시험 포인트로 넣었고, 구문 설명에서는 what you served them의 주어를 “사람들”로 잘못 풀었습니다.

일곱 AI, 한 줄씩

Claude Opus — 구문까지 짚는 꼼꼼한 선생. 두 채점자 모두 4.83점을 줬습니다. 의문사+to부정사, 명사 뒤에서 꾸미는 분사까지 짚었고, 할머니의 말을 거꾸로 뒤집은 참/거짓 문제도 좋은 평을 받았습니다.

GPT Astra — 흐름을 잘 잡는 모범생. 해석과 구간 흐름, 참/거짓이 탄탄했고 어순 설명이 유용하다는 평을 받았습니다. 다만 what이 이끄는 절의 역할은 설명하지 않았습니다.

GPT Sol — 숙어 정리가 먼저인 선생. 흐름과 어휘, 참/거짓은 좋았지만 구문 설명이 pass away, be full of 같은 숙어 위주였습니다.

Claude Haiku — 값싸고 성실한 조교. 해석과 구문 설명이 대체로 정확했고 almost 같은 작은 말까지 짚었습니다. 마지막 문장 해석은 손볼 곳이 있었습니다.

Gemini Flash — 문장이 매끄러운 번역가. 해석은 자연스러웠지만 구간 요약에서 almost(거의)의 뜻을 빠뜨렸고, 구간을 넷으로 크게 묶었습니다.

Claude Sonnet — 빠르지만 한 번 잘못 읽으면 끝까지 가는 쪽. 29초로 Claude 중 가장 빨랐고 구간별 흐름 설명은 좋았습니다. no one quite knew를 잘못 읽은 것이 해설 여러 곳으로 번졌습니다.

GPT Luna — 22초 만에 초안을 내미는 속기사. 큰 흐름과 참/거짓은 두 채점자 모두 안정적이라고 봤습니다. 해석 한 곳과 출제 포인트, 너무 쉬운 어휘(grandmother, sink)에서 점수를 잃었습니다.

선생님 상황별로 고르면

  • 내일 수업 자료가 급할 때: Claude Opus. 이번 지문에서 응답에 약 79초가 걸렸고, 일곱 중 고칠 곳이 가장 적었습니다.
  • 한 학기 교재를 만들 때: 학생 손에 오래 남을 자료라면 역시 Opus 쪽입니다. 이번과 같은 분량이라면 지문 40개에 추정 비용 약 1만 1,600원입니다.
  • 매일 지문 여러 개를 돌릴 때: Claude Haiku. 한 부 약 17원이라 하루 10개를 돌려도 약 170원입니다.
  • 흐름과 참/거짓 틀만 빨리 보고 싶을 때: GPT Luna. 22초, 약 3원입니다.

그래도 저는 Luna에 걸어 봅니다

여기까지가 잰 결과이고, 지금부터는 제 생각입니다.

Luna가 놓친 곳을 다시 보면, 머리가 모자라서라기보다 지시가 덜 촘촘해서 생긴 실수로 보입니다. “지문에 없는 문법은 출제 포인트로 꼽지 말 것”, “기간을 나타내는 말은 원문 뜻 그대로 옮길 것” 같은 규칙은 지시문에 얼마든지 더 적어 넣을 수 있습니다. 그래서 저는 이번 점수가 Luna의 한계보다 프롬프트프롬프트 prompt AI에게 주는 작업 지시문. 무엇을 어떤 형식으로 만들지 적은 글입니다.를 다듬는 깊이가 아직 부족해서 생긴 문제라고 봅니다. 프롬프트는 AI에게 주는 작업 지시문입니다.

한 부 약 3원, 가격 경쟁력은 Luna가 단연 최고입니다. Luna 정도의 지능이면 지시만 잘 다듬어 주면 충분히 해낼 수 있다는 게 제 개인적인 생각입니다.

그래서 도구를 이렇게 열었습니다

해설서 만들기에서 이제 이렇게 쓰실 수 있어요.

  • 해설서를 만드는 프롬프트를 그대로 공개했습니다. 왼쪽 「프롬프트」 탭을 열면 Luna에게 들어가는 지시를 직접 읽고, 고쳐서 뽑아 볼 수 있어요. 해설서 모양을 맞추는 출력 형식 규칙은 서버가 항상 뒤에 붙이니, 내용에 관한 지시는 마음껏 바꾸셔도 됩니다.
  • 모두 함께 쓰는 하루 200회 안에서 프롬프트를 고쳐 가며 여러 번 뽑아 볼 수 있어요. 한 번 만들 때마다 1회씩 줄고, 남은 횟수는 화면 위쪽에 보입니다.
  • 나온 해설서는 「수정하기」를 누른 뒤 화면의 글자를 고치고 「확정」하면 되고, PDF·HTML·JSONJSON 제이슨 프로그램끼리 데이터를 주고받는 글 형식. 항목 이름과 값을 짝지어 적습니다.으로 내려받을 수 있어요.
  • 이렇게 뽑은 모든 회차(지문, 고친 프롬프트, 결과)는 모아서 기본 프롬프트를 고치는 데 씁니다. 6개월 보관하고 공개하지 않습니다. 자세한 내용은 개인정보 안내에 적었습니다. 선생님은 원하는 해설서를 얻고, 저는 더 나은 기본 프롬프트를 얻으니 누이 좋고 매부 좋은 일입니다.

한 번 뽑고 끝나는 도구가 아닙니다. 고쳐 보고, 다시 뽑고, 또 다듬어 가며 쓰는 도구입니다.

같이 해 보고, Luna로 이게 되는지 같이 확인해 보시죠.

새 글 소식

새 글이 나오면 메일로 알려 드립니다.

새 글 주소와 한 줄 요약만 보냅니다. 광고는 보내지 않습니다.