9월 22일 하루에 새 모델 소식이 연달아 나왔습니다. Anthropic은 Claude Opus 5.5를, OpenAI는 GPT-6 Sol과 Luna를 발표했습니다. GPT-6 Astra까지 합치면 이제 선택지가 꽤 많아졌죠. 그런데 GPT-5.6 때 Sol과 Luna 사이에 있던 Terra는 왜 GPT-6 목록에 없을까요?

발표 직후에는 벤치마크 순위부터 보게 됩니다. Codex나 Claude Code에서 오래 남는 건 결국 이 질문이죠. 내 작업을 몇 번의 수정 끝에, 얼마를 들여 끝내느냐. 이번 발표도 그 기준으로 읽어봤습니다.

순순이 새 모델 선택 카드를 보고 놀라고, 흑심이가 Terra의 행방을 묻는 모습
그림 1. 새 모델 발표에서 먼저 확인할 것은 이름보다 내 작업에 맞는 선택지입니다.

새로 나온 세 모델

Claude Opus 5.5는 9월 22일 출시됐습니다. Anthropic은 긴 코딩 작업과 지식 업무, 소통 방식이 개선됐다고 설명합니다. Opus 5보다 출력 속도가 30% 이상 빠르고, 일반적인 작업의 총비용이 약 40% 낮아졌다는 수치도 제시했습니다. 모두 Anthropic이 측정·발표한 결과입니다.

같은 날 나온 GPT-6 Sol과 Luna는 이달 초 나온 Astra보다 낮은 가격대입니다. OpenAI는 사실성, 코딩, 컴퓨터 사용과 대화 방식이 개선됐다고 설명합니다. 모델 목록에서는 Sol을 복잡한 코딩·에이전트 작업에, Luna를 비용에 민감한 대량 작업에 권합니다. 발표 당시 두 모델은 Codex와 ChatGPT Work의 유료 사용자에게 제공됐고, Luna는 Free·Go 사용자의 데스크톱 앱에도 열렸습니다. 일반 Chat에는 아직 제공되지 않았습니다.

전 세대와 붙여보면

비교할 것은 비싼 Astra보다 싸다는 사실이 아니라 같은 계열의 전작에서 얼마나 내려왔는가입니다. 아래는 9월 23일 확인한 표준 API의 텍스트 100만 토큰당 미국 달러 가격입니다. 화살표 왼쪽이 전작, 오른쪽이 신작이고 괄호는 인하율입니다. 구독 요금이나 실제 작업 한 건의 청구액과는 다릅니다.

같은 계열의 전작 → 신작입력: 전 → 후출력: 전 → 후캐시 읽기: 전 → 후
Opus 5Opus 5.5$5 → $4 20%↓$25 → $20 20%↓$0.50 → $0.20 60%↓
GPT-5.6 SolGPT-6 Sol$4 → $2 50%↓$20 → $10 50%↓$0.40 → $0.20 50%↓
GPT-5.6 LunaGPT-6 Luna$0.20 → $0.10 50%↓$1.20 → $0.50 약 58%↓$0.02 → $0.01 50%↓

Sol은 세 단가 모두 절반, Luna는 출력 단가가 절반 이상 내려갔습니다. Opus 5.5의 캐시 읽기도 60% 내려갔고요. 다만 GPT-5.6 Sol의 $4·$20은 OpenAI가 프로모션 가격이라고 명시합니다. 이후 가격이 바뀌면 이 비교도 다시 계산해야 합니다.

청구액으로 바꾸면 더 선명합니다. 한 번의 요청에 새 입력 10만 토큰과 출력 2만 토큰을 썼다고 가정하고 캐시·도구·추가 요금을 빼면, Opus는 $1→$0.80, Sol은 $0.80→$0.40, Luna는 $0.044→$0.020입니다. 같은 양의 토큰을 썼을 때의 예시일 뿐, 실제로는 답을 고치느라 몇 번 더 부르는지가 비용을 바꿉니다.

가격만 바뀐 것은 아닙니다. Opus 55.5의 입력창은 모두 100만 토큰이고, GPT-5.6 Sol·Luna와 GPT-6 Sol·Luna도 각각 105만 토큰입니다. OpenAI 발표는 자사 사실성 평가에서 GPT-6 Sol의 오류가 전작의 약 절반, high 추론 수준의 업무 자동화 평가에서 GPT-6 Luna의 점수가 전작보다 5.4%포인트 높다고 제시합니다. 평가 과제와 설정이 제한된 제조사 수치이므로 실제 작업에서 확인할 차이로 읽는 편이 맞겠습니다. GPT-6 Astra는 GPT-5.6 제품군에 같은 이름의 전작이 없고, Terra의 직접 후속 모델도 발표되지 않았습니다.

Opus 5.5는 Sol보다 일반 입력·출력 단가가 두 배지만 캐시 읽기 가격은 같습니다. 파일을 계속 다시 읽는 코딩 작업에서는 처음 보는 입력, 캐시에서 다시 읽는 입력, 모델이 생각하고 쓰는 출력의 비중이 달라집니다. 그래서 단가가 두 배라고 작업 총비용도 두 배가 되지는 않습니다. Anthropic의 Claude Code 비용 설명도 반복 횟수와 캐시·출력 토큰을 함께 보라고 권합니다.

긴 입력에는 가격표에 없는 조건도 있습니다. GPT-6 Sol과 Luna는 입력이 27만 2천 토큰을 넘으면 그 요청 전체에 입력·캐시 2배, 출력 1.5배 요금이 적용됩니다. 큰 코드베이스나 자료 묶음을 한 번에 넣는다면 Sol 모델 페이지의 가격 조건까지 함께 봐야 합니다.

두 발표는 서로 다른 상대와 비교했습니다

Anthropic 발표의 비교표에는 주로 GPT-6 Astra가, OpenAI의 새 발표에는 주로 Claude Opus 5가 등장합니다. 각각 Opus 5.5의 높은 코딩·지식 업무 성적과 Sol·Luna의 낮은 작업 비용을 내세우지만, 이 숫자를 이어 붙여 ‘Opus 5.5 대 GPT-6 Sol’의 승패로 바꾸기는 어렵습니다. 추론 수준(reasoning effort), 도구와 작업 환경에 따라서도 결과가 달라집니다.

커뮤니티의 눈도 성능표보다 사용감과 비용에 먼저 가 있습니다. Opus 5.5 첫인상 글에는 응답이 빨라지고 사용 한도를 덜 먹는다는 반응, 캐시 가격 인하가 반복 작업에서 크겠다는 계산이 나옵니다. 동시에 작은 버그는 여전하고 출시 몇 시간의 열광만으로 판단하기 이르다는 댓글도 붙었습니다.

GPT-6 발표 토론에서는 Sol의 절반 가격과 더 여유로운 사용량을 반기는 목소리가 보입니다. 반면 Luna의 체감 개선은 작다는 의견, 일반 Chat에서 바로 쓸 수 없다는 아쉬움도 있습니다. ‘Terra는 끝났다’는 농담도 있었지만, 아래에서 보듯 기존 Terra의 종료 공지는 확인되지 않았습니다. 두 게시물의 댓글은 출시 직후 몇몇 사용자의 경험과 예상이지, 성능 검증이나 전체 이용자 여론조사는 아닙니다.

특히 ‘사용 한도가 덜 닳는다’는 말은 구독 서비스에서 느낀 반응이고, 앞의 표는 API 토큰 단가입니다. 둘을 같은 절감률로 읽으면 안 됩니다. 관심사는 비슷합니다. 모델이 빨라졌는가보다, 한도를 아껴서 또는 적은 재시도로 같은 일을 끝낼 수 있는가에 반응이 모였죠.

Terra는 정말 사라졌을까요?

현재 공개된 GPT-6 제품군은 Astra, Sol, Luna입니다. GPT-6 Terra는 발표되지 않았습니다. 그렇다고 GPT-5.6 Terra가 종료됐다는 뜻은 아닙니다. OpenAI Docs에는 gpt-5.6-terra의 모델 페이지와 API 가격이 여전히 있습니다. OpenAI는 새 제품군에서 Terra를 제외한 이유나 기존 Terra의 종료 일정을 이번 발표에서 밝히지 않았습니다.

GPT-6 새 제품군에는 Astra·Sol·Luna만 있고 Terra는 명단에 없으며, 별도로 GPT-5.6 Terra API 모델 페이지가 유지됨을 구분한 상태 표
그림 2. 원래 상태 표를 유지했습니다. GPT-6 명단에 Terra가 없는 것과 기존 GPT-5.6 Terra가 종료됐다는 것은 다른 이야기입니다. 작은 화면에서는 그림을 눌러 확대할 수 있습니다. 원문: OpenAI 모델 목록.

가격표에서는 새 Sol의 입력 단가가 기존 Terra와 같은 $2이고 출력은 $10으로 더 낮습니다. 가격 구간이 겹치니 중간 등급을 별도로 내놓을 필요가 줄었을 수는 있습니다. 어디까지나 가격표를 보고 한 해석입니다. 이미 Terra를 쓰는 서비스라면 ‘곧 중단된다’고 가정해 급히 바꾸기보다, 공식 공지를 확인하면서 같은 작업을 Sol에도 돌려보는 편이 낫겠습니다.

순순이 GPT-6 발표 목록의 Astra·Sol·Luna를 확인하고, 작은 흑심이가 별도의 GPT-5.6 Terra 모델 페이지를 보여주는 그림
그림 3. 순순은 새 목록에서 Terra를 찾고, 흑심이는 기존 Terra의 모델 페이지가 남아 있음을 짚습니다. 두 문서는 서로 다른 세대의 상태를 보여줍니다.

두 진영에서 지금 고른다면

그림 한 장에 일곱 이름을 넣으니 ‘무슨 작업에 먼저 써야 하지?’가 여전히 남았습니다. 이번에는 회사별로 나눠보겠습니다. 아래 사용처는 Anthropic의 선택 가이드OpenAI의 GPT-6 가이드를 바탕으로 고른 첫 시험 대상입니다. 이번 출시 모델들을 같은 조건에서 직접 돌려 얻은 순위는 아닙니다.

먼저 Claude입니다. Anthropic은 대부분의 작업을 Opus 5.5에서 시작하라고 안내합니다. Opus로 품질 기준을 맞춘 뒤 더 빠르고 저렴한 모델로 내려가거나, 아주 어려운 작업에서 Opus의 높은 추론 설정도 부족할 때 Fable을 시험하는 흐름이죠.

순순이 Opus 5.5로 코드와 문서를 살펴보고, 작은 흑심이가 완료 기준을 확인하며 Sonnet 5·Haiku 4.5·Fable 5.1을 시험할 작업물을 가리키는 그림
그림 4. 순순이 “오퍼스부터?”라고 묻자 흑심이가 “쉬우면 낮춰. 막히면 올려.”라고 답합니다. 화살표는 자동 전환이나 성능 순위가 아니라 같은 작업으로 시험해볼 방향입니다. 작은 화면에서는 눌러 확대할 수 있습니다.
  • Opus 5.5는 여러 파일을 고치고 테스트를 돌리는 긴 코딩 작업, 자료를 읽어 결과 문서까지 만드는 지식 작업의 출발점입니다. 입력·출력 100만 토큰당 $4·$20이며 기본 추론 수준은 medium입니다. 결과가 모자라면 먼저 추론 수준과 작업 지시를 조정해볼 수 있습니다.
  • Sonnet 5는 코드 생성·자료 분석·문서 작성처럼 왕복 속도도 중요한 작업의 비교 대상입니다. $2·$10으로 Opus보다 단가가 낮지만, 같은 완료 기준을 통과하는지 확인한 뒤 옮겨야 합니다.
  • Haiku 4.5는 분류, 정해진 형식의 초안, 짧은 응답을 많이 처리할 때 시험할 모델입니다. $1·$5로 저렴하고 빠르지만 컨텍스트는 20만 토큰으로, 다른 세 Claude 모델의 100만 토큰보다 작습니다. 긴 자료 묶음을 그대로 넣는 작업이라면 이 차이를 먼저 봐야 합니다.
  • Fable 5.1은 여러 단계를 오래 이어가는 연구·에이전트 작업에서 Opus를 높은 추론 수준으로 돌려도 평가 기준에 미달할 때 비교합니다. $10·$50이고 상대적으로 느립니다. 그래서 단순히 ‘제일 비싸니 기본’으로 고를 모델은 아니죠.

Fable 이름은 한 번 확인하고 넘어가야 합니다. 9월 23일 Anthropic의 공식 모델 목록에 Fable 5.2는 없고, 공개된 최신은 Fable 5.1입니다. 그림과 가이드도 확인된 5.1을 기준으로 했습니다.

GPT는 공식 모델 설명에서 Luna를 비용에 민감한 대량 작업, Sol을 지능과 비용의 균형, Astra를 가장 어려운 작업에 둡니다. 개발 작업을 여러 번 반복한다면 Sol을 기준으로 두고, 일의 성격에 따라 양쪽으로 옮겨 시험할 수 있습니다.

순순이 Luna에 일을 모두 맡길지 묻고, 작은 흑심이가 완료율 확인을 권하는 가운데 Luna의 분류 문서·Sol의 코드 테스트·Astra의 다단계 자료와 브라우저 작업을 보여주는 그림
그림 5. “루나가 싸면 다 맡길까?”라는 순순에게 흑심이는 “완료율부터 봐!”라고 말합니다. 반복 작업은 Luna, 개발의 균형점은 Sol, 더 어려운 다단계 작업은 Astra를 같은 완료 조건으로 비교합니다.
  • Luna는 고객 문장을 정해진 항목으로 분류하거나 짧은 형식으로 바꾸는 일을 많이 처리할 때 첫 후보입니다. $0.10·$0.50입니다. 몇 건만 맞는지 보지 말고 틀리기 쉬운 사례까지 모아 정확도를 확인해야 합니다.
  • Sol은 기능 구현, 여러 도구를 쓰는 개발 작업, 반복되는 문서 작업에서 품질과 비용을 함께 볼 기준점입니다. $2·$10입니다. Luna가 자주 틀리는 작업을 Sol에 올리고, Sol의 첫 결과가 부족하다면 지시·추론 수준을 조정해봅니다.
  • Astra는 코드·브라우저·전문 소프트웨어를 오가는 긴 다단계 작업이나 Sol이 반복해서 실패하는 유형에 붙여볼 모델입니다. $10·$50으로 토큰 단가는 높습니다. 다만 한 번에 끝나는 비율이나 출력 길이가 달라지면 실제 완료 비용의 순서도 달라질 수 있습니다. 세 GPT-6 모델의 컨텍스트는 모두 105만 토큰이라, 입력창이 더 길어서 고르는 것은 아닙니다.

숫자는 모두 표준 API의 입력·출력 각 100만 토큰당 가격입니다. 구독 서비스의 사용 한도와는 별도로 봐야 하고, 앞서 적은 Sol·Luna의 27만 2천 토큰 초과 요금 조건도 큰 자료를 넣을 때 다시 확인해야 합니다.

마지막은 같은 과제로 검증하는 일입니다. 작은 코드 수정에는 테스트 통과와 수정 파일 수를, 여러 파일에 걸친 기능에는 전체 테스트와 재수정 횟수를, 자료 요약에는 빠진 사실과 출처 오류를 완료 조건으로 적어둡니다. 같은 입력·도구로 전작과 새 모델, 그리고 두 회사의 후보를 돌리되 각 모델의 추론 설정도 기록하고 통과한 결과 한 건에 든 비용과 시간을 비교합니다. 반복 개발·문서 작업이라면 Sol과 Opus 5.5를 이렇게 비교해보겠습니다. 두 모델의 캐시 읽기 단가는 $0.20으로 같지만 왕복 횟수와 출력량이 달라질 수 있거든요.

기존 Opus 5나 GPT-5.6 모델로 이미 돌아가는 작업이 있다면 그 결과도 비교표의 기준선으로 남겨두는 편이 좋습니다. 새 모델의 토큰 단가가 낮아도 수정이 늘거나 기존에 통과하던 검사가 깨지면 작업당 비용은 달라지니까요. 특히 실패가 잦았던 작업을 포함해 같은 완료 조건으로 돌려봐야 차이가 보입니다.

Opus 5에서 5.5로 API 모델명만 바꾸는 경우에는 설정도 확인해야 합니다. Anthropic 문서에 따르면 기본 추론 수준은 high에서 medium으로 바뀌었고, 5.5에서는 사고 과정을 끄거나 특정 도구 사용을 강제하는 설정이 허용되지 않습니다. 두 세대의 품질을 비교할 때 추론 수준을 명시하고, 기존 자동화가 이런 설정을 쓰는지도 살펴야 합니다.

추론 수준도 처음부터 최대로 올릴 필요는 없습니다. OpenAI Docs는 작업의 품질·지연·비용을 함께 보도록 안내하고, Anthropic의 사용 가이드는 Opus 5.5의 일상 작업을 medium에서 시작해 막히는 경우 high로 올리는 방식을 제안합니다. 작업을 확인할 테스트나 검토 기준을 함께 주는 것도 중요합니다. 생각을 오래 하는 것과 결과가 맞는 것은 같은 일이 아니니까요.

이번에 확실히 내려간 것은 몇몇 모델의 토큰 가격입니다. 내 작업의 비용까지 내려갔는지는 아직 별개의 이야기입니다. Terra의 다음 행보도 공식 설명을 기다려야 하겠네요.