Codex SOL TERRA LUNA 모델 차이점과 상황별 최적 선택 가이드
AI 코딩 도구를 개발 현장에 적용할 때 가장 어려운 판단 중 하나는 작업마다 어떤 모델을 선택할지 정하는 일입니다. 최고 성능 모델만 계속 사용하면 품질은 안정적일 수 있지만 단순 반복 업무까지 높은 비용과 대기 시간을 부담하게 됩니다. 반대로 가장 저렴한 모델만 고집하면 복잡한 버그나 설계 작업에서 재시도가 늘어나 전체 비용이 오히려 커질 수 있습니다.
GPT‑5.6 기반 Codex에는 Sol, Terra, Luna 세 모델이 있습니다. 공식 안내는 Sol을 복잡하고 열린 문제를 위한 모델, Terra를 일상 업무용 균형형 모델, Luna를 명확하고 반복 가능한 대량 작업용 모델로 구분합니다. 이 글에서는 Codex SOL TERRA LUNA 차이와 API 가격, 추론 강도 설정, 실제 프로젝트에서 세 모델을 조합하는 방법을 정리합니다.
- Sol: 정답 경로가 불명확하고 높은 판단력과 완성도가 필요한 작업
- Terra: 기능 구현, 리팩터링, 테스트와 리뷰 같은 일상 개발 업무
- Luna: 기준이 명확한 추출, 분류, 변환과 구조화 요약 업무
- 비용 최적화: 낮은 비용 모델로 시작하되 품질 기준 미달 시 상위 모델이나 높은 추론 단계로 승격
1. GPT‑5.6 Sol·Terra·Luna 모델 체계
OpenAI의 최신 모델 안내에 따르면 일반적인 gpt-5.6 별칭은 플래그십 모델인 gpt-5.6-sol로 연결됩니다. gpt-5.6-terra는 더 낮은 가격에서 강한 성능을 제공하는 균형형 모델이고, gpt-5.6-luna는 효율적인 대량 작업을 위한 모델입니다.
이 세 모델은 단순히 좋음, 보통, 나쁨으로 나누는 등급표가 아닙니다. 작업의 모호성, 실패했을 때의 비용, 필요한 판단 깊이와 처리량에 맞춰 선택하는 용도별 라인업입니다. 공식 Codex 모델 선택 안내는 확신이 없을 때 Sol에서 시작하라고 설명합니다. 다만 비용을 세밀하게 관리하는 자동화 시스템에서는 명확한 저위험 작업을 Terra나 Luna에 먼저 배치하고 검수 결과에 따라 Sol로 올리는 방식도 실용적입니다.
2. Sol 모델이 적합한 작업
Sol은 GPT‑5.6 제품군에서 가장 강한 역량을 제공하는 플래그십 모델입니다. 공식 문서에서는 복잡한 코딩, 컴퓨터 사용, 연구와 사이버보안 같은 영역을 대표 용도로 제시합니다. 정답을 만드는 경로가 처음부터 명확하지 않거나 여러 파일과 시스템의 관계를 동시에 이해해야 할 때 Sol의 장점이 커집니다.
복잡한 아키텍처 설계, 재현하기 어려운 장애 분석, 보안 검토, 대규모 코드베이스의 연쇄 변경, 중요한 배포 전 최종 리뷰가 대표적인 예입니다. 요구사항이 충돌하거나 여러 선택지의 장단점을 비교해야 하는 작업도 Sol에 적합합니다. 단순 코드 생성보다 분석, 판단, 검증과 완성도에 비용을 지불하는 모델이라고 이해하면 쉽습니다.
Sol 선택이 유리한 상황
- 문제 원인이 불분명하고 여러 가설을 비교해야 하는 디버깅
- 보안, 개인정보, 결제처럼 실패 비용이 큰 코드 검토
- 여러 서비스와 데이터 흐름을 포함한 시스템 설계
- 정확한 근거와 높은 수준의 문서 완성도가 필요한 작업
- 하위 모델 결과가 품질 검사에서 반복적으로 탈락한 작업
3. Terra 모델이 적합한 작업
Terra는 강한 추론과 도구 사용이 필요하지만 Sol의 최대 깊이까지는 필요하지 않은 일상 개발 작업용 모델입니다. 공식 Codex 안내는 Terra를 실용적인 범용 모델이자 일상 업무의 중심 모델로 설명합니다. 기존 기능에 조건을 추가하거나 코드를 정리하고 테스트를 보강하는 업무처럼 목표와 범위가 비교적 분명한 작업에 잘 맞습니다.
기능 구현, 코드 리팩터링, 코드 리뷰, 단위 테스트 작성, API 연결, 문서와 코드의 불일치 수정 등이 대표적입니다. 비용 중심의 팀이라면 Terra를 일상 업무의 출발점으로 사용하고, 설계가 모호하거나 검수에서 문제가 발견될 때 Sol로 승격하는 전략을 적용할 수 있습니다. 다만 공식 안내의 기본 추천은 ‘모르겠으면 Sol’이므로, 팀의 평가 데이터 없이 Terra가 모든 프로젝트의 절대 기본값이라고 단정해서는 안 됩니다.
4. Luna 모델이 적합한 작업
Luna는 제품군에서 가장 빠르고 저렴한 모델로 안내됩니다. 좋은 결과의 형식과 정답 조건을 미리 정의할 수 있는 명확하고 반복 가능한 작업에 적합합니다. 공식 문서가 제시하는 예시는 정보 추출, 분류, 데이터 변환과 구조화된 요약입니다.
예를 들어 로그에서 시간과 오류 코드만 뽑기, 파일 목록을 규칙에 따라 분류하기, 정해진 스키마로 데이터를 바꾸기, 동일한 형식의 주석이나 요약을 대량 생성하는 작업에 활용할 수 있습니다. 반면 대용량 로그의 근본 원인을 스스로 추론하거나 여러 시스템의 장애 원인을 종합하는 일은 단순 반복 작업이 아닙니다. 추출은 Luna에 맡기고 원인 분석은 Terra나 Sol에 맡기는 식으로 단계를 분리하는 편이 안전합니다.
5. API 가격으로 비교하는 모델별 비용

OpenAI 공식 API 가격표의 표준 처리 기준으로 현재 입력 100만 토큰과 출력 100만 토큰 가격은 다음과 같습니다. API 가격은 Codex 구독 상품의 크레딧 소비 방식과 다른 개념이므로 혼동하지 않아야 합니다.
| 모델 | 입력 100만 토큰 | 출력 100만 토큰 | 비용 관점 |
|---|---|---|---|
| GPT‑5.6 Sol | 5달러 | 30달러 | 품질 우선 |
| GPT‑5.6 Terra | 2.5달러 | 15달러 | Sol의 절반 수준 |
| GPT‑5.6 Luna | 1달러 | 6달러 | Sol의 5분의 1 수준 |
가격은 2026년 7월 확인한 표준 API 요금 기준이며 캐시 입력, 캐시 쓰기, Batch API와 데이터 지역 설정 등에 따라 달라질 수 있습니다. 실제 적용 전에는 OpenAI 공식 API 가격표를 다시 확인하세요.
6. 모델과 추론 강도는 별도로 선택해야 한다
모델을 선택한 뒤에는 추론 강도도 작업에 맞춰 조절할 수 있습니다. GPT‑5.6 API는 none, low, medium, high, xhigh, max 단계를 지원합니다. Codex 화면에서는 사용하는 제품 표면에 따라 Light, Medium, High, Extra High 같은 이름으로 보일 수 있습니다.
공식 권장 원칙은 필요한 결과를 만드는 가장 낮은 추론 수준을 사용하는 것입니다. 빠르고 범위가 명확한 작업은 낮은 단계, 계획이 필요한 작업은 중간 단계, 여러 단계와 근거 검증이 필요한 작업은 높은 단계를 선택합니다. Max는 속도와 사용량보다 깊이가 중요한 가장 어려운 문제에 제한적으로 사용합니다.
가장 비싼 모델에 가장 높은 추론 단계를 결합한다고 항상 경제적인 것은 아닙니다. 대표 업무로 평가 세트를 만들고 성공률, 재시도 횟수, 전체 토큰, 처리 시간과 사람이 수정한 시간을 함께 비교해야 실제 비용을 알 수 있습니다. 자세한 기본 원칙은 OpenAI 최신 모델 선택 가이드에서 확인할 수 있습니다.
7. 비용과 품질을 함께 잡는 단계별 파이프라인
세 모델을 효율적으로 사용하려면 한 작업을 처음부터 끝까지 같은 모델에 맡기기보다 단계별 역할을 나누는 방법이 좋습니다. 아래 구성은 공식 설명을 바탕으로 한 실무형 라우팅 예시입니다.
- Luna 전처리: 파일 분류, 필드 추출, 형식 통일과 구조화 요약을 처리합니다.
- Terra 구현: 정리된 요구사항을 바탕으로 기능 구현, 리팩터링과 테스트를 수행합니다.
- 자동 품질 검사: 테스트, 린터, 보안 규칙과 결과 형식 검사를 실행합니다.
- Sol 승격: 실패 원인이 모호하거나 품질 기준에 미달한 작업, 위험도가 높은 변경을 재분석합니다.
- 최종 검증: 상위 모델 결과도 같은 테스트와 검수 기준을 다시 통과해야 완료로 처리합니다.
이 구조의 핵심은 처음부터 고비용 모델을 전수 투입하지 않는 동시에 저비용 모델의 결과를 무조건 신뢰하지 않는 것입니다. 앞선 글인 AI 블로그 자동화 비용 절감과 작업별 모델 변경 사례에서도 같은 방식으로 단순 조사와 고위험 검수를 분리하는 방법을 확인할 수 있습니다.
8. 모델별 프롬프트 작성 방법
Sol에는 목표와 판단 기준을 제공하기
복잡한 작업이라고 해서 모든 단계를 세세하게 지시할 필요는 없습니다. 해결할 목표, 변경하면 안 되는 범위, 승인 없이 수행하면 안 되는 행동, 검증 기준을 명확히 전달하세요. 여러 선택지를 비교해야 한다면 평가 기준과 최종 산출물 형식을 함께 지정하는 것이 좋습니다.
Terra에는 범위와 완료 조건을 명확히 하기
수정할 파일과 기능 범위, 기존 동작 중 유지해야 할 조건, 실행할 테스트를 구체적으로 알려주세요. ‘리팩터링해 줘’보다 ‘외부 동작은 유지하고 중복 함수만 통합한 뒤 기존 테스트를 실행해 줘’처럼 완료 상태를 명시하면 결과가 안정적입니다.
Luna에는 입력과 출력 형식을 고정하기
분류 기준, 허용 값, 누락값 처리, 출력 스키마와 예시를 제공하세요. 판단이 필요한 예외가 나오면 임의로 추측하지 않고 별도 목록에 담도록 지시하면 상위 모델이 검토할 대상을 쉽게 분리할 수 있습니다.
9. 상황별 최적 모델 선택표
| 작업 상황 | 추천 출발점 | 승격 조건 |
|---|---|---|
| 신규 시스템 설계·보안 검토 | Sol | 추론 강도를 높여 재검증 |
| 일반 기능 구현·리팩터링·테스트 | Terra | 반복 실패·범위 확장 시 Sol |
| 정형 데이터 추출·분류·변환 | Luna | 예외 판단이 필요하면 Terra |
| 로그에서 필드 추출 | Luna | 근본 원인 분석은 Terra·Sol |
| 중요 배포 전 최종 리뷰 | Sol | 필요하면 High·Extra High |
10. 자주 묻는 질문
어떤 모델인지 모르겠으면 Terra를 선택하면 되나요?
비용 중심의 내부 라우팅에서는 Terra가 실용적인 출발점이 될 수 있습니다. 그러나 공식 Codex 안내는 확신이 없을 때 Sol에서 시작하라고 권장합니다. 팀의 대표 업무를 평가한 결과가 없다면 Sol로 기준 품질을 확인한 뒤 Terra와 Luna가 같은 기준을 만족하는지 비교하는 방법이 안전합니다.
Luna로 복잡한 버그를 분석해도 되나요?
오류 코드 추출과 로그 구조화처럼 기준이 명확한 전처리는 Luna에 적합합니다. 여러 원인을 비교하고 시스템 맥락을 해석해야 하는 근본 원인 분석은 Terra나 Sol이 더 적절합니다.
항상 높은 추론 단계를 사용하면 품질이 좋아지나요?
어려운 작업에서 도움이 될 수 있지만 지연 시간과 사용량이 늘어납니다. 공식 안내처럼 필요한 품질을 달성하는 가장 낮은 단계를 찾고, 높은 단계가 실제 성공률을 개선하는지 대표 작업으로 측정해야 합니다.
11. 마무리
Codex SOL TERRA LUNA 차이를 이해하는 핵심은 모델을 순위로만 보지 않는 것입니다. Sol은 복잡하고 열린 고가치 작업, Terra는 강한 추론과 도구 사용이 필요한 일상 개발, Luna는 결과 기준이 명확한 반복 업무에 맞춰져 있습니다.
비용을 줄이려면 Luna나 Terra를 무조건 선택하는 것이 아니라 작업을 작게 나누고 품질 검사를 자동화해야 합니다. 낮은 비용의 모델이 기준을 통과하면 그대로 사용하고, 결과가 부족하거나 위험도가 높으면 Sol 또는 높은 추론 단계로 승격하세요. 모델 선택, 추론 강도, 자동 검증을 함께 설계할 때 개발 속도와 결과 품질, 운영 비용을 동시에 관리할 수 있습니다.
모델 제공 범위와 가격은 변경될 수 있습니다. 이 글은 2026년 7월 확인한 OpenAI 공식 Codex 모델 안내, GPT‑5.6 가이드와 API 가격표를 기준으로 작성했습니다.