2026-09-27 16:09(업데이트: 2026-09-27 16:16)
새 AI 모델이 나오면 가장 먼저 눈길을 끄는 것은 점수표입니다. 하지만 개발팀에서 정말 궁금한 질문은 따로 있죠. ‘기존 모델보다 버그를 덜 내는가?’, ‘여러 도구를 오가는 작업을 끝까지 처리하는가?’, ‘비용이 낮아졌는데 실제 완료율은 유지되는가?’입니다. GPT-6 Sol은 최고 점수 하나보다 성능과 작업당 비용의 균형으로 읽어야 하는 모델입니다.
이번 글은 오픈AI의 GPT-6 Sol·Luna 발표, 공식 API 모델 문서, Artificial Analysis의 독립 평가를 구분해 읽습니다. 벤치마크는 제공사가 제시한 조건과 타사 독립 측정의 조건이 다릅니다. 특히 오픈AI 발표에서 비교 대상으로 쓰인 ‘클로드 오퍼스 5’와 현재의 ‘클로드 오퍼스 5.5’를 혼동하지 않도록 주의하겠습니다.
GPT-6 Sol은 오픈AI의 GPT-6 계열에서 최고 성능을 목표로 하는 Astra와 경량·저비용의 Luna 사이에 놓인 모델입니다. 공식 설명은 복잡한 코딩과 에이전트 업무를 주요 용도로 제시합니다. API 모델 이름은 gpt-6-sol이며, 입력은 텍스트·이미지, 출력은 텍스트를 지원합니다. 공식 모델 사양의 컨텍스트 창은 105만 토큰, 최대 출력은 12만 8천 토큰입니다. 다만 큰 창을 지원한다는 사실이 모든 길이에서 동일한 정확도나 요금을 보장하지는 않습니다.
추론 노력은 none, low, 기본값 medium, high, xhigh, max를 지원합니다. 따라서 ‘Sol 점수’라고 한 숫자로 설명하면 실행 조건을 놓치기 쉽습니다. 공식 발표의 최고 성적은 흔히 xhigh나 max 단계에서 나온 반면, 현업 API가 설정을 생략하면 중간 단계로 작동합니다. 어떤 노력 수준의 점수인지가 성능표를 읽는 첫 번째 열쇠입니다.
| 항목 | GPT-6 Sol 공식 사양 | 실무 해석 |
|---|---|---|
| 위치 | Astra 아래, Luna 위 | 최고 점수보다 처리량·비용 균형에 초점 |
| API 모델 | gpt-6-sol |
테스트와 운영에 동일 모델 ID 고정 |
| 입력·출력 | 텍스트·이미지 입력, 텍스트 출력 | 음성·영상 직접 처리 여부 별도 확인 |
| 문맥·출력 한도 | 105만 / 12만 8천 토큰 | 대량 입력은 품질뿐 아니라 요금 확인 |
| 기본 추론 노력 | medium |
max 벤치마크와 기본 설정을 구분 |
특히 가격표에서 말하는 ‘절반 인하’는 이전 세대 Sol의 API 입력·출력 단가와의 비교입니다. 실제 업무 예산은 사고 토큰, 도구 호출, 캐시 적중률, 재시도를 합쳐야 판단할 수 있습니다.
오픈AI의 발표 자료는 서로 다른 평가 세트를 사용합니다. 업무 자동화, 전문 업무, 코드 병합 가능성, 복잡한 소프트웨어 엔지니어링, 컴퓨터 사용은 측정하는 능력이 다릅니다. 아래 수치는 오픈AI가 밝힌 특정 노력 수준·평가 환경의 결과이며, 모든 업무에서의 평균 성공 확률이 아닙니다.
| 평가 | GPT-6 Sol 결과 | 읽어야 할 의미 |
|---|---|---|
| AutomationBench 1.0.6 | xhigh 33.2%, 작업당 0.27달러 |
여러 앱·도구를 거치는 업무 흐름 |
| Agents’ Last Exam V1 | max 56.4% |
장시간 전문 업무 과제 |
| DeepSWE v1.1 | max 68.8% |
실제 코드베이스의 장기 과제 |
| OSWorld 2.0 offline | xhigh 60.5% |
화면과 앱을 다루는 컴퓨터 작업 |
AutomationBench 1.0.6은 영업·마케팅·운영·고객지원·재무·인사 영역의 47개 도구를 쓰는 완결형 작업입니다. Sol xhigh는 33.2%와 작업당 0.27달러를 기록했고, 비교된 클로드 오퍼스 5 max는 26.9%였습니다. 오픈AI가 주장하는 가격 대비 강점이 잘 드러나지만, 비교 대상은 오퍼스 5이지 오퍼스 5.5가 아닙니다. 또 한 번에 성공한 비율이 여전히 높다고 할 수 없으므로, 대외 발송·결재·자금 이동을 에이전트에 자동 위임하는 근거로 써서는 안 됩니다.
FrontierCode는 코드의 정답뿐 아니라 테스트 품질, 수정 범위의 절제, 스타일, 저장소 규칙에 맞는지까지 평가합니다. 오픈AI는 Sol이 GPT-5.6 Sol보다 크게 개선되고 클로드 Fable 5.1 xhigh와 견줄 만하다고 설명합니다. 반면 DeepSWE v1.1에서는 Sol max가 68.8%를 기록해 Fable 5 xhigh의 69.9%에 근접했다고 발표했습니다. 두 시험은 이름이 달라 결과를 교차해서 ‘코딩 점수 1위’로 합칠 수 없습니다. 우리 팀에서는 변경된 파일 목록, 누락된 호출부, 실패한 회귀 테스트, 리뷰 수정 시간을 함께 측정해야 합니다.
오픈AI는 내부 사실성 평가에서 Sol의 오류가 전작의 약 절반이라고 설명합니다. 이 평가에는 기존 모델의 사실 오류를 사용자가 표시한 비식별 대화가 포함돼 있어 일반적인 대화의 오류율을 뜻하지 않습니다. 따라서 ‘환각이 절반으로 줄었다’는 문구를 모든 질문에 적용하면 과장입니다. 금융 규정 해석이나 보안 통제 문서에서는 원문 조항·시행일·예외를 따로 대조해야 합니다.
OSWorld 2.0의 오프라인 세트에서는 Sol xhigh 60.5%, 오퍼스 5 medium 60.3%로 오픈AI가 소개합니다. 각 모델의 노력 수준이 다르고 오프라인 세트의 부분 보상 기준이라는 조건이 붙습니다. 화면 조작이 필요한 업무라면 로그인·권한·중간 승인·오류 복구까지 우리 환경에서 재현해야 합니다. 벤치마크 그래프의 위치가 실서비스의 자동화 안전성까지 인증하지는 않습니다.
같은 계열의 전작과 비교할 때 눈에 띄는 변화는 비용입니다. 오픈AI 발표 기준 GPT-5.6 Sol의 입력·출력 100만 토큰당 4달러·20달러에서 GPT-6 Sol은 2달러·10달러로 내려갑니다. 같은 토큰 수라는 가정에서는 요금이 절반이지만, 실제 호출에서 추론량이 늘거나 도구 사용이 길어지면 완료된 과제당 비용은 다를 수 있습니다.
독립 평가 기관 Artificial Analysis의 GPT-6 Sol과 GPT-5.6 Sol 페이지는 최고 노력 조건의 종합 지수를 각각 48과 47로 표시합니다. 즉 이 측정만으로 ‘지능이 대폭 상승했다’고 말하기 어렵습니다. 오픈AI는 FrontierCode의 개선을 내세우지만, DeepSWE의 최고 성적 비교에서는 전작 72.7%, 신작 68.8%라는 수치가 보고됩니다. 이 차이는 평가의 단계·구성·버전이 동일한지까지 확인하고 해석해야 하며, 전 영역에서 전작을 무조건 앞선다는 주장은 피해야 합니다.
오픈AI가 자사 발표에서 직접 비교한 모델은 오퍼스 5입니다. 오퍼스 5.5의 우열은 같은 평가를 돌린 독립 자료로 따로 봐야 합니다. Artificial Analysis의 오퍼스 5.5 페이지는 적응형 추론·최대 노력·기본 폴백 조건에서 종합 지수 58을 표시하고, Sol max는 48입니다. 측정된 해당 조건에서는 오퍼스 5.5가 높지만 이 지수 하나로 모든 코딩·자동화 업무의 우열을 단정할 수는 없습니다.
| 비교 항목 | GPT-6 Sol | 클로드 오퍼스 5.5 | 판단 포인트 |
|---|---|---|---|
| API 입력·출력 단가 | 100만 토큰당 2·10달러 | 100만 토큰당 4·20달러 | 토큰 단가는 Sol이 낮음 |
| 독립 종합 지수 | 48, max |
58, 적응형 max·폴백 |
설정·폴백 비용까지 포함해 비교 |
| 지수 과제당 비용 | 1.06달러 | 5.98달러 | 해당 평가 과제의 측정값, 모든 업무에 일반화 금지 |
| API 문맥 한도 | 105만 토큰 | 100만 토큰 | 실제 입력 길이의 비용·정확도 확인 |
표의 핵심은 ‘점수가 높으니 언제나 더 비싼 모델을 쓰자’도, ‘토큰 단가가 낮으니 무조건 Sol을 쓰자’도 아닙니다. 오퍼스 5.5의 지수는 기본 폴백 조건을 포함하므로 단순한 순수 모델 1회 호출 비교가 아닙니다. 필요한 품질을 Sol이 충족하면 단가 이점이 크고, 난해한 판단 과제에서 누락·재작업이 잦다면 오퍼스 5.5의 높은 성능이 값을 할 수 있습니다. 같은 저장소와 같은 완료 기준으로 재시험하는 것이 공정합니다.
오퍼스 5.5는 최고 성능을 위해 비용을 더 낼 수 있는 선택지지만, 클로드 소넷 5는 GPT-6 Sol과 공개 기본 토큰 단가가 같은 직접 경쟁 모델입니다. 앤트로픽 공식 모델 사양과 오픈AI Sol 사양은 모두 입력 100만 토큰당 2달러·출력 100만 토큰당 10달러, 캐시 읽기 0.20달러를 제시합니다. ‘소넷 5는 출시 특가이므로 곧 3달러·15달러로 오른다’는 설명은 현재 기준으로 틀립니다. 앤트로픽 발표문 변경 이력에 따르면 8월 10일 2달러·10달러를 상시 가격으로 확정했습니다.
| 비교 항목 | GPT-6 Sol | 클로드 소넷 5 | 읽는 방법 |
|---|---|---|---|
| 표준 입력·출력 / 100만 토큰 | 2달러·10달러 | 2달러·10달러 | 단가만 보고 승자 결정 불가 |
| 캐시 읽기·기본 쓰기 / 100만 토큰 | 0.20달러·2.50달러 | 0.20달러·5분 2.50달러 | 소넷 1시간 쓰기는 4달러 |
| 문맥 창·최대 출력 | 105만·12만 8천 토큰 | 100만·12만 8천 토큰 | 긴 프롬프트 요금 조건은 별도 |
| 기본 추론 노력 | medium |
high |
기본값끼리도 추론량 조건이 다름 |
| 독립 종합 지수, 최고 노력 | 48, max |
38, 적응형 max |
해당 평가 묶음에 한정 |
| 독립 평가 과제당 평균 비용 | 1.06달러, max |
5.09달러, max |
작업 종류·출력량·재시도에 종속 |
Artificial Analysis의 동일 지수 비교는 여러 영역의 평가를 묶은 v4.3.2 기준 최고 노력에서 Sol 48, 소넷 5 38로 표시합니다. 이 값은 오픈AI의 AutomationBench 1.0.6이나 앤트로픽의 OSWorld-Verified와 시험 문제·채점 방식이 다른 종합 지수입니다. 한 회사가 발표한 서로 다른 시험의 숫자를 붙여 ‘코딩 승률 차이’로 표현하면 안 됩니다. 해당 비교 페이지의 엔지니어링 지수는 Sol 49·소넷 5 40, 재무·회계 지수는 48·40으로 표시하지만, 이것 역시 각 직무의 실제 성공 확률을 뜻하지는 않습니다.
비용 차이는 같은 단가인데도 생깁니다. 독립 평가의 max에서 소넷 5는 평균 과제당 출력 약 11만 8천 토큰, 그중 사고 토큰 약 8만 8천 토큰을 쓰고 Sol은 출력 약 3만 1천 토큰, 사고 토큰 약 2만 1천 토큰을 썼습니다. 평가 환경에서는 이 차이가 과제당 5.09달러와 1.06달러로 나타납니다. 과제당 비용 차이를 ‘소넷 5 API 단가가 비싸서’라고 설명하면 잘못입니다. 노력 수준이 높을수록 길게 생각하거나 더 많은 단계를 거칠 수 있고, 두 회사의 토크나이저가 달라 동일한 자료가 같은 토큰 수가 되지도 않습니다. 실제로 앤트로픽은 소넷 5의 새 토크나이저에서 동일 입력도 콘텐츠에 따라 이전 소넷보다 약 1.0~1.35배 토큰이 될 수 있다고 밝힙니다.
그렇다면 소넷 5를 쓸 이유는 없을까요? 그렇지 않습니다. 앤트로픽의 소넷 5 소개는 코딩·도구 사용·전문 업무의 에이전트 기능을 강조하고, Claude Code나 Claude API를 이미 운영한다면 기존 승인·도구 흐름과의 적합성이 중요합니다. 다만 회사가 공개한 소넷 5 성적은 주로 소넷 4.6·오퍼스 4.8과의 비교입니다. GPT-6 Sol을 직접 이겼다는 동일 벤치마크 수치로 읽어서는 안 됩니다. 소넷 5의 100만 토큰 문맥도 요청을 통째로 넣어도 정확도가 유지된다는 보증은 아닙니다.
실전 테스트는 두 모델의 ‘기본값끼리’와 ‘같은 업무 품질을 충족하도록 조절한 조건’을 따로 돌려 보세요. Sol의 medium과 소넷 5의 high는 각각 기본값이지만 동일한 추론 예산은 아닙니다. 예컨대 동일한 화면→API→배치 변경 이슈를 맡기고 호출부 누락, 회귀 테스트 통과, 리뷰어가 추가로 고친 줄 수, 최종 완료 시간, 캐시·재시도를 포함한 총비용을 기록합니다. 금융 IT 문서라면 규정 원문 인용의 정확성과 미확인 항목의 표시까지 확인하세요. 독립 지수의 우위는 출발점일 뿐, 우리 조직의 변경관리 적합성을 대신하지 못합니다.
공식 API 사양상 표준 가격은 입력 100만 토큰당 2달러, 캐시된 입력 0.20달러, 캐시 쓰기 2.50달러, 출력 10달러입니다. 입력 프롬프트가 27만 2천 토큰을 초과하면 초과분에만 붙는 게 아니라 요청 전체에 입력·캐시 요율 2배, 출력 요율 1.5배가 적용됩니다. 긴 코드 저장소나 방대한 문서 묶음을 그대로 붙이기 전에 필요한 부분만 검색·분할할 이유입니다. 추가로 배치·Flex, 빠른 처리, 지역 처리, 도구 호출은 각각 별도 요금 조건을 확인해야 합니다.
캐시 읽기 할인은 같은 문맥을 반복 사용하는 에이전트에 중요합니다. 하지만 ‘캐시 읽기 90% 할인’이 전체 청구액 90% 할인을 뜻하지는 않습니다. 처음 쓰는 프롬프트와 캐시 쓰기, 추론에 사용한 출력 토큰, 도구 호출은 별도로 계산됩니다. 오픈AI는 GPT-6에서 추론 노력과 사용 도구를 바꿔도 앞선 문맥의 캐시 재사용이 유지된다고 설명합니다. 실서비스에서라면 요청별 캐시 적중률을 직접 확인해야 합니다.
속도도 ‘초당 출력 토큰’ 하나로 판단하면 안 됩니다. Artificial Analysis의 Sol 측정은 max 조건에서 출력 속도 약 86.2토큰/초와 첫 답변 토큰까지 약 138초를 표시합니다. 전자는 출력이 시작된 뒤의 속도, 후자는 추론 시간까지 포함한 대기 지표입니다. 복잡한 과제의 최고 노력 설정을 평상시 응답 속도로 소개하면 사용자 경험을 오해하기 쉽습니다. 자신의 업무에서는 기본 medium으로 첫 응답 시간과 과제 완료 시간을 각각 기록해 보세요.
금융 IT의 화면·API·배치 변경처럼 한 파일만 고쳐서는 끝나지 않는 과제라면, 먼저 변경 파일과 호출 경로, 회귀 테스트, 사람 승인 지점을 명시하세요. 모델에게는 ‘샘플 데이터만으로 오류를 재현하고, 영향 파일 목록과 테스트 결과를 제출하되 운영 배포·실거래 실행은 하지 말 것’처럼 범위를 줍니다. 에이전트의 성능 점수는 변경관리 승인이나 개인정보 처리 근거를 대신하지 못합니다.
medium부터 측정합니다.high, 장시간 복합 과제에서 필요할 때 xhigh·max를 시험합니다.API를 붙이는 팀이라면 공식 모델 문서의 주의사항도 확인해야 합니다. 기본 제공 도구와 함수 호출은 Responses API를 권장하며, Chat Completions의 함수 호출은 reasoning_effort를 none으로 설정했을 때만 지원된다고 명시합니다. 오래된 통합에서 모델 이름만 바꾸면 기능이 그대로 작동한다고 가정하지 말고, 호출 방식과 오류 처리부터 검증하세요.
결국 GPT-6 Sol 성능의 강점은 일부 최고 점수보다 어느 수준의 일을 어느 비용으로 끝내는가에 있습니다. 오픈AI 자체 벤치마크와 독립 종합 평가는 질문이 다릅니다. 우리 업무에서 처음부터 끝까지 완성한 결과물의 품질과 비용을 함께 확인할 때, Sol을 일상 작업의 기본 모델로 둘지 더 강한 모델로 일부 업무를 넘길지 결정할 수 있습니다.