2026-09-29 08:56
클로드 모델을 고를 때 이름만 보면 오퍼스가 무조건 더 똑똑하고 소넷은 그저 저렴한 대안처럼 느껴집니다. 그런데 막상 코딩 에이전트를 돌려 보면 답변 품질만큼 중요한 것이 있습니다. 몇 번에 작업을 끝냈는지, 테스트는 통과했는지, 기다린 시간과 실제 청구액은 얼마인지입니다. 클로드 오퍼스 5.5 vs 소넷 5.5를 비교할 때도 이 네 가지를 함께 봐야 합니다.
두 모델은 모두 출시됐습니다. 앤트로픽의 오퍼스 5.5 발표는 2026년 9월 22일, 소넷 5.5 공식 발표는 9월 28일 공개됐습니다. 소넷 5.5를 아직 미출시로 소개한 정보는 최신 발표를 반영하지 않은 것입니다. 여기서는 두 공식 발표의 같은 평가 항목을 우선 비교하고, 숫자가 실제 업무 선택으로 이어지는 지점과 그렇지 않은 지점을 나눠 보겠습니다.
| 항목 | 오퍼스 5.5 | 소넷 5.5 |
|---|---|---|
| Claude API 모델 ID | claude-opus-5-5 |
claude-sonnet-5-5 |
| 기본 입력 요금 | $4 / 100만 토큰 | $2 / 100만 토큰 |
| 기본 출력 요금 | $20 / 100만 토큰 | $10 / 100만 토큰 |
| 캐시 읽기 요금 | $0.20 / 100만 토큰 | $0.20 / 100만 토큰 |
| 대표적인 강점 | 복잡하고 개방적인 장기 작업 | 범위가 분명한 일상 작업과 빠른 반복 |
두 모델의 요금과 성격은 각각 오퍼스 발표문과 소넷 발표문에 나온 기본 Claude API 기준입니다. 소넷 5.5는 이전 소넷 5와 입력·출력·캐시 읽기 단가가 같습니다. 오퍼스의 기본 입력·출력 단가는 각각 소넷의 두 배지만, 두 모델의 캐시 읽기 단가는 동일합니다. 처음 입력할 때와 새 답변을 만들 때는 차이가 크고, 같은 문맥을 반복해서 읽는 에이전트에서는 차이가 줄어들 수 있다는 뜻입니다.
단가를 곧바로 한 작업의 총비용으로 바꾸지는 마세요. 두 모델은 같은 일을 해도 사고 과정, 출력량, 도구 호출 횟수가 다를 수 있습니다. 앤트로픽은 소넷 5.5가 이전 소넷 5보다 대체로 적은 토큰을 써서 작업당 최대 30% 적은 비용이 들었다고 설명합니다. 이 수치는 오퍼스 5.5 대비 절감률이 아니라 소넷 5 대비 자사 시험 결과입니다. ‘최대’라는 표현을 모든 업무의 보장된 할인율로 읽어서도 안 됩니다.
캐시 없이 입력 100만 토큰과 출력 10만 토큰을 사용한다고 가정하면, 기본 요금만 적용한 금액은 오퍼스 5.5가 3입니다. 이것은 단가 구조를 이해하기 위한 예시일 뿐, 같은 과제에서 두 모델이 똑같은 토큰을 사용한다는 실측은 아닙니다. 긴 답변을 여러 번 재작성하거나 테스트를 재시도한다면 격차가 달라집니다.
소넷 5.5 공식 평가표를 보면 예상과 다른 결과가 보입니다. 명령줄에서 여러 단계의 과제를 푸는 Terminal-Bench 4.0은 소넷 5.5가 70.6%, 오퍼스 5.5가 66.4%입니다. 반면 실제 코딩 세션의 모호한 여러 파일 수정 과제를 다루는 CursorBench 4.0은 소넷 5.5가 55.5%, 오퍼스 5.5가 57.8%입니다. 한 줄로 ‘오퍼스 승’ 혹은 ‘소넷 승’이라고 쓰기 어려운 이유입니다.
| 평가 항목 | 오퍼스 5.5 | 소넷 5.5 | 읽는 법 |
|---|---|---|---|
| Terminal-Bench 4.0 | 66.4% | 70.6% | 터미널 기반 다단계 작업 |
| CursorBench 4.0 | 57.8% | 55.5% | 모호한 실전 코드 수정 |
| Humanity’s Last Exam, 도구 사용 | 67.7% | 64.5% | 여러 분야의 어려운 문제 |
| OSWorld 2.1, 부분 점수 | 81.8% | 80.1% | 컴퓨터 사용 과제 |
위 숫자는 소넷 발표문에 함께 실린 비교표를 옮긴 것입니다. 벤치마크는 서로 다른 능력을 측정합니다. 터미널에서 목표가 분명한 과제를 단계별로 수행하는 능력이 좋다고 해서, 복잡한 레거시 구조를 해석하고 변경 범위를 스스로 정하는 일에서도 반드시 앞선다고 볼 수 없습니다. 공식 발표 역시 소넷 5.5가 높은 노력 수준에서 일부 평가에서 오퍼스에 근접하지만, 오래 이어지는 개방형 작업과 지속적인 판단이 필요한 일에서는 오퍼스 5.5가 뚜렷하게 강하다고 설명합니다.
점수 차이가 작은 항목은 측정 조건을 특히 조심해야 합니다. 오퍼스 5.5 발표는 대부분의 자사 오퍼스 점수를 최대 노력 수준으로 측정하고 Terminal-Bench에는 매우 높음(xhigh)을 적용했다고 명시합니다. 평가표의 퍼센트 차이를 모든 설정에서 그대로 재현할 수 있다고 생각하면 안 됩니다. 동일 과제의 난이도, 에이전트 도구, 시도 횟수, 통계 오차에 따라 실사용 순위가 달라질 수 있습니다.
소넷의 발전폭 자체도 눈여겨볼 만합니다. 앤트로픽이 공개한 Terminal-Bench 4.0의 이전 소넷 5 점수는 10.3%이고 소넷 5.5는 70.6%입니다. 다만 이 큰 차이의 이유를 단순히 ‘모델 자체가 몇 배 똑똑해졌다’로 환산해서는 안 됩니다. 평가 구성과 도구를 포함해 무엇이 바뀌었는지를 함께 확인해야 하며, 독자 여러분의 저장소에서 같은 폭의 개선을 약속하는 숫자도 아닙니다.
업무용 AI라면 코드만 잘 쓰는 것으로 부족합니다. 여러 문서에서 수치를 찾아 보고서를 만들고, 표와 차트를 해석하며, 이유를 설명할 수 있어야 합니다. 앤트로픽의 GDPval-AA v2.1 평가에서 오퍼스 5.5는 1846 Elo, 소넷 5.5는 1844 Elo로 제시됩니다. 이 수치는 다양한 직업 관련 과제에서 산출된 상대적 점수이지, ‘정확도가 몇 퍼센트’라는 뜻은 아닙니다. 근접한 점수만으로 모든 기업 업무에서 두 모델이 똑같다고 결론 내려서도 안 됩니다.
소넷 5.5 발표에서는 문서·슬라이드·스프레드시트 작성, 정해진 범위의 버그 수정, 화면 디자인처럼 목표가 뚜렷한 일을 강점으로 설명합니다. 오퍼스 5.5 발표는 오히려 여러 출처의 정보가 충돌하거나 장시간에 걸쳐 판단을 이어 가야 하는 작업을 강조합니다. 이를 실무 언어로 바꾸면, 절차가 잘 정리된 처리에는 소넷, 문제의 범위부터 찾아야 하는 분석에는 오퍼스를 시험하는 것이 출발점입니다.
예를 들어 금융회사의 전자금융 장애 보고서를 만든다면, 이미 확정된 사고 시각과 로그를 정해진 서식에 맞게 요약하는 초안에는 소넷 5.5를 먼저 써볼 수 있습니다. 반면 여러 서비스의 로그가 모순되고, 원인 후보와 변경 이력, 후속 통제를 함께 추적해야 한다면 오퍼스 5.5를 대조군에 넣을 만합니다. 어느 쪽이든 숫자와 인용은 원문 로그·증빙에 대조하고 최종 판단은 담당자가 승인해야 합니다. 벤치마크의 근소한 차이보다 이 검증 절차가 훨씬 중요합니다.
앤트로픽은 소넷 5.5가 소넷 5보다 출력 생성 속도가 30% 이상 빠르다고 설명합니다. 오퍼스 5.5도 오퍼스 5보다 30% 이상 빠르다고 밝힙니다. 이 두 문장은 각각 이전 세대와 비교한 것이지, 소넷 5.5가 오퍼스 5.5보다 정확히 몇 퍼센트 빠르다는 공개 실측치가 아닙니다. 다른 세대와 비교한 비율 둘을 빼서 신모델끼리의 속도를 만들면 잘못된 결론이 됩니다.
체감 시간은 출력 속도만으로 결정되지 않습니다. 모델이 첫 답변을 시작하기까지 걸리는 시간, 명령을 실행하는 횟수, 테스트를 다시 돌리는 횟수까지 합쳐야 합니다. 처음에는 빨리 답했지만 잘못된 파일을 수정해 두 번 되돌려야 한다면 결국 더 오래 걸립니다. 일상적인 질문과 길고 복잡한 변경 요청을 분리해 시간을 재야 하는 이유입니다.
노력 수준 역시 비교 조건입니다. 소넷 5.5 발표에 따르면 Claude 앱과 Claude Code의 기본 노력 수준은 중간(Medium), Claude Platform의 기본은 높음(High)입니다. 같은 소넷 5.5라도 사용하는 화면과 설정에 따라 출력량·비용·품질이 달라질 수 있습니다. 오퍼스 5.5의 빠른 모드는 일반 요금과 별개의 프리미엄 옵션이므로, 빠른 모드의 응답 시간과 일반 모드의 단가를 묶어 비교하지 마세요.
팀에서 재려면 ‘처음 토큰이 나온 시간’과 ‘검증 가능한 결과물이 완성된 시간’을 따로 남기세요. 코딩 작업이라면 테스트 성공까지의 총시간이, 고객응대라면 검토·수정 후 발송 가능한 답변까지의 시간이 더 현실적인 지표입니다.
코드 에이전트는 긴 시스템 지침, 같은 저장소 파일, 도구 정의를 여러 차례 읽습니다. 이때 캐시 적중량이 많다면 표의 기본 입력 단가만 곱해서 예상액을 만들 수 없습니다. 두 신모델 모두 캐시 읽기 요금이 100만 토큰당 $0.20이라는 점은 흥미롭지만, 캐시를 처음 쓸 때의 비용과 답변 출력 비용까지 같다는 뜻은 아닙니다. 오퍼스 가격 문서와 소넷 공식 발표의 조건을 구분해 봐야 합니다.
앤트로픽은 소넷 5.5가 낮음·중간 노력 수준일 때 여러 평가에서 이전 소넷 5의 최고 점수를 작업당 훨씬 적은 비용으로 넘는다고 설명합니다. 그러나 소넷의 노력 수준을 높여 오퍼스 수준의 성능에 접근하면 과제당 실제 비용도 비슷해질 수 있다고 명시합니다. ‘토큰 단가가 반값이니까 같은 성공 작업도 무조건 반값’이라는 가정은 성립하지 않습니다.
예를 들어 파일 하나를 고치는 작업은 소넷이 충분할 수 있습니다. 반대로 여러 서비스에 걸친 설계 변경은 오퍼스가 재작업을 줄여 결과물당 비용 격차를 좁힐 가능성이 있습니다. 어느 쪽이 실제로 유리한지는 조직의 작업 모음으로 측정해야 하며, 구독형 Claude의 이용 한도와 API 토큰 청구를 같은 가격표로 혼동해서도 안 됩니다.
금융 시스템과 개인정보를 다루는 팀이라면 성능 평가와 운영 통제를 떼어놓을 수 없습니다. 모델이 한 번 잘 답했다고 바로 운영 DB를 조회하거나 코드를 병합할 권한을 주기보다는, 비식별 샘플과 별도 테스트 저장소에서 먼저 품질을 재는 편이 안전합니다. 소넷 5.5 공식 발표는 소넷도 사이버보안 관련 보호 조치와 대체 모델 경로를 적용한다고 설명합니다. 따라서 특정 보안 과제의 결과를 두 모델의 순수 능력 차이로만 해석하지 말고 거절·대체 처리 여부도 기록해야 합니다.
클로드 오퍼스 5.5 vs 소넷 5.5를 우리 팀에 맞게 결론 내리려면, 대표 과제를 난이도별로 고르는 것이 좋습니다. 같은 저장소 시점, 같은 권한, 같은 완료 조건으로 각각 여러 번 실행하세요. 성공률만 보지 말고 담당자가 손으로 고쳐야 했던 부분, 완료 시간, 과제당 청구액을 나란히 놓으면 모델의 장점이 더 분명해집니다.
지금 당장 하나를 기본 모델로 정해야 한다면, 반복적인 개발·문서 작업에는 소넷 5.5부터, 범위가 불분명하고 장시간 판단이 필요한 과제에는 오퍼스 5.5까지 평가하는 구성이 합리적입니다. Terminal-Bench에서는 소넷이 앞서고 CursorBench와 고난도 판단 작업에서는 오퍼스의 이점이 보입니다. 업무 평가 점수는 매우 가깝지만, 그 사실이 여러분 회사의 자료에서 두 모델의 오류율도 같다는 뜻은 아닙니다.
모델명만 바꿔 바로 운영 배포하지도 마세요. 소넷 5.5로 옮기면서 사고 기능을 끈 채 소넷을 쓰던 연동은 앤트로픽의 공식 안내에 따라 between_tools 설정 변경이 필요할 수 있습니다. 실제 API 응답, 도구 호출, 거절 및 대체 경로를 사전 환경에서 확인하세요. 좋은 선택은 벤치마크 한 칸의 승자가 아니라 우리 업무를 정해진 품질과 통제 안에서 더 빠르고 경제적으로 끝내는 모델입니다.