Anthropic의 현재 Claude 라인업으로 인해 단순한 가격 비교만으로는 오해를 불러일으킬 수 있습니다. 이 리뷰에서는 Claude Opus 5.5, Claude Opus 5, Claude Fable 5.1을 동일한 5가지 프롬프트에 적용하여, 작업 결과, 로컬 소요 시간, 경로별 토큰 사용량, 그리고 각 관측치의 한계를 보고합니다.
실질적인 차이는 과제 카드에서 확인할 수 있습니다. Opus 5.5는 측정 대상인 Fable 5.1 세트 중에서 가장 빠르고 비용이 가장 저렴했으며, Fable 5.1은 출력 토큰 수가 가장 적고 중국어 형식의 응답이 가장 깔끔하게 나왔고, Opus 5는 처리 시간이 가장 오래 걸렸으며, Opus 5.5는 출력 토큰을 가장 많이 사용했습니다. 코딩 카드는 중요한 전제 조건을 제시합니다. 즉, 출력이 짧다고 해서 무조건 더 좋은 결과라는 보장은 없다는 것입니다.
이전 Claude Opus 5.5 리뷰에서 제시된 5개의 프롬프트를 복사하여 각 모델에 대해 프롬프트 하나씩 실행했습니다. 요청 설정은 모두 동일했습니다: 토큰 상한 8,192, 높은 노력도, 사용자 메시지 1개, 도구 사용 금지. 해당 요청은 HTTP 200을 반환했고 턴 종료 총 15건의 요청 모두에 대해.
간단한 답변
- 이 5가지 과제 모음 중에서 가장 빠른 것은: Claude Opus 5.5는 5개의 연속된 요청에 걸쳐 47.725초의 로컬 종단 간 시간을 소요했습니다. Claude Fable 5.1은 53.290초를, Claude Opus 5는 61.470초를 소요했습니다.
- 추정 최저 정가: 공식 토큰 환율을 적용했을 때, 5건의 요청에 대한 Opus 5.5의 비용은 약 $0.0818이었으며, 그 다음으로 Opus 5가 $0.0962, Fable 5.1이 $0.1415를 기록했습니다. 이는 산술적 추정치일 뿐, 플랫폼 수수료는 아닙니다.
- 우수한 결과: 세 프로그램 모두 5개의 탄환을 추출한 결과, 파싱 가능한 JSON, 그리고 올바른 수학 답을 반환했습니다. 코딩 결과물은 극한 상황 처리 방식에서 차이가 있었으나, Fable 5.1은 두 문단으로 구성된 중국식 지침을 가장 깔끔하게 따랐습니다.
- API 관련 유의사항: Opus 5.5는 모든 Opus 5 통합 환경에 대해 단순히 이름을 바꿔서 바로 적용할 수 있는 버전이 아닙니다. 마이그레이션 가이드에 따르면 ‘thinking’ 기능을 비활성화할 수 없으며, 일부 구형 도구 및 ‘thinking’ 패턴은 변경이 필요합니다.
- 순위를 지나치게 중요하게 여기지 마세요: 이는 하나의 경로에서 작업당 한 번의 일치된 실행을 의미합니다. 이는 보편적인 모델 점수가 아닌, 구체적인 행동, 소요 시간 및 보고된 사용량을 측정합니다.
세 가지 모델의 가격과 특징
Anthropic의 현재 모델 문서에 따르면, 이 세 가지 API는 1M 토큰의 컨텍스트 윈도우와 128K의 최대 출력량을 공유합니다. 이들의 과금 단위와 상태는 서로 다릅니다. Opus 5.5는 최신 Opus 경로이며, Opus 5는 레거시로 분류되고, Fable 5.1은 가장 높은 표준 입출력 속도를 제공합니다.
| 모델 | 공식 지위 | API 모델 ID | 입력 / 출력 | 컨텍스트 / 최대 출력 | 기본 노력 | 캐시 읽기 |
|---|---|---|---|---|---|---|
| Claude Opus 5.5 | 최신 | 클로드-작품 5-5 | MTok당 $4 / $20 | 1M / 128K | Medium | $0.20 / MTok |
| Claude Opus 5 | 활성, 레거시 | 클로드-오푸스-5 | MTok당 $5 / $25 | 1M / 128K | 높음 | $0.50 / MTok |
| Claude Fable 5.1 | 최신 | 클로드-파블-5-1 | MTok당 $10 / $50 | 1M / 128K | 높음 | $0.25 / MTok |
간단한 비캐시 예시를 들어보면, Opus 5.5에서는 입력 토큰 100,000개와 출력 토큰 20,000개에 대해 $0.80이 청구되며, Opus 5에서는 $1.00, Fable 5.1에서는 $2.00이 소요됩니다(표시된 요금 기준). Fable 5.1은 Opus 5보다 캐시 읽기 비율이 낮으므로, 캐시 사용량이 많은 에이전트 워크로드의 경우 별도의 계산이 필요합니다.
공식 벤치마크 표가 보여주는 내용
Anthropic의 Claude Opus 5.5 발표 세 가지 모델을 모두 동일한 공급업체 비교 표에 포함시켰습니다. Opus 5.5가 나열된 행 중 1위를 차지하고 있지만, 이는 벤치마크별 테스트 케이스와 작업 설정을 적용해 공급업체가 보고한 결과입니다. 발표문 자체에서도, 이 수준의 성능에서는 벤치마크 점수 차이가 미미할 경우 실제 성능 차이를 가늠하는 데 신뢰도가 떨어진다고 경고하고 있습니다.
| 공급자 벤치마크 | 작품 5.5 | Fable 5.1 | 오푸스 5 | 측정 항목 |
|---|---|---|---|---|
| 터미널-벤치 4.0 | 66.4% | 55.8% | 52.3% | 에이전트 기반 명령줄 코딩 |
| FrontierCode v1.1 | 54.4% | 50.3% | 48.0% | 에이전트 코드 변경 사항이 병합될지 여부 |
| CursorBench 4.0 | 57.8% | 51.8% | 46.6% | 모호한 다중 파일 코딩 과제 |
| GDPval-AA v2.1 | 1846 | 1735 | 1708 | 44개 직종에 걸친 전문 지식 업무 |
| AutomationBench | 40.0% | 31.4% | 26.9% | 종단간 비즈니스 워크플로우 |
| 인류의 마지막 시험 | 67.7% 도구를 사용하여 | 65.6% (공구 포함) | 63.6% (공구 포함) | 다학제적 추론 |
| OSWorld 2.0 | 81.8% 일부 | 80.7% 부분 | 74.0% 부분 | 컴퓨터 활용 과제 |
이 표는 제공업체가 주장하는 성능 프론티어를 파악하는 데 유용합니다. 다만 이 표는 아래에 제시된 매칭된 카드들을 대체할 수는 없습니다. 본 테스트는 짧은 단일 턴 프롬프트, 높은 노력도, 도구 미사용, 제3자가 제어하는 경로를 기준으로 진행되었습니다.
동일한 프롬프트, 동일한 요청 설정
이전 Opus 5.5 테스트 팩에 포함된 5개의 프롬프트를 복사하여 각 모델에 한 번씩 전송했습니다. 클라이언트는 작업별로 모델 순서를 번갈아 가며 지정하고, UTF-8 JSON을 사용했으며, 요청 시작 시점부터 응답 본문이 완전히 읽힐 때까지의 시간을 측정했습니다. 총 15개의 요청 모두 HTTP 200을 반환했으며, 턴 종료. 더 자세한 근거와 재현 가능한 워크플로는 다음을 참조하십시오. GlobalGPT가 AI 모델을 어떻게 테스트하는지.
시간 및 토큰 비교
| 경로 | 5런이 지났다 | 평균 / 과제 | 입력 토큰 | 출력 토큰 | 경로 기반 사고 | 권장 소비자 가격 추정치* |
|---|---|---|---|---|---|---|
| Claude Opus 5.5 | 47.725초 | 9.545초 | 700 | 3,952 | 2,214 | $0.0818 |
| Claude Opus 5 | 61.470초 | 12.294초 | 690 | 3,709 | 1,859 | $0.0962 |
| Claude Fable 5.1 | 53.290초 | 10.658초 | 700 | 2,690 | 1,122 | $0.1415 |
*경로에서 보고된 입력/출력 토큰 및 Anthropic의 표준 API 요율 목록을 바탕으로 추산한 값입니다. 여기에는 캐시 요금, 플랫폼 크레딧, 세금 및 마크업은 포함되지 않습니다. 소요 시간은 요청이 전송된 후의 현지 종단 간 실제 소요 시간이며, 제공자의 지연 시간이나 초당 토큰 수는 아닙니다. “사고(Thinking)”는 경로에서 보고된 사용량 필드이며, 독립적으로 측정된 숨겨진 추론 과정을 의미하지 않습니다.
지표에 따라 종합적인 결과가 서로 다른 양상을 보입니다. Opus 5.5는 가장 빠른 총 처리 시간과 가장 낮은 예상 비용을 기록했으며, Fable 5.1은 가장 적은 출력 토큰 수를 기록했고, Opus 5는 이 그룹에서 가장 느린 총 처리 시간을 보였습니다. 답안이 짧다고 해서 무조건 더 좋은 답안인 것은 아닙니다. 코딩 카드를 보면 출력 내용과 극한 상황 처리를 여전히 꼼꼼히 살펴봐야 하는 이유가 드러납니다.
일치하는 과제 카드 5장
이 모델들이 혼합형 중복 제거 기능을 복원할 수 있을까요?
작업 설정: 이 프롬프트에서는 수정된 함수와 간결한 테스트 케이스 두 개, 대소문자를 구분하지 않는 문자열 비교, 첫 번째 철자 보존, 그리고 문자열이 아닌 값을 입력해도 프로그램이 중단되지 않는 기능을 구현해야 했습니다.
| 모델 | 시간 / 사용량 | 관측된 결과 |
|---|---|---|
| Claude Opus 5.5 | 15.844초 (로컬) · 145 입력 / 1478 출력 · 700 생각 · end_turn | 대소문자를 구분하지 않는 처리 방식과 목록 기반 대체 방식을 함께 사용합니다. 문서 문자열에는 '동일성'이라고 명시되어 있지만, 코드에서는 '등가성'을 사용합니다. |
| Claude Opus 5 | 16.845초 (로컬) · 143 입력 / 1109 출력 · 312 생각 중 · end_turn | 타입 태그가 지정된 키와 등가성 대체 처리 기능을 추가하고, 유효하지 않은 한 줄짜리 파이썬 구문을 지적합니다. |
| Claude Fable 5.1 | 12.778초 (로컬) · 145 인 / 783 아웃 · 0 생각 · end_turn | 해시화할 수 없는 값의 경우 repr(item)을 사용합니다. 이는 제시된 예제에서는 정상적으로 작동하지만, 유형 간에 충돌이 발생할 수 있습니다. |
비교 결과: 이 예외적인 경우는 작업 단위의 관찰 결과일 뿐, 모든 코딩 업무에 대한 주장이 아닙니다.
모델들이 주어진 다섯 가지 사실을 추가 주장을 덧붙이지 않고 그대로 유지할 수 있을까요?
작업 설정: 이 자료는 세 명의 글쓰기 보조 도구를 2주 동안 테스트한 내용을 담은 짧은 메모였습니다. 이는 대규모 문맥을 다루는 벤치마크가 아닌, 간단한 추출 과제입니다.
| 모델 | 시간 / 사용량 | 관측된 결과 |
|---|---|---|
| Claude Opus 5.5 | 4.374초 (지역 시간) · 210 입력 / 312 출력 · 101 생각 · 턴 종료 | 번호가 매겨진 총알 5발을 반환했으며, 제공된 사실 범위 내에서만 다루었습니다. 표기와 순서는 약간 달랐습니다. |
| Claude Opus 5 | 4.661초 (로컬) · 208 입력 / 265 출력 · 27 생각 · end_turn | 번호가 매겨진 총알 5발을 반환했으며, 제공된 사실 범위 내에서만 다루었습니다. 표기와 순서는 약간 달랐습니다. |
| Claude Fable 5.1 | 6.305초 (현지 시간) · 210 인 / 223 아웃 · 0 생각 · end_turn | 번호가 매겨진 총알 5발을 반환했으며, 제공된 사실 범위 내에서만 다루었습니다. 표기와 순서는 약간 달랐습니다. |
비교 결과: 원문 구절은 짧았습니다. 이 테스트는 근거에 기반한 추출 및 서식 지정을 확인하는 것이지, 백만 토큰 규모의 문맥 처리를 확인하는 것이 아닙니다.
모델들이 요청된 구조를 정확히 반환할 수 있나요?
작업 설정: 이 프롬프트는 유효한 JSON 형식만 허용하며, 정확히 5개의 키와 장점과 단점 각각 2개씩, 그리고 짧은 문자열을 포함해야 했습니다. 이 가상의 리뷰 내용은 어떤 모델에 대한 증거가 아닙니다.
| 모델 | 시간 / 사용량 | 관측된 결과 |
|---|---|---|
| Claude Opus 5.5 | 8.276초 (로컬) · 128 입력 / 622 출력 · 390 생각 · end_turn | 요청된 키와 장단점 두 가지씩이 포함된 파싱 가능한 JSON을 반환했습니다. 생성된 리뷰 내용은 테스트용 텍스트일 뿐, 실제 제품 정보는 아닙니다. |
| Claude Opus 5 | 6.344초 (지역 시간) · 126 인 / 238 아웃 · 0 생각 · 턴 종료 | 요청된 키와 장단점 두 가지씩이 포함된 파싱 가능한 JSON을 반환했습니다. 생성된 리뷰 내용은 테스트용 텍스트일 뿐, 실제 제품 정보는 아닙니다. |
| Claude Fable 5.1 | 6.626초 (로컬) · 128 입력 / 203 출력 · 0 생각 · end_turn | 요청된 키와 장단점 두 가지씩이 포함된 파싱 가능한 JSON을 반환했습니다. 생성된 리뷰 내용은 테스트용 텍스트일 뿐, 실제 제품 정보는 아닙니다. |
비교 결과: 이 JSON 문자열은 가상의 리뷰 설정을 설명하는 것이며, 제품 정보로 공개해서는 안 됩니다.
모델들이 둥근 배치 순서를 최종 답까지 그대로 이어갈 수 있을까요?
작업 설정: 이 순서는 12였으며, 이후 4개의 배치에 걸쳐 반올림하여 25%가 추가되었습니다.
| 모델 | 시간 / 사용량 | 관측된 결과 |
|---|---|---|
| Claude Opus 5.5 | 3.830초 (지역 시간) · 89 인 / 257 아웃 · 74 생각 중 · end_turn | 12, 15, 18, 22를 더한 결과는 총 67이었고, 세 가지 계산 결과 모두 요청받은 단독 숫자인 67로 끝났다. |
| Claude Opus 5 | 5.079초 (지역) · 87 입력 / 277 출력 · 90 생각 중 · end_turn | 12, 15, 18, 22를 더한 결과는 총 67이었고, 세 가지 계산 결과 모두 요청받은 단독 숫자인 67로 끝났다. |
| Claude Fable 5.1 | 5.347초 (로컬) · 89 입력 / 127 출력 · 0 사고 · end_turn | 12, 15, 18, 22를 더한 결과는 총 67이었고, 세 가지 계산 결과 모두 요청받은 단독 숫자인 67로 끝났다. |
비교 결과: 세 문제 모두 이 산술 문제를 통과했습니다. 단 한 문제만으로는 일반적인 추론 능력을 신뢰성 있게 평가할 수 없습니다.
이 경로는 요청된 두 단락 구조를 유지할 수 있을까요?
작업 설정: 지시사항에 따르면, 각각 80~120자 분량의 중국어 문단 두 개를 작성해야 합니다. 첫 번째 문단은 가치에 대한 답변이고, 두 번째 문단은 테스트 계획입니다.
| 모델 | 시간 / 사용량 | 관측된 결과 |
|---|---|---|
| Claude Opus 5.5 | 15.401초 (로컬) · 128 입력 / 1283 출력 · 949 사고 시간 · end_turn | 요청받은 두 단락을 반영한 뒤, 마크다운 형식을 적용하고 영어 메모를 추가했습니다. |
| Claude Opus 5 | 28.541초 (로컬) · 입력 126 / 출력 1820 · 사고 시간 1430 · 턴 종료 | 요청받은 두 단락을 원본대로 복원하고, 구분선 뒤에 영어로 된 메모를 추가했습니다. |
| Claude Fable 5.1 | 22.234초 (로컬) · 128 입력 / 1354 출력 · 1122 사고 시간 · end_turn | 추가 설명이나 마크다운 태그 없이 깔끔한 중국어 문단 두 개가 반환되었습니다. |
비교 결과: 이 기록은 테스트된 경로를 따라 진행된 지침을 기록한 것이며, 중국어 품질 평가 기준이 아닙니다.
API 및 마이그레이션 시 유의사항
Opus 5.5는 모든 Opus 5 통합 환경에서 단순히 이름을 바꿔서 바로 적용할 수 있는 버전이 아닙니다. Anthropic의 이주 가이드 Opus 5.5에서는 ‘thinking’ 기능을 비활성화할 수 없다고 밝히며, 이 기능을 비활성화하거나 이전 ‘thinking’ 모드를 수동으로 활성화하려는 요청에 대해서는 400 오류를 반환하도록 요청합니다. 또한 이번 마이그레이션을 통해 도구 강제 사용 방식이 변경되고, ‘thinking’ 블록이 모델 및 대화와 연동되며, Claude API 및 Google Cloud 경로에서 사용되던 기존 컴퓨터 사용 도구가 대체됩니다.
사용된 공통 시험은 output_config.effort: high 세 모델 모두에 대해 동일한 조건을 적용하여 프롬프트 결과를 더 쉽게 비교할 수 있도록 했습니다. 즉, 이번 실행 결과는 각 모델의 기본 노력 설정을 재현하지 않습니다. Fable 5.1은 적응형 사고 기능이 항상 켜져 있고 기본 노력 수준이 ‘높음’으로 설정되어 있는 것으로 기록되어 있으며, Opus 5.5는 적응형 사고 기능이 항상 켜져 있고 기본 노력 수준이 ‘중간’으로 설정되어 있는 것으로 기록되어 있습니다. Opus 5는 적응형 사고 기능을 사용하며 기본 노력 수준이 ‘높음’으로 설정되어 있습니다.
이 테스트가 실제로 입증하는 바는
작업별 판정
Opus 5.5: 이 5가지 작업으로 구성된 팩 중에서 예상 정가가 가장 빠르고 저렴할 뿐만 아니라, 가장 많은 출력 토큰을 생성합니다. Fable 5.1: 전체적으로 가장 짧은 출력을 보였으며 중국의 ‘두 문단 제약’을 가장 깔끔하게 준수했으나, 토큰 가격이 높아 5회 실행 추정치가 가장 높았고, 코딩 대체 방안에는 구체적인 교차형 에지 케이스가 포함되어 있었다. 오푸스 5: 추출, JSON, 수학 작업에서는 정확하지만, 이 경로 예제에서는 가장 느리며 공식 문서에서 구형으로 표시되어 있습니다.
이는 측정된 이 경로에서 Opus 5.5를 실질적으로 선호할 만한 충분한 근거가 되지만, 모든 워크로드에서 우위를 점한다고 주장하기에는 부족합니다. 결과를 실제 운영 벤치마크로 삼기 전에 다양한 도구와 더 긴 입력 데이터를 사용하여 여러 번 테스트를 반복해 보십시오.
별도의 계정 세 개를 개설하지 않고도 이 비교를 재현하고 싶다면, GlobalGPT에서 모델 비교 워크플로를 사용해 보세요. 실제 적용 여부를 결정할 때는 직접 모델 경로와 업스트림 공급자 매핑을 여전히 별도로 검증해야 합니다.
자주 묻는 질문
대조 테스트에서 어떤 모델이 가장 빨랐나요?
Claude Opus 5.5는 5개의 연속 요청에 걸쳐 총 47.725초로, 가장 짧은 총 로컬 소요 시간을 기록했습니다. 이는 경로 관측값이며, 제공자 측 지연 시간이 아닙니다.
어떤 모델이 출력 토큰을 가장 적게 사용했나요?
Claude Fable 5.1은 5가지 과제 전반에 걸쳐 경로 보고 출력 토큰 2,690개를 사용한 반면, Opus 5는 3,709개, Opus 5.5는 3,952개를 사용했습니다.
이번 테스트에서 가장 저렴한 모델은 무엇이었나요?
공식 표준 API 요금과 반환된 입력/출력 토큰 수를 기준으로 할 때, Opus 5.5는 $0.0818로 5회 실행 추정치 중 가장 낮은 수치를 기록했습니다. 여기에는 캐시, 크레딧, 세금 및 플랫폼 마크업은 포함되지 않습니다.
세 모델 모두 같은 과제를 통과했나요?
세 가지 모두 요청된 키가 포함된 파싱 가능한 JSON 형식의 5개 항목 추출 결과를 반환했으며, 총합은 67로 정확했습니다. 코딩 방식과 중국식 서식 카드 간에는 출력 결과에 의미 있는 차이가 나타났습니다.
이 벤치마크는 장기간에 걸친 벤치마크였나요?
아닙니다. 재사용된 추출 프롬프트에는 짧은 문장이 포함되어 있습니다. 이 프롬프트는 그라운딩과 정확한 서식 지정을 평가하기 위한 것이므로, 백만 토큰 규모의 문맥 처리 성능을 입증하는 근거로 제시되어서는 안 됩니다.
Claude Opus 5는 여전히 최신 버전인가요?
Anthropic의 모델 문서에서는 Opus 5를 ‘활성 상태이지만 구형’으로 분류하고 있으며, 성능 향상을 위해 Opus 5.5를 고려할 것을 권장합니다. 기존 API 연동 환경의 경우, 전환 전에 마이그레이션 가이드를 검토해야 합니다.
공식 사양: Opus 5.5 문서, Opus 5 문서, 및 Fable 5.1 문서. 제공업체의 벤치마크 값은 Anthropic에 기반하며, 실습 값은 앞서 설명한 매칭 테스트 팩에서 도출된 것입니다.



