앤트로픽이 10월 7일 Claude Haiku 5.5를 공개했다. 문서를 요약하고 고객 문의를 분류하거나, 필요한 정보를 뽑아 다른 프로그램에 넘기는 AI 모델이다. 복잡한 일을 오래 수행하는 대형 모델보다 빠른 응답과 낮은 처리 비용에 초점을 맞췄다. 공식 발표
작고 빠른 모델에 맡기는 일
앤트로픽은 대화형 AI 서비스 Claude와 그 안에서 사용하는 모델을 개발하는 회사다. Haiku는 Claude 제품군에서 속도와 비용을 중시하는 모델 계열이다. 같은 회사의 Opus가 오래 걸리는 코딩과 지식 업무를, Sonnet이 일상적인 작업의 성능과 속도를 함께 중시한다면, Haiku는 범위가 분명한 요청을 많이 처리하는 데 맞춰져 있다. 글과 이미지를 입력받아 글로 답하며, 이미지를 생성하는 모델은 아니다. Claude 모델 비교
예를 들어 고객 문의를 읽고 배송·환불·제품 사용법으로 나눈 뒤, 주문번호와 요청 내용을 추출하는 서비스에 활용할 수 있다. 사람이 문의를 하나씩 열기 전에 담당 부서와 필요한 정보를 정리하는 방식이다. 사내 문서에서는 특정 계약의 갱신일이나 보고서의 매출 항목을 찾는 작업을 맡길 수 있다. 이런 활용은 긴 보고서를 통째로 새로 작성하는 것보다 입력과 원하는 결과의 범위를 정하기 쉽다. 주요 활용 분야
큰 모델과 역할을 나누는 구성도 가능하다. 큰 모델이 발표 자료의 목차와 논리를 정하는 동안 Haiku가 자료별 수치를 찾아오거나 문서를 요약하게 하는 식이다. 전체 작업을 맡은 AI가 하위 작업을 별도의 AI에 나눠 맡기는 방식이 ‘서브에이전트’ 활용이다. Haiku의 답을 최종 결과로 바로 쓰기보다, 필요한 근거와 중간 결과를 모아 큰 모델이 이어서 처리하도록 만들 수 있다. 서브에이전트 활용
모델의 판단과 실제 실행은 어떻게 연결되나?
문서 요약은 내용을 읽고 답을 생성하면 되지만, 주문 조회나 화면 조작에는 외부 도구가 필요하다. 개발자가 모델에 사용 가능한 도구와 입력 형식을 알려주면, 모델은 어떤 도구에 어떤 값을 보낼지 정한다. 연결된 프로그램이 실제 작업을 수행하고 결과를 돌려주면 모델이 답을 이어간다. Haiku가 고객의 요청을 이해하는 것과 주문 데이터베이스에서 정보를 가져오는 것은 이 과정의 서로 다른 단계다. 도구 호출의 작동 방식
컴퓨터 조작에서는 연결된 프로그램이 화면 캡처를 모델에 보내고, 모델이 제안한 클릭이나 키 입력을 실행한다. 그 뒤 바뀐 화면을 다시 읽으며 다음 동작을 정하는 흐름이다. 컴퓨터 사용 도구
Haiku 5.5에는 작업에 들이는 추론 수준을 조절하는 effort 설정이 처음 추가됐다. 기본값은 medium이며, 단순한 분류에는 low를, 여러 자료를 비교하거나 지시를 엄격하게 따라야 하는 작업에는 high를 사용할 수 있다. 모델이 답을 준비할 때 들이는 추론량에 영향을 주어 품질·시간·비용의 균형을 바꾸는 방식이다. 일정한 처리 시간이나 토큰 예산을 보장하는 설정은 아니다. 추론 수준 설정
낮은 설정이 모든 작업에 유리한 것은 아니다. 앤트로픽 문서는 긴 에이전트 작업에서 low를 사용하면 검색이나 확인을 건너뛰고 일찍 끝낼 가능성이 커진다고 설명한다. 짧은 문의를 분류할 때와 여러 화면을 오가며 기록을 대조할 때 필요한 설정이 다를 수 있다는 뜻이다. 실제 업무에서는 처리 속도와 함께 누락된 정보가 없는지도 비교해야 한다.
한 번에 참고할 수 있는 문맥은 최대 100만 토큰으로, 이전 Haiku 4.5의 20만 토큰보다 늘었다. 토큰은 글을 모델이 처리하기 위해 나눈 작은 단위이며, 글자 수나 페이지 수와 정확히 같지는 않다. 여러 문서와 대화 기록을 함께 넣을 여유가 커졌지만, 입력 가능한 양이 늘었다고 모든 내용을 빠짐없이 찾는다는 뜻은 아니다. 문맥 길이의 변화
컴퓨터 조작과 코딩에서 보인 차이
앤트로픽은 Haiku 5.5가 실제 컴퓨터를 조작하는 OSWorld 2.1 평가의 오프라인 부분에서 72.4%를 기록했다고 발표했다. 같은 표의 Haiku 4.5와 GPT-6 Luna보다 높은 결과다. 다만 비교 대상으로 제시한 Sonnet 5.5에는 미치지 못했고, 복잡한 코딩 작업에서는 격차가 더 컸다. 아래 수치는 작업 성공률이며, 응답 속도나 비용을 비교한 결과는 아니다.
OSWorld는 화면을 보고 여러 단계의 컴퓨터 작업을 끝내는 능력을 평가한다. 이번 수치는 오프라인 부분에 한정되므로 인터넷을 사용하는 모든 브라우저 작업의 성공률로 읽을 수는 없다. Terminal-Bench는 명령줄 환경에서 복잡한 작업을 수행하는 평가다. Haiku의 개선 폭은 크지만, 큰 모델을 보조하는 짧은 작업과 처음부터 끝까지 맡기는 복잡한 코딩은 구분할 필요가 있다. 두 결과 모두 회사가 공개한 평가이며 별도의 독립 재현 결과는 아니다. 평가 결과와 설명
지금 이용하는 방법과 비용
Haiku 5.5는 Claude의 웹·iOS·Android에서 Free부터 Enterprise까지 모든 요금제 사용자가 선택할 수 있으며, Claude Code에서도 제공된다. 개발자는 Claude Platform의 API로 연결하거나 AWS·Google Cloud·Microsoft Foundry를 통해 이용할 수 있다. API는 서비스에서 모델에 요청을 보내고 답을 받는 연결 방식이다. 현재 제공 범위
Claude Platform의 기본 API 가격은 요청의 입력 길이에 따라 달라진다. 10만 토큰 이하의 요청은 100만 토큰당 입력 0.10달러·출력 0.50달러다. Haiku 4.5의 입력 1달러·출력 5달러에 비해 단가는 90% 낮다. 10만 토큰을 넘는 요청은 입력 0.50달러·출력 2.50달러로 오른다. 긴 자료를 많이 넣을 수 있다는 기능과 저렴한 기본 단가가 적용되는 범위는 구분해야 한다. 공식 가격표
가령 요청마다 입력 1,000토큰과 출력 200토큰을 사용한다면, 1만 건의 기본 토큰 비용은 2달러다. 짧은 요청의 단가를 적용한 계산으로, 별도 도구 요금과 추가 추론에 사용된 토큰 등은 제외했다. 반면 같은 문서를 요청마다 길게 넣으면 처리 건수가 같아도 비용이 달라진다. 실제로 보낸 양과 생성한 양을 함께 확인해야 한다.
기존 Haiku 4.5에서 바꿀 때도 단가만 비교하면 안 된다. 새 모델은 글을 나누는 방식이 달라 같은 입력이 약 30% 더 많은 토큰으로 계산될 수 있다고 문서에 안내돼 있다. 내용에 따라 차이가 달라지므로 기존 서비스의 입력을 다시 계산해야 한다. 토큰 계산 방식의 변화
답글 남기기
댓글을 달기 위해서는 로그인해야합니다.