So sánh Claude Haiku 5.5 và 4.5: Có gì mới và lỗi nghiêm trọng cần sửa ngay
Claude Haiku 5.5 (claude-haiku-5-5, phát hành ngày 7 tháng 10 năm 2026) giảm 90% chi phí so với Haiku 4.5 cho lời nhắc tối đa 100K token (0,10 USD/0,50 USD trên mỗi triệu token đầu vào/đầu ra so với 1 USD/5 USD). Mô hình
Claude Haiku 5.5 (claude-haiku-5-5, phát hành ngày 7 tháng 10 năm 2026) giảm 90% chi phí so với Haiku 4.5 cho lời nhắc tối đa 100K token (0,10 USD/0,50 USD trên mỗi triệu token đầu vào/đầu ra so với 1 USD/5 USD). Mô hình này tăng cửa sổ ngữ cảnh từ 200K lên 1M token và đạt điểm cao hơn trong các bài kiểm tra hiệu năng được công bố cho cả hai phiên bản. Tuy nhiên, việc nâng cấp không chỉ là đổi model: năm cấu trúc request từng hoạt động trên 4.5 sẽ trả về lỗi 400 trên 5.5, trong khi một số thay đổi khác có thể âm thầm ảnh hưởng phản hồi và chi phí.
Bài viết này cung cấp bảng so sánh, JSON trước/sau cho từng thay đổi gây lỗi, các thay đổi ngầm cần kiểm tra và quy trình xác thực migration trong Apidog. Xem Claude Haiku 5.5 là gì để đọc thông số đầy đủ, hoặc tham khảo hướng dẫn API Claude Haiku 4.5 nếu hệ thống của bạn vẫn dùng phiên bản cũ.
Haiku 4.5 so với Haiku 5.5: tổng quan
| Claude Haiku 4.5 | Claude Haiku 5.5 | |
|---|---|---|
| ID mô hình (Claude API) | claude-haiku-4-5-20251001 |
claude-haiku-5-5 |
| Ngữ cảnh / đầu ra tối đa | 200K / 64K | 1M / 128K |
| Đầu vào / đầu ra trên mỗi MTok | $1 / $5 | $0.10 / $0.50 cho lời nhắc đến 100K token; $0.50 / $2.50 cho hơn 100K |
| Đọc cache / ghi cache 5 phút trên mỗi MTok | $0.10 / $1.25 | $0.01 / $0.125 đến 100K; $0.05 / $0.625 cho hơn 100K |
| Đầu vào / đầu ra batch trên mỗi MTok | $0.50 / $2.50 | $0.05 / $0.25 đến 100K; $0.25 / $1.25 cho hơn 100K |
| Suy nghĩ |
budget_tokens thủ công |
Chỉ adaptive, mặc định bật |
| Mức độ nỗ lực | Không có |
low, medium (mặc định), high, xhigh, max
|
| Lời nhắc tối thiểu có thể cache | 4.096 token | 512 token |
| Tokenizer | Cũ hơn | Khoảng 30% nhiều token hơn cho cùng văn bản |
| Tham số sampling không mặc định, prefill | Được chấp nhận | Lỗi 400 |
| Hạng ưu tiên | Được hỗ trợ | Không được hỗ trợ |
| Trạng thái | Hoạt động, không ngừng hoạt động trước 15/10/2026 | Hoạt động, không ngừng hoạt động trước 07/10/2027 |
Haiku 4.5 chưa bị ngừng hỗ trợ. Trang ngừng hỗ trợ mô hình vẫn liệt kê phiên bản này là Hoạt động và không có ngày ngừng hỗ trợ. Bạn có thể lập kế hoạch migration theo tiến độ riêng; giới hạn tốc độ không thay đổi giữa hai phiên bản.
Năm thay đổi gây lỗi 400
Hãy chạy kiểm tra từng mục dưới đây trước khi đổi model ID trong production. Theo hướng dẫn di chuyển Haiku 5.5, mỗi cấu trúc sau đều trả về lỗi 400 trên Haiku 5.5 dù từng hoạt động trên Haiku 4.5.
1. Thay budget_tokens bằng adaptive thinking
Haiku 5.5 chỉ hỗ trợ suy nghĩ thích ứng. Request chứa ngân sách suy nghĩ cố định sẽ bị từ chối.
// Trước: Haiku 4.5
{
"model": "claude-haiku-4-5-20251001",
"max_tokens": 16000,
"thinking": { "type": "enabled", "budget_tokens": 8000 },
"messages": [
{ "role": "user", "content": "Classify this ticket." }
]
}
// Sau: Haiku 5.5
{
"model": "claude-haiku-5-5",
"max_tokens": 16000,
"thinking": { "type": "adaptive" },
"output_config": { "effort": "medium" },
"messages": [
{ "role": "user", "content": "Classify this ticket." }
]
}
Dùng output_config.effort để kiểm soát mức suy luận:
- Nếu trước đây dùng
budget_tokensthấp, bắt đầu vớieffort: "low". - Dùng
mediumlàm cấu hình mặc định. - Chỉ tăng lên
high,xhighhoặcmaxsau khi đo chất lượng và chi phí thực tế. - Bạn vẫn có thể gửi
thinking: {"type": "disabled"}, nhưng chỉ khi effort làhightrở xuống. Kết hợp vớixhighhoặcmaxsẽ trả về lỗi 400.
2. Loại bỏ tham số sampling không được hỗ trợ
Xóa temperature, top_p và top_k khỏi request migration. Haiku 5.5 chỉ chấp nhận temperature: 1 hoặc top_p: 0.99; mọi giá trị khác đều lỗi 400.
Các trường hợp lỗi bao gồm:
-
temperaturekhác1 -
top_pkhác0.99, kể cảtop_p: 1 - Bất kỳ giá trị
top_knào - Gửi đồng thời
temperaturevàtop_p
// Trước: Haiku 4.5
{
"model": "claude-haiku-4-5-20251001",
"max_tokens": 1024,
"temperature": 0.2,
"top_k": 40,
"messages": [
{ "role": "user", "content": "Extract the order ID." }
]
}
// Sau: Haiku 5.5
{
"model": "claude-haiku-5-5",
"max_tokens": 1024,
"messages": [
{ "role": "user", "content": "Extract the order ID." }
]
}
Nếu bạn từng giảm temperature để ổn định đầu ra, hãy chuyển yêu cầu đó vào prompt, ví dụ: “Trả về đúng một đối tượng JSON, không thêm diễn giải.”
3. Bỏ assistant prefill
Haiku 5.5 không chấp nhận lượt assistant cuối cùng dùng để tiền điền câu trả lời, kể cả khi thinking bị tắt. Mảng messages phải kết thúc bằng lượt user.
// Trước: Haiku 4.5
{
"model": "claude-haiku-4-5-20251001",
"max_tokens": 1024,
"messages": [
{ "role": "user", "content": "Return the sentiment as JSON." },
{ "role": "assistant", "content": "{\"sentiment\": \"" }
]
}
// Sau: Haiku 5.5
{
"model": "claude-haiku-5-5",
"max_tokens": 1024,
"system": "Reply with only a JSON object. No preamble.",
"messages": [
{ "role": "user", "content": "Return the sentiment as JSON." }
]
}
Với đầu ra nghiêm ngặt, ưu tiên structured outputs hoặc tool có trường enum thay vì dựa vào prefill.
4. Đổi computer_20250124 sang computer_toolset_20260801
Trên Claude API và Google Cloud, Haiku 5.5 chỉ hỗ trợ computer use qua toolset mới.
Thực hiện đồng thời các bước sau:
- Đổi
computer_20250124thànhcomputer_toolset_20260801. - Xóa header beta
computer-use-2025-01-24. - Xóa
fine-grained-tool-streaming-2025-05-14nếu đang gửi cùng toolset mới, vì tổ hợp này gây lỗi 400.
// Trước: Haiku 4.5
// Header: anthropic-beta: computer-use-2025-01-24
{
"model": "claude-haiku-4-5-20251001",
"max_tokens": 4096,
"tools": [
{
"type": "computer_20250124",
"name": "computer",
"display_width_px": 1280,
"display_height_px": 800
}
],
"messages": [
{ "role": "user", "content": "Open the settings page." }
]
}
// Sau: Haiku 5.5
// Không có beta header
{
"model": "claude-haiku-5-5",
"max_tokens": 4096,
"tools": [
{ "type": "computer_toolset_20260801" }
],
"messages": [
{ "role": "user", "content": "Open the settings page." }
]
}
Cập nhật cả vòng lặp agent:
- Phân phối tool result theo
namevàtoolset_namecủa từng khốitool_use. - Không còn phân phối theo
input.action. - Lặp lại
toolset_nametrong tool result. - Haiku 5.5 cũng hỗ trợ browser toolset qua
browser_toolset_20260801, trong khi Haiku 4.5 không hỗ trợ.
Xem thêm Sử dụng máy tính trong Claude Code để có tổng quan về computer use.
5. Không chỉnh sửa lịch sử trước một thinking block
Một thinking block của Haiku 5.5 chỉ hợp lệ nếu toàn bộ dữ liệu gửi trước đó giữ nguyên. Nếu bạn thay đổi system, tools hoặc một message cũ rồi gửi lại thinking block, request sẽ lỗi 400.
// Trước: system đã bị chỉnh sửa + thinking block phát lại = 400
{
"model": "claude-haiku-5-5",
"max_tokens": 4096,
"system": "You are a billing agent. Be brief.",
"messages": [
{ "role": "user", "content": "Why was I charged twice?" },
{
"role": "assistant",
"content": [
{
"type": "thinking",
"thinking": "",
"signature": "<from turn 1>"
},
{ "type": "text", "text": "Checking." }
]
},
{ "role": "user", "content": "Order 4412." }
]
}
// Sau: giữ nguyên lịch sử, đưa chỉ dẫn mới vào message mới
{
"model": "claude-haiku-5-5",
"max_tokens": 4096,
"system": "You are a billing agent.",
"messages": [
{ "role": "user", "content": "Why was I charged twice?" },
{
"role": "assistant",
"content": [
{
"type": "thinking",
"thinking": "",
"signature": "<from turn 1>"
},
{ "type": "text", "text": "Checking." }
]
},
{ "role": "user", "content": "Order 4412. Be brief." }
]
}
Với tài khoản được tạo trước ngày 31 tháng 8 năm 2026, 00:00 UTC, lỗi này chỉ xuất hiện khi request đặt thinking.block_binding.prefix_mismatch_behavior.
Những thay đổi ngầm không gây lỗi
Các mục sau thường không gây lỗi HTTP, nhưng cần được đưa vào regression test.
-
Thinking mặc định trống. Mỗi khối
thinkingtrả về trườngthinkingtrống và chỉ chứasignature. Haiku 4.5 từng trả về suy nghĩ đã tóm tắt. Nếu cần ghi log hoặc hiển thị suy nghĩ, đặt:
{
"thinking": {
"type": "adaptive",
"display": "summarized"
}
}
Phản hồi có thể bắt đầu bằng thinking block. Adaptive thinking được bật mặc định. Khi parse response, tìm block theo
type, không truy cập theo chỉ số cố định nhưcontent[0].Cùng văn bản có thể nhiều hơn khoảng 30% token. Tokenizer mới làm tăng số token trên cùng nội dung. Đếm lại prompt thực tế của bạn; token suy nghĩ cũng tính vào
max_tokens, nên giới hạn thấp có thể dẫn đếnstop_reason: "max_tokens"trước khi có text output.tool_choicebắt buộc sẽ bỏ qua thinking.tool_choice: {"type": "any"}hoặc chỉ định tool cụ thể vẫn hoạt động, nhưng response bắt đầu bằng tool call mà không có thinking block. Nếu cần mô hình suy luận trước, dùng:
{
"tool_choice": { "type": "auto" }
}
Sau đó mô tả rõ trong prompt khi nào mô hình nên gọi tool.
Có thêm trường hợp từ chối. Haiku 5.5 chạy các classifier an toàn như
cyber,frontier_llm,biovàgeneral_harms, có thể trả vềstop_reason: "refusal". Không có fallback phía server; retry cùng nội dung thường vẫn bị từ chối.Hạng ưu tiên bị loại bỏ. Nếu đang có cam kết Priority Tier cho Haiku 4.5, cần lập kế hoạch năng lực riêng khi chuyển đổi.
Thinking block bị giới hạn theo tài khoản. Chúng chỉ hoạt động trong tài khoản tạo ra block hoặc tài khoản được liên kết. Phát lại hội thoại đã lưu từ tài khoản khác sẽ không giữ được reasoning đó.
Cache rẻ hơn và bắt đầu từ prompt ngắn hơn. Ngưỡng cache giảm từ 4.096 xuống 512 token. Những system prompt ngắn không đủ điều kiện cache ở Haiku 4.5 giờ có thể được cache.
Những gì đã được cải thiện
Các số liệu dưới đây do Anthropic báo cáo với Haiku 5.5 ở mức effort tối đa; Artificial Analysis đã chạy độc lập GDPval-AA và AA-Briefcase.
| Bài kiểm tra hiệu năng | Haiku 4.5 | Haiku 5.5 |
|---|---|---|
| GDPval-AA v2.1 (Elo) | 735 | 1620 |
| AA-Briefcase v1.1 (Elo) | 614 | 1578 |
| OSWorld 2.1, tập con ngoại tuyến | 15.7% | 72.4% |
| Kỳ thi cuối cùng của nhân loại, có tool | 18.7% | 57.4% |
| Terminal-Bench 4.0 | 0.0% | 39.2% |
| SWE-bench Đa ngôn ngữ | 67.4% | 83.7% |
| Phân tích biểu đồ, không tool | 6.4% | 46.4% |
Haiku 4.5 chạy Terminal-Bench với ngân sách thinking cố định 63.999 token. Ở effort: "medium" mặc định, Haiku 5.5 đạt 1277 điểm trên GDPval-AA, vẫn cao hơn đáng kể so với 4.5. Box đã báo cáo điểm số cao hơn 11 điểm so với Haiku 4.5 với độ trễ chỉ bằng một nửa.
Xem bảng chi tiết tại các bài kiểm tra hiệu năng của Claude Haiku 5.5.
Anthropic vẫn định vị Sonnet 5.5 và Opus 5.5 là lựa chọn phù hợp hơn cho coding agent phức tạp. Haiku 5.5 nhắm đến các workload như:
- Phân loại
- Trích xuất dữ liệu
- Tóm tắt và nén nội dung
- Sub-agent
- Browser use
Về chi phí, Anthropic cho biết Haiku 5.5 rẻ hơn trung bình khoảng 75%. Con số này kết hợp mức giảm 90% với request đến 100K token, mức giảm 50% với request dài hơn, đồng thời đã tính đến token bổ sung từ tokenizer mới. System prompt cho tool use cũng giảm từ 496 xuống 286 token khi dùng tool_choice: "auto".
Xem các tình huống tính chi phí tại giá của Claude Haiku 5.5.
Kiểm tra migration trong Apidog
Trong Apidog, tạo một project với ba request lưu sẵn tới https://api.anthropic.com/v1/messages.
Thiết lập ba request như sau:
-
Cơ sở: request Haiku 4.5 hiện tại. Xác nhận status
200. -
Payload cũ, model mới: chỉ đổi
modelthànhclaude-haiku-5-5. Xác nhận status400. Lưu một bản sao cho từng lỗi migration phát hiện được. -
Đã di chuyển: request đã sửa. Xác nhận:
- Status
200 -
stop_reasonkhông phảirefusalhoặcmax_tokens - Có text block được tìm bằng
type, không dựa vào vị trí trong mảngcontent
- Status
Lưu ANTHROPIC_API_KEY thành biến môi trường và dùng biến này trong header:
x-api-key: {{ANTHROPIC_API_KEY}}
anthropic-version: 2023-06-01
So sánh usage.input_tokens giữa request cơ sở và request đã di chuyển để đo tác động của tokenizer mới lên prompt thực tế của bạn.
Sau đó, lưu bộ request này thành test scenario. Nếu ai đó vô tình thêm lại temperature, test sẽ thất bại trong CI thay vì gây lỗi 400 ở production.
Xem phần thiết lập request cơ bản trong cách sử dụng Claude Haiku 5.5 API.
Nếu làm việc trong Claude Code, bạn có thể chạy:
/claude-api migrate this project to claude-haiku-5-5
Lệnh này áp dụng model ID mới, sửa các tham số liên quan và cung cấp checklist. Lưu ý: alias haiku chỉ phân giải thành Haiku 5.5 trên Anthropic API. Xem thêm Claude Haiku 5.5 trong Claude Code.
Câu hỏi thường gặp
Claude Haiku 4.5 có bị ngừng hỗ trợ không?
Không. Mô hình vẫn được liệt kê là Hoạt động, không có ngày ngừng hỗ trợ và thời điểm ngừng hoạt động không sớm hơn ngày 15 tháng 10 năm 2026.
Tại sao request Haiku 4.5 trả về lỗi 400 trên Haiku 5.5?
Kiểm tra năm điểm: budget_tokens, temperature/top_p/top_k, assistant prefill, computer_20250124, và thay đổi lịch sử trước thinking block.
Haiku 5.5 có rẻ hơn Haiku 4.5 cho prompt dài không?
Có. Với prompt vượt 100K token, Haiku 5.5 có giá 0,50 USD/2,50 USD trên mỗi triệu token đầu vào/đầu ra, bằng một nửa mức 1 USD/5 USD của Haiku 4.5. Haiku 4.5 cũng không xử lý được prompt vượt 200K token.
Có nên chuyển toàn bộ workload sang Haiku 5.5 không?
Với phân loại, trích xuất và sub-agent, hãy benchmark workload thực tế trước rồi mới chuyển. Bạn cũng có thể so sánh với đối thủ gần nhất trong Haiku 5.5 so với GPT-6 Luna.
Bước tiếp theo
Lưu request Haiku 4.5 hiện tại cạnh phiên bản Haiku 5.5 tương đương. Xác nhận request cũ lỗi 400 khi chỉ đổi model ID, sửa lần lượt từng incompatibility, rồi chỉ chuyển traffic sau khi request đã di chuyển vượt qua test suite.
Tải xuống Apidog để xây dựng và tự động hóa cặp kiểm thử này.
Originally published by Dev.to AI. Aggregated on AIWithGhost for educational purposes — full credit and traffic to the original publisher.