Dev.to AI 🤖 Ai 👁 0 📖 13 min read

So sánh Claude Haiku 5.5 và 4.5: Có gì mới và lỗi nghiêm trọng cần sửa ngay

Claude Haiku 5.5 (claude-haiku-5-5, phát hành ngày 7 tháng 10 năm 2026) giảm 90% chi phí so với Haiku 4.5 cho lời nhắc tối đa 100K token (0,10 USD/0,50 USD trên mỗi triệu token đầu vào/đầu ra so với 1 USD/5 USD). Mô hình

So sánh Claude Haiku 5.5 và 4.5: Có gì mới và lỗi nghiêm trọng cần sửa ngay

Claude Haiku 5.5 (claude-haiku-5-5, phát hành ngày 7 tháng 10 năm 2026) giảm 90% chi phí so với Haiku 4.5 cho lời nhắc tối đa 100K token (0,10 USD/0,50 USD trên mỗi triệu token đầu vào/đầu ra so với 1 USD/5 USD). Mô hình này tăng cửa sổ ngữ cảnh từ 200K lên 1M token và đạt điểm cao hơn trong các bài kiểm tra hiệu năng được công bố cho cả hai phiên bản. Tuy nhiên, việc nâng cấp không chỉ là đổi model: năm cấu trúc request từng hoạt động trên 4.5 sẽ trả về lỗi 400 trên 5.5, trong khi một số thay đổi khác có thể âm thầm ảnh hưởng phản hồi và chi phí.

Dùng thử Apidog ngay hôm nay

Bài viết này cung cấp bảng so sánh, JSON trước/sau cho từng thay đổi gây lỗi, các thay đổi ngầm cần kiểm tra và quy trình xác thực migration trong Apidog. Xem Claude Haiku 5.5 là gì để đọc thông số đầy đủ, hoặc tham khảo hướng dẫn API Claude Haiku 4.5 nếu hệ thống của bạn vẫn dùng phiên bản cũ.

Haiku 4.5 so với Haiku 5.5: tổng quan

Claude Haiku 4.5 Claude Haiku 5.5
ID mô hình (Claude API) claude-haiku-4-5-20251001 claude-haiku-5-5
Ngữ cảnh / đầu ra tối đa 200K / 64K 1M / 128K
Đầu vào / đầu ra trên mỗi MTok $1 / $5 $0.10 / $0.50 cho lời nhắc đến 100K token; $0.50 / $2.50 cho hơn 100K
Đọc cache / ghi cache 5 phút trên mỗi MTok $0.10 / $1.25 $0.01 / $0.125 đến 100K; $0.05 / $0.625 cho hơn 100K
Đầu vào / đầu ra batch trên mỗi MTok $0.50 / $2.50 $0.05 / $0.25 đến 100K; $0.25 / $1.25 cho hơn 100K
Suy nghĩ budget_tokens thủ công Chỉ adaptive, mặc định bật
Mức độ nỗ lực Không có low, medium (mặc định), high, xhigh, max
Lời nhắc tối thiểu có thể cache 4.096 token 512 token
Tokenizer Cũ hơn Khoảng 30% nhiều token hơn cho cùng văn bản
Tham số sampling không mặc định, prefill Được chấp nhận Lỗi 400
Hạng ưu tiên Được hỗ trợ Không được hỗ trợ
Trạng thái Hoạt động, không ngừng hoạt động trước 15/10/2026 Hoạt động, không ngừng hoạt động trước 07/10/2027

Haiku 4.5 chưa bị ngừng hỗ trợ. Trang ngừng hỗ trợ mô hình vẫn liệt kê phiên bản này là Hoạt động và không có ngày ngừng hỗ trợ. Bạn có thể lập kế hoạch migration theo tiến độ riêng; giới hạn tốc độ không thay đổi giữa hai phiên bản.

Năm thay đổi gây lỗi 400

Hãy chạy kiểm tra từng mục dưới đây trước khi đổi model ID trong production. Theo hướng dẫn di chuyển Haiku 5.5, mỗi cấu trúc sau đều trả về lỗi 400 trên Haiku 5.5 dù từng hoạt động trên Haiku 4.5.

1. Thay budget_tokens bằng adaptive thinking

Haiku 5.5 chỉ hỗ trợ suy nghĩ thích ứng. Request chứa ngân sách suy nghĩ cố định sẽ bị từ chối.

// Trước: Haiku 4.5
{
  "model": "claude-haiku-4-5-20251001",
  "max_tokens": 16000,
  "thinking": { "type": "enabled", "budget_tokens": 8000 },
  "messages": [
    { "role": "user", "content": "Classify this ticket." }
  ]
}

// Sau: Haiku 5.5
{
  "model": "claude-haiku-5-5",
  "max_tokens": 16000,
  "thinking": { "type": "adaptive" },
  "output_config": { "effort": "medium" },
  "messages": [
    { "role": "user", "content": "Classify this ticket." }
  ]
}

Dùng output_config.effort để kiểm soát mức suy luận:

  • Nếu trước đây dùng budget_tokens thấp, bắt đầu với effort: "low".
  • Dùng medium làm cấu hình mặc định.
  • Chỉ tăng lên high, xhigh hoặc max sau khi đo chất lượng và chi phí thực tế.
  • Bạn vẫn có thể gửi thinking: {"type": "disabled"}, nhưng chỉ khi effort là high trở xuống. Kết hợp với xhigh hoặc max sẽ trả về lỗi 400.

2. Loại bỏ tham số sampling không được hỗ trợ

Xóa temperature, top_p và top_k khỏi request migration. Haiku 5.5 chỉ chấp nhận temperature: 1 hoặc top_p: 0.99; mọi giá trị khác đều lỗi 400.

Các trường hợp lỗi bao gồm:

  • temperature khác 1
  • top_p khác 0.99, kể cả top_p: 1
  • Bất kỳ giá trị top_k nào
  • Gửi đồng thời temperature và top_p
// Trước: Haiku 4.5
{
  "model": "claude-haiku-4-5-20251001",
  "max_tokens": 1024,
  "temperature": 0.2,
  "top_k": 40,
  "messages": [
    { "role": "user", "content": "Extract the order ID." }
  ]
}

// Sau: Haiku 5.5
{
  "model": "claude-haiku-5-5",
  "max_tokens": 1024,
  "messages": [
    { "role": "user", "content": "Extract the order ID." }
  ]
}

Nếu bạn từng giảm temperature để ổn định đầu ra, hãy chuyển yêu cầu đó vào prompt, ví dụ: “Trả về đúng một đối tượng JSON, không thêm diễn giải.”

3. Bỏ assistant prefill

Haiku 5.5 không chấp nhận lượt assistant cuối cùng dùng để tiền điền câu trả lời, kể cả khi thinking bị tắt. Mảng messages phải kết thúc bằng lượt user.

// Trước: Haiku 4.5
{
  "model": "claude-haiku-4-5-20251001",
  "max_tokens": 1024,
  "messages": [
    { "role": "user", "content": "Return the sentiment as JSON." },
    { "role": "assistant", "content": "{\"sentiment\": \"" }
  ]
}

// Sau: Haiku 5.5
{
  "model": "claude-haiku-5-5",
  "max_tokens": 1024,
  "system": "Reply with only a JSON object. No preamble.",
  "messages": [
    { "role": "user", "content": "Return the sentiment as JSON." }
  ]
}

Với đầu ra nghiêm ngặt, ưu tiên structured outputs hoặc tool có trường enum thay vì dựa vào prefill.

4. Đổi computer_20250124 sang computer_toolset_20260801

Trên Claude API và Google Cloud, Haiku 5.5 chỉ hỗ trợ computer use qua toolset mới.

Thực hiện đồng thời các bước sau:

  1. Đổi computer_20250124 thành computer_toolset_20260801.
  2. Xóa header beta computer-use-2025-01-24.
  3. Xóa fine-grained-tool-streaming-2025-05-14 nếu đang gửi cùng toolset mới, vì tổ hợp này gây lỗi 400.
// Trước: Haiku 4.5
// Header: anthropic-beta: computer-use-2025-01-24
{
  "model": "claude-haiku-4-5-20251001",
  "max_tokens": 4096,
  "tools": [
    {
      "type": "computer_20250124",
      "name": "computer",
      "display_width_px": 1280,
      "display_height_px": 800
    }
  ],
  "messages": [
    { "role": "user", "content": "Open the settings page." }
  ]
}

// Sau: Haiku 5.5
// Không có beta header
{
  "model": "claude-haiku-5-5",
  "max_tokens": 4096,
  "tools": [
    { "type": "computer_toolset_20260801" }
  ],
  "messages": [
    { "role": "user", "content": "Open the settings page." }
  ]
}

Cập nhật cả vòng lặp agent:

  • Phân phối tool result theo name và toolset_name của từng khối tool_use.
  • Không còn phân phối theo input.action.
  • Lặp lại toolset_name trong tool result.
  • Haiku 5.5 cũng hỗ trợ browser toolset qua browser_toolset_20260801, trong khi Haiku 4.5 không hỗ trợ.

Xem thêm Sử dụng máy tính trong Claude Code để có tổng quan về computer use.

5. Không chỉnh sửa lịch sử trước một thinking block

Một thinking block của Haiku 5.5 chỉ hợp lệ nếu toàn bộ dữ liệu gửi trước đó giữ nguyên. Nếu bạn thay đổi system, tools hoặc một message cũ rồi gửi lại thinking block, request sẽ lỗi 400.

// Trước: system đã bị chỉnh sửa + thinking block phát lại = 400
{
  "model": "claude-haiku-5-5",
  "max_tokens": 4096,
  "system": "You are a billing agent. Be brief.",
  "messages": [
    { "role": "user", "content": "Why was I charged twice?" },
    {
      "role": "assistant",
      "content": [
        {
          "type": "thinking",
          "thinking": "",
          "signature": "<from turn 1>"
        },
        { "type": "text", "text": "Checking." }
      ]
    },
    { "role": "user", "content": "Order 4412." }
  ]
}

// Sau: giữ nguyên lịch sử, đưa chỉ dẫn mới vào message mới
{
  "model": "claude-haiku-5-5",
  "max_tokens": 4096,
  "system": "You are a billing agent.",
  "messages": [
    { "role": "user", "content": "Why was I charged twice?" },
    {
      "role": "assistant",
      "content": [
        {
          "type": "thinking",
          "thinking": "",
          "signature": "<from turn 1>"
        },
        { "type": "text", "text": "Checking." }
      ]
    },
    { "role": "user", "content": "Order 4412. Be brief." }
  ]
}

Với tài khoản được tạo trước ngày 31 tháng 8 năm 2026, 00:00 UTC, lỗi này chỉ xuất hiện khi request đặt thinking.block_binding.prefix_mismatch_behavior.

Những thay đổi ngầm không gây lỗi

Các mục sau thường không gây lỗi HTTP, nhưng cần được đưa vào regression test.

  • Thinking mặc định trống. Mỗi khối thinking trả về trường thinking trống và chỉ chứa signature. Haiku 4.5 từng trả về suy nghĩ đã tóm tắt. Nếu cần ghi log hoặc hiển thị suy nghĩ, đặt:
  {
    "thinking": {
      "type": "adaptive",
      "display": "summarized"
    }
  }
  • Phản hồi có thể bắt đầu bằng thinking block. Adaptive thinking được bật mặc định. Khi parse response, tìm block theo type, không truy cập theo chỉ số cố định như content[0].

  • Cùng văn bản có thể nhiều hơn khoảng 30% token. Tokenizer mới làm tăng số token trên cùng nội dung. Đếm lại prompt thực tế của bạn; token suy nghĩ cũng tính vào max_tokens, nên giới hạn thấp có thể dẫn đến stop_reason: "max_tokens" trước khi có text output.

  • tool_choice bắt buộc sẽ bỏ qua thinking. tool_choice: {"type": "any"} hoặc chỉ định tool cụ thể vẫn hoạt động, nhưng response bắt đầu bằng tool call mà không có thinking block. Nếu cần mô hình suy luận trước, dùng:

  {
    "tool_choice": { "type": "auto" }
  }

Sau đó mô tả rõ trong prompt khi nào mô hình nên gọi tool.

  • Có thêm trường hợp từ chối. Haiku 5.5 chạy các classifier an toàn như cyber, frontier_llm, bio và general_harms, có thể trả về stop_reason: "refusal". Không có fallback phía server; retry cùng nội dung thường vẫn bị từ chối.

  • Hạng ưu tiên bị loại bỏ. Nếu đang có cam kết Priority Tier cho Haiku 4.5, cần lập kế hoạch năng lực riêng khi chuyển đổi.

  • Thinking block bị giới hạn theo tài khoản. Chúng chỉ hoạt động trong tài khoản tạo ra block hoặc tài khoản được liên kết. Phát lại hội thoại đã lưu từ tài khoản khác sẽ không giữ được reasoning đó.

  • Cache rẻ hơn và bắt đầu từ prompt ngắn hơn. Ngưỡng cache giảm từ 4.096 xuống 512 token. Những system prompt ngắn không đủ điều kiện cache ở Haiku 4.5 giờ có thể được cache.

Những gì đã được cải thiện

Các số liệu dưới đây do Anthropic báo cáo với Haiku 5.5 ở mức effort tối đa; Artificial Analysis đã chạy độc lập GDPval-AA và AA-Briefcase.

Bài kiểm tra hiệu năng Haiku 4.5 Haiku 5.5
GDPval-AA v2.1 (Elo) 735 1620
AA-Briefcase v1.1 (Elo) 614 1578
OSWorld 2.1, tập con ngoại tuyến 15.7% 72.4%
Kỳ thi cuối cùng của nhân loại, có tool 18.7% 57.4%
Terminal-Bench 4.0 0.0% 39.2%
SWE-bench Đa ngôn ngữ 67.4% 83.7%
Phân tích biểu đồ, không tool 6.4% 46.4%

Haiku 4.5 chạy Terminal-Bench với ngân sách thinking cố định 63.999 token. Ở effort: "medium" mặc định, Haiku 5.5 đạt 1277 điểm trên GDPval-AA, vẫn cao hơn đáng kể so với 4.5. Box đã báo cáo điểm số cao hơn 11 điểm so với Haiku 4.5 với độ trễ chỉ bằng một nửa.

Xem bảng chi tiết tại các bài kiểm tra hiệu năng của Claude Haiku 5.5.

Anthropic vẫn định vị Sonnet 5.5 và Opus 5.5 là lựa chọn phù hợp hơn cho coding agent phức tạp. Haiku 5.5 nhắm đến các workload như:

  • Phân loại
  • Trích xuất dữ liệu
  • Tóm tắt và nén nội dung
  • Sub-agent
  • Browser use

Về chi phí, Anthropic cho biết Haiku 5.5 rẻ hơn trung bình khoảng 75%. Con số này kết hợp mức giảm 90% với request đến 100K token, mức giảm 50% với request dài hơn, đồng thời đã tính đến token bổ sung từ tokenizer mới. System prompt cho tool use cũng giảm từ 496 xuống 286 token khi dùng tool_choice: "auto".

Xem các tình huống tính chi phí tại giá của Claude Haiku 5.5.

Kiểm tra migration trong Apidog

Trong Apidog, tạo một project với ba request lưu sẵn tới https://api.anthropic.com/v1/messages.

Giao diện Apidog để kiểm tra request Claude API

Thiết lập ba request như sau:

  1. Cơ sở: request Haiku 4.5 hiện tại. Xác nhận status 200.
  2. Payload cũ, model mới: chỉ đổi model thành claude-haiku-5-5. Xác nhận status 400. Lưu một bản sao cho từng lỗi migration phát hiện được.
  3. Đã di chuyển: request đã sửa. Xác nhận:
    • Status 200
    • stop_reason không phải refusal hoặc max_tokens
    • Có text block được tìm bằng type, không dựa vào vị trí trong mảng content

Lưu ANTHROPIC_API_KEY thành biến môi trường và dùng biến này trong header:

x-api-key: {{ANTHROPIC_API_KEY}}
anthropic-version: 2023-06-01

So sánh usage.input_tokens giữa request cơ sở và request đã di chuyển để đo tác động của tokenizer mới lên prompt thực tế của bạn.

Sau đó, lưu bộ request này thành test scenario. Nếu ai đó vô tình thêm lại temperature, test sẽ thất bại trong CI thay vì gây lỗi 400 ở production.

Xem phần thiết lập request cơ bản trong cách sử dụng Claude Haiku 5.5 API.

Nếu làm việc trong Claude Code, bạn có thể chạy:

/claude-api migrate this project to claude-haiku-5-5

Lệnh này áp dụng model ID mới, sửa các tham số liên quan và cung cấp checklist. Lưu ý: alias haiku chỉ phân giải thành Haiku 5.5 trên Anthropic API. Xem thêm Claude Haiku 5.5 trong Claude Code.

Câu hỏi thường gặp

Claude Haiku 4.5 có bị ngừng hỗ trợ không?

Không. Mô hình vẫn được liệt kê là Hoạt động, không có ngày ngừng hỗ trợ và thời điểm ngừng hoạt động không sớm hơn ngày 15 tháng 10 năm 2026.

Tại sao request Haiku 4.5 trả về lỗi 400 trên Haiku 5.5?

Kiểm tra năm điểm: budget_tokens, temperature/top_p/top_k, assistant prefill, computer_20250124, và thay đổi lịch sử trước thinking block.

Haiku 5.5 có rẻ hơn Haiku 4.5 cho prompt dài không?

Có. Với prompt vượt 100K token, Haiku 5.5 có giá 0,50 USD/2,50 USD trên mỗi triệu token đầu vào/đầu ra, bằng một nửa mức 1 USD/5 USD của Haiku 4.5. Haiku 4.5 cũng không xử lý được prompt vượt 200K token.

Có nên chuyển toàn bộ workload sang Haiku 5.5 không?

Với phân loại, trích xuất và sub-agent, hãy benchmark workload thực tế trước rồi mới chuyển. Bạn cũng có thể so sánh với đối thủ gần nhất trong Haiku 5.5 so với GPT-6 Luna.

Bước tiếp theo

Lưu request Haiku 4.5 hiện tại cạnh phiên bản Haiku 5.5 tương đương. Xác nhận request cũ lỗi 400 khi chỉ đổi model ID, sửa lần lượt từng incompatibility, rồi chỉ chuyển traffic sau khi request đã di chuyển vượt qua test suite.

Tải xuống Apidog để xây dựng và tự động hóa cặp kiểm thử này.

📰 Read the original article on Dev.to AI

Originally published by Dev.to AI. Aggregated on AIWithGhost for educational purposes — full credit and traffic to the original publisher.