Dev.to AI πŸ€– Ai πŸ‘ 0 πŸ“– 6 min read

Claude Haiku 5.5 Benchmark

Claude Haiku 5.5 mencetak 72,4% pada OSWorld 2.1, 1620 pada GDPval-AA v2.1, 46,4% pada FrontierCode 1.1, dan 39,2% pada Terminal-Bench 4.0. Haiku 4.5 mencetak 15,7%, 735, dan 0,0% pada tiga tolok ukur tersebut. Semua ang

Claude Haiku 5.5 mencetak 72,4% pada OSWorld 2.1, 1620 pada GDPval-AA v2.1, 46,4% pada FrontierCode 1.1, dan 39,2% pada Terminal-Bench 4.0. Haiku 4.5 mencetak 15,7%, 735, dan 0,0% pada tiga tolok ukur tersebut. Semua angka ini menggunakan upaya maksimal; pada upaya standar medium, GDPval-AA turun menjadi 1277. Belum ada laboratorium independen yang menerbitkan hasil Haiku 5.5.

Coba Apidog hari ini

Artikel ini merangkum setiap tolok ukur Claude Haiku 5.5, pihak yang menjalankannya, dampak pengaturan upaya terhadap skor dan biaya, serta cara mengujinya pada lalu lintas Anda sendiri di Apidog. Untuk spesifikasi dan harga, mulai dari apa itu Claude Haiku 5.5.

Tabel peluncuran

Setiap hasil Haiku 5.5 di bawah menggunakan pemikiran adaptif pada upaya maksimal, biasanya dirata-ratakan dari lima percobaan. Terminal-Bench menggunakan sepuluh percobaan per tugas. n/r berarti tidak ada hasil yang diterbitkan.

Tolok ukur Haiku 5.5 Haiku 4.5 GPT-6 Luna Sonnet 5.5
GDPval-AA v2.1 (Elo) 1620 735 1437 1840
AA-Briefcase v1.1 (Elo) 1578 614 1336 1824
OSWorld 2.1, subset offline 72,4% 15,7% 48,9% 83,9%
Ujian Terakhir Manusia, tanpa alat 45,9% 10,2% n/r 56,9%
Ujian Terakhir Manusia, dengan alat 57,4% 18,7% n/r 64,5%
Terminal-Bench 4.0 39,2% 0,0% 16,4% 70,6%
FrontierCode 1.1 (Utama) 46,4% n/r 42,4% 52,1% (sangat tinggi)
Kartografi, tanpa alat 46,4% 6,4% 29,1% 61,6%

Siapa yang menjalankan setiap tolok ukur

Anthropic menjalankan sebagian besar pengujian sendiri. Baris lintas vendor dapat memakai nama tolok ukur yang sama, tetapi tidak selalu menggunakan harness atau pengaturan upaya yang identik.

Tolok ukur Siapa yang menjalankannya Kondisi
GDPval-AA v2.1, AA-Briefcase v1.1 Artificial Analysis, secara independen GDPval-AA: 220 tugas, 44 pekerjaan, Elo dijangkarkan ke DeepSeek V4.1 Flash (maks) pada 1600; Briefcase: proyek multi-minggu
FrontierCode 1.1 Cognition Claude di Claude Code, GPT di Codex; Utama = 100 tugas tersulit dari 150
Kartografi Anthropic, pada tolok ukur Surge AI Penilai Gemini 3.5 Flash; skor Luna dari Surge AI
Terminal-Bench 4.0 Anthropic Claude Code --bare, 66 tugas, 10 percobaan masing-masing, pengamanan aktif
OSWorld 2.1 Anthropic 82 dari 108 tugas, 1080p, hingga 500 langkah
Ujian Terakhir Manusia Anthropic Anggaran tugas 980K token, penilai Opus 4.6

Dua skor GPT-6 Luna memerlukan konteks:

  • Anthropic menjalankan skor OSWorld Luna melalui API OpenAI pada 82 tugas yang sama.
  • Terminal-Bench Luna 16,4% berasal dari papan peringkat publik menggunakan Codex CLI pada upaya maksimal.
  • Pada Terminal-Bench, pengamanan menghentikan 1,8% percobaan Haiku 5.5 atau 12 dari 660 percobaan. Setiap percobaan tersebut dihitung sebagai kegagalan.

Jebakan FrontierCode

Tabel peluncuran membandingkan Haiku 5.5 pada maks (46,4%) dengan Sonnet 5.5 pada sangat tinggi (52,1%), yaitu skor terbaik Sonnet. Kartu sistem menyediakan angka yang lebih sebanding:

FrontierCode 1.1 Utama Diperluas
Haiku 5.5, maks 46,4% 58,4%
Haiku 5.5, sangat tinggi 45,8% n/r
Sonnet 5.5, maks 46,2% 59,1%
Sonnet 5.5, sangat tinggi 52,1% 64,4%

Pada upaya maksimal yang sama, Haiku 5.5 sedikit mengungguli Sonnet 5.5 pada subset Utama: 46,4% versus 46,2%.

Namun, pada konfigurasi terbaik masing-masing model, Sonnet memimpin 5,7 poin. Saat mengutip hasil FrontierCode, selalu sertakan tingkat upaya yang digunakan.

Tambahan dari kartu sistem

Kartu sistem menambahkan beberapa hasil yang tidak ada pada postingan peluncuran. Semua menggunakan upaya maksimal, kecuali jika disebutkan lain.

Tolok ukur Haiku 5.5 Haiku 4.5 Sonnet 5.5
SWE-Bench Pro 64,8 n/r 81,3
SWE-bench Multilingual 83,7 67,4 90,3
SWE-bench Multimodal 30,7 19,8 54,3
OSWorld 2.1, tingkat kelulusan ketat 37,1% n/r 48,8%
Kartografi, dengan alat 86,2% 8,8% 90,2%
OfficeQA / OfficeQA Pro 73,5% / 60,3% 63,0% / 47,1% 76,9% / 65,6%
HealthBench Profesional, disesuaikan panjang 64,8% 32,2% 69,2%

Skor OSWorld 72,4% mencakup kredit parsial; hanya 37,1% tugas yang lulus sepenuhnya. Pada Kartografi, penggunaan alat menaikkan skor Haiku 5.5 dari 46,4% menjadi 86,2%, sehingga alat penting untuk tugas berbasis grafik.

Skor upaya standar lebih rendah

Haiku 5.5 menggunakan medium secara default pada API Claude dan Claude Code. Kartu sistem melaporkan hasil berikut untuk upaya standar:

Tolok ukur Menengah (standar) Maks Catatan
GDPval-AA v2.1 1277 1620 Menengah menggunakan sekitar sepersepuluh token output maks
AA-Briefcase v1.1 1372 1578 Menengah menggunakan kurang dari seperempat token output maks
HealthBench Profesional 59,9% 64,8% Rendah 57,9%, tinggi 61,3%

Jika Anda memanggil API tanpa output_config.effort, harapkan hasil yang mendekati kolom medium. Dokumentasi effort mencakup kelima tingkat upaya.

Skor dan biaya berdasarkan upaya

Data berikut berasal dari grafik peluncuran. Biaya OSWorld dan Terminal-Bench adalah biaya per percobaan, sedangkan GDPval-AA adalah biaya per tugas.

Model β€” OSWorld 2.1 Rendah Menengah Tinggi Sangat tinggi Maks
Haiku 5.5 42,0% ($0.07) 53,3% ($0.13) 61,3% ($0.18) 67,6% ($0.28) 72,4% ($0.61)
Sonnet 5.5 57,9% ($0.68) 66,0% ($0.93) 73,2% ($1.38) 81,1% ($2.22) 83,9% ($5.73)
GPT-6 Luna 19,2% ($0.04) 37,5% ($0.13) 42,3% ($0.14) 44,8% ($0.17) 48,9% ($0.21)
Model β€” GDPval-AA v2.1 Rendah Menengah Tinggi Sangat tinggi Maks
Haiku 5.5 1125 ($0.012) 1277 ($0.030) 1420 ($0.089) 1513 ($0.27) 1620 ($0.87)
Sonnet 5.5 1179 ($0.22) 1324 ($0.27) 1551 ($0.62) 1731 ($1.88) 1840 ($6.78)
GPT-6 Luna 1036 ($0.004) 1262 ($0.02) 1344 ($0.03) 1364 ($0.05) 1437 ($0.09)
Model β€” Terminal-Bench 4.0 Rendah Menengah Tinggi Sangat tinggi Maks
Haiku 5.5 12,7% ($0.42) 20,3% ($0.68) 24,8% ($1.04) 31,5% ($1.75) 39,2% ($2.64)
Sonnet 5.5 20,0% ($0.62) 28,8% ($0.68) 43,0% ($1.46) 61,5% ($4.34) 70,6% ($10.44)

Poin praktis dari tabel tersebut:

  • Upaya maksimal mahal untuk peningkatan terakhir. Pada GDPval-AA, maks menggunakan sekitar 28 kali biaya medium untuk tambahan 343 Elo. Pada OSWorld, maks menghabiskan lebih dari dua kali biaya sangat tinggi untuk tambahan 4,8 poin.
  • Haiku 5.5 pada medium mengalahkan Luna pada maks di OSWorld: 53,3% dengan $0.13, dibandingkan 48,9% dengan $0.21.
  • Haiku 5.5 pada maks mengalahkan Sonnet 5.5 pada medium di OSWorld: 72,4% dengan $0.61, dibandingkan 66,0% dengan $0.93.
  • Terminal-Bench adalah pengecualian: Sonnet 5.5 pada tinggi mencapai 43,0% dengan $1.46, lebih baik daripada Haiku 5.5 pada maks yang mencapai 39,2% dengan $2.64.

Luna lebih murah pada setiap tingkat upaya yang setara, kecuali biaya medium OSWorld yang hampir sama. Untuk perbandingan lebih rinci, lihat Haiku 5.5 vs GPT-6 Luna.

Biaya menggunakan harga daftar: $0.10/$0.50 per juta token untuk prompt hingga 100K token, dan lebih tinggi untuk konteks di atas batas tersebut. Lihat rincian harga.

Di mana Haiku 5.5 masih tertinggal

Sonnet 5.5 memimpin setiap baris pada tabel peluncuran. Satu-satunya kemenangan head-to-head Haiku adalah FrontierCode pada upaya maksimal yang sama.

Kesenjangan terbesar terlihat pada:

  • Terminal-Bench 4.0: 39,2% vs 70,6%.
  • SWE-Bench Pro: 64,8 vs 81,3.
  • SWE-bench Multimodal: 30,7 vs 54,3.

Anthropic juga menyatakan bahwa Sonnet 5.5 dan Opus 5.5 tetap lebih baik untuk tugas pengkodean agen yang kompleks. Haiku 5.5 lebih cocok untuk pekerjaan dengan cakupan sempit, seperti:

  • Pemadatan konteks
  • Peringkasan
  • Klasifikasi
  • Penggunaan browser
  • Sub-agen di bawah model yang lebih besar

Untuk pola sub-agen yang lebih murah, lihat Haiku 5.5 di Claude Code.

Hasil independen belum ada

Per 8 Oktober 2026, belum ada laboratorium independen yang menerbitkan hasil Haiku 5.5.

Halaman Haiku 5.5 Artificial Analysis mengembalikan 404, sementara papan peringkat Artificial Analysis hanya mencantumkan Claude 4.5 Haiku. Vals, LMArena, SWE-bench, dan Aider juga belum menampilkan hasil Haiku 5.5.

Tidak ada angka kecepatan pihak ketiga. Anthropic menyebut Haiku 5.5 sebagai β€œmodel tercepat hingga saat ini” pada kecepatan standar, tetapi lebih lambat dari Opus dalam Mode Cepat.

Angka eksternal terdekat datang dari Cursor. Dokumentasi model Cursor menyebut Haiku 5.5 mencetak 48,4% pada CursorBench dengan upaya maksimal, naik dari 30,9% pada low.

Dengan pemikiran dimatikan, Cursor melaporkan skor 22,1% hingga 26,2%. Ketika pemikiran diaktifkan, skor menjadi 30,9% hingga 42,3% pada tingkat upaya yang sama.

Apa yang dilaporkan pelanggan

Data berikut berasal dari postingan peluncuran Anthropic dan belum diverifikasi secara independen:

  • HubSpot: rata-rata 92,8% dari tiga percobaan pada suite portal CRM simulasi mereka.
  • AlphaSense: 0,84 dibanding 0,76 untuk Haiku 4.5 pada 400 kueri Tanya dalam Dokumen.
  • Box: 11 poin lebih tinggi daripada Haiku 4.5 dengan sekitar setengah latensi dalam pengujian awal.
  • Asana: latensi lebih dari 30% lebih rendah untuk penyelesaian tugas dibandingkan model saat ini.
  • Cognition: Devin Fusion mencapai skor FrontierCode 66,2 dengan Haiku 5.5 sebagai rekan dan Opus 5.5 sebagai pemimpin. Ini adalah sistem dua model, bukan hasil Haiku saja.

Jalankan evaluasi Anda sendiri

Tolok ukur publik tidak akan identik dengan lalu lintas produksi Anda. Panduan prompt Anthropic menyarankan penggunaan xhigh atau maks hanya jika evaluasi Anda menunjukkan peningkatan yang nyata. Jalankan evaluasi yang sama pada Sonnet 5.5 sebagai pembanding.

Gunakan alur berikut di Apidog:

  1. Simpan ANTHROPIC_API_KEY sebagai variabel lingkungan.
  2. Buat koleksi berisi 20 hingga 50 prompt nyata sebagai permintaan Messages API.
  3. Tambahkan assertion untuk:
    • Status 200
    • stop_reason bukan "max_tokens" atau "refusal"
    • Konten wajib yang harus ada pada jawaban benar
  4. Jalankan koleksi pada low, medium, dan high.
  5. Catat tingkat kelulusan dan jumlah token di objek usage.
  6. Duplikat koleksi, ganti model menjadi claude-sonnet-5-5, lalu bandingkan hasilnya dalam proyek yang sama.

Mengubah pengaturan effort membatalkan cache prompt. Tokenizer baru juga menghasilkan sekitar 30% lebih banyak token dibandingkan Haiku 4.5 untuk teks yang sama.

Contoh permintaan API:

curl https://api.anthropic.com/v1/messages \
  -H "x-api-key: $ANTHROPIC_API_KEY" \
  -H "anthropic-version: 2023-06-01" \
  -H "content-type: application/json" \
  -d '{
    "model": "claude-haiku-5-5",
    "max_tokens": 8000,
    "thinking": {"type": "adaptive"},
    "output_config": {"effort": "medium"},
    "messages": [
      {
        "role": "user",
        "content": "Classify this support ticket as billing, bug or feature request: ..."
      }
    ]
  }'

Jangan mengirim temperature, top_p, top_k, atau prefill asisten. Masing-masing akan mengembalikan HTTP 400 pada Haiku 5.5.

Saat memproses respons, pilih blok berdasarkan nilai type, karena blok thinking dapat muncul sebelum blok jawaban. Lihat panduan API Claude Haiku 5.5 dan pengujian aplikasi LLM.

FAQ

Apakah Claude Haiku 5.5 lebih baik dari Sonnet 5.5?

Tidak berdasarkan angka Anthropic. Sonnet 5.5 memimpin setiap baris pada tabel peluncuran. Haiku hanya sedikit unggul di FrontierCode ketika keduanya menggunakan upaya maksimal: 46,4% vs 46,2%. Lihat Haiku 5.5 vs Haiku 4.5 untuk perbandingan peningkatan.

Berapa skor SWE-bench Haiku 5.5?

Haiku 5.5 mencetak 64,8 pada SWE-Bench Pro, 83,7 pada SWE-bench Multilingual, dan 30,7 pada SWE-bench Multimodal. Semuanya menggunakan upaya maksimal.

Pada upaya berapa tolok ukur dijalankan?

Biasanya pada maks, dengan rata-rata lima percobaan. Standar API adalah medium, di mana GDPval-AA menghasilkan 1277, bukan 1620.

Apakah ada tolok ukur Haiku 5.5 independen?

Belum. Artificial Analysis menjalankan GDPval-AA dan AA-Briefcase secara independen, tetapi Anthropic yang menerbitkan skor tersebut. Artificial Analysis belum memiliki halaman Haiku 5.5.

Apakah GPT-6 Luna lebih murah?

Biasanya, ya. Luna memiliki biaya lebih rendah pada setiap tingkat GDPval-AA dan setiap tingkat OSWorld kecuali medium, ketika biaya keduanya hampir sama. Namun, Haiku 5.5 menghasilkan skor lebih tinggi pada kedua tolok ukur tersebut.

Langkah selanjutnya

Mulai dari medium, lalu naikkan effort hanya jika peningkatan tingkat kelulusan sepadan dengan biayanya.

Unduh Apidog, buat koleksi evaluasi Anda, lalu simpan hasil Haiku dan baseline Sonnet 5.5 di Apidog sebelum mengalihkan lalu lintas produksi.

πŸ“° Read the original article on Dev.to AI

Originally published by Dev.to AI. Aggregated on AIWithGhost for educational purposes β€” full credit and traffic to the original publisher.