Dev.to AI 🤖 Ai 👁 0 📖 9 min read

Claude Haiku 5.5 vs Haiku 4.5 : Nouveautés et ruptures à corriger en priorité

Claude Haiku 5.5 (claude-haiku-5-5, sorti le 7 octobre 2026) réduit de 90 % le coût des invites allant jusqu’à 100 000 jetons par rapport à Haiku 4.5 : 0,10 $/0,50 $ par million de jetons d’entrée/sortie, contre 1 $/5 $.

Claude Haiku 5.5 vs Haiku 4.5 : Nouveautés et ruptures à corriger en priorité

Claude Haiku 5.5 (claude-haiku-5-5, sorti le 7 octobre 2026) réduit de 90 % le coût des invites allant jusqu’à 100 000 jetons par rapport à Haiku 4.5 : 0,10 $/0,50 $ par million de jetons d’entrée/sortie, contre 1 $/5 $. Il étend aussi la fenêtre contextuelle de 200 000 à 1 million de jetons et affiche de meilleurs scores sur les benchmarks de lancement communs. En contrepartie, plusieurs requêtes compatibles avec Haiku 4.5 renvoient une erreur 400 sur 5.5, tandis que d’autres changements modifient silencieusement les réponses et les coûts.

Essayez Apidog dès aujourd’hui

Ce guide fournit les différences de requête, les JSON avant/après, les changements silencieux et un plan de test dans Apidog. Consultez aussi la fiche technique : qu’est-ce que Claude Haiku 5.5. Si votre application utilise encore l’ancien modèle, reportez-vous au guide de l’API Claude Haiku 4.5.

Haiku 4.5 vs Haiku 5.5 en un coup d’œil

Claude Haiku 4.5 Claude Haiku 5.5
ID du modèle (API Claude) claude-haiku-4-5-20251001 claude-haiku-5-5
Contexte / sortie max 200K / 64K 1M / 128K
Entrée / sortie par MJetons 1 $ / 5 $ 0,10 $ / 0,50 $ jusqu’à 100 000 jetons ; 0,50 $ / 2,50 $ au-delà
Lecture cache / écriture 5 min par MJetons 0,10 $ / 1,25 $ 0,01 $ / 0,125 $ jusqu’à 100K ; 0,05 $ / 0,625 $ au-delà
Entrée / sortie par lot par MJetons 0,50 $ / 2,50 $ 0,05 $ / 0,25 $ jusqu’à 100K ; 0,25 $ / 1,25 $ au-delà
Réflexion budget_tokens manuel Adaptative uniquement, activée par défaut
Niveaux d’effort Aucun low, medium (par défaut), high, xhigh, max
Invite minimale cachable 4 096 jetons 512 jetons
Tokeniseur Ancien Environ 30 % de jetons en plus pour le même texte
Échantillonnage non par défaut / préremplissage Accepté Erreur 400
Niveau de priorité Pris en charge Non pris en charge
Statut Actif, retrait pas avant le 15 oct. 2026 Actif, retrait pas avant le 7 oct. 2027

Haiku 4.5 n’est pas encore obsolète. La page d’obsolescence des modèles le liste comme actif, sans date d’obsolescence. Les limites de débit sont identiques pour les deux modèles.

Les cinq changements majeurs

Les cas suivants fonctionnaient avec Haiku 4.5 mais produisent une erreur 400 avec Haiku 5.5. Référez-vous également au guide de migration Haiku 5.5.

1. Remplacer budget_tokens par la réflexion adaptative

Haiku 5.5 rejette un budget de réflexion fixe. Utilisez la réflexion adaptative et pilotez le comportement avec output_config.effort.

// Avant : Haiku 4.5
{
  "model": "claude-haiku-4-5-20251001",
  "max_tokens": 16000,
  "thinking": { "type": "enabled", "budget_tokens": 8000 },
  "messages": [
    { "role": "user", "content": "Classify this ticket." }
  ]
}

// Après : Haiku 5.5
{
  "model": "claude-haiku-5-5",
  "max_tokens": 16000,
  "thinking": { "type": "adaptive" },
  "output_config": { "effort": "medium" },
  "messages": [
    { "role": "user", "content": "Classify this ticket." }
  ]
}

Pour limiter le raisonnement, réduisez l’effort au lieu de définir un budget. Vous pouvez désactiver la réflexion avec thinking: { "type": "disabled" }, mais uniquement avec un effort high ou inférieur. Les niveaux xhigh et max avec réflexion désactivée renvoient une erreur 400.

2. Supprimer les paramètres d’échantillonnage

Supprimez temperature, top_p et top_k de vos requêtes migrées.

Les seules valeurs acceptées sont :

  • temperature: 1
  • top_p: 0.99

Toute autre valeur renvoie une erreur 400, y compris top_p: 1, tout top_k, ou l’envoi simultané de temperature et top_p.

// Avant : Haiku 4.5
{
  "model": "claude-haiku-4-5-20251001",
  "max_tokens": 1024,
  "temperature": 0.2,
  "top_k": 40,
  "messages": [
    { "role": "user", "content": "Extract the order ID." }
  ]
}

// Après : Haiku 5.5
{
  "model": "claude-haiku-5-5",
  "max_tokens": 1024,
  "messages": [
    { "role": "user", "content": "Extract the order ID." }
  ]
}

Si vous utilisiez une température faible pour stabiliser le format, explicitez cette contrainte dans votre prompt.

3. Supprimer le préremplissage de l’assistant

Haiku 5.5 rejette un dernier message assistant utilisé pour amorcer ou compléter une réponse. Votre tableau messages doit se terminer par un tour utilisateur.

// Avant : Haiku 4.5
{
  "model": "claude-haiku-4-5-20251001",
  "max_tokens": 1024,
  "messages": [
    { "role": "user", "content": "Return the sentiment as JSON." },
    { "role": "assistant", "content": "{\"sentiment\": \"" }
  ]
}

// Après : Haiku 5.5
{
  "model": "claude-haiku-5-5",
  "max_tokens": 1024,
  "system": "Reply with only a JSON object. No preamble.",
  "messages": [
    { "role": "user", "content": "Return the sentiment as JSON." }
  ]
}

Pour des sorties strictes, utilisez les sorties structurées ou un outil avec des champs d’énumération pour les tâches de classification.

4. Migrer l’utilisation de l’ordinateur vers computer_toolset_20260801

Sur l’API Claude et Google Cloud, Haiku 5.5 prend en charge l’utilisation de l’ordinateur via le nouvel ensemble d’outils uniquement.

Actions à appliquer :

  1. Remplacez computer_20250124 par computer_toolset_20260801.
  2. Supprimez l’en-tête bêta computer-use-2025-01-24.
  3. Supprimez fine-grained-tool-streaming-2025-05-14 s’il est présent : il renvoie une erreur 400 avec un ensemble d’outils.
// Avant : Haiku 4.5
// En-tête : anthropic-beta: computer-use-2025-01-24
{
  "model": "claude-haiku-4-5-20251001",
  "max_tokens": 4096,
  "tools": [
    {
      "type": "computer_20250124",
      "name": "computer",
      "display_width_px": 1280,
      "display_height_px": 800
    }
  ],
  "messages": [
    { "role": "user", "content": "Open the settings page." }
  ]
}

// Après : Haiku 5.5
// Aucun en-tête bêta
{
  "model": "claude-haiku-5-5",
  "max_tokens": 4096,
  "tools": [
    { "type": "computer_toolset_20260801" }
  ],
  "messages": [
    { "role": "user", "content": "Open the settings page." }
  ]
}

Mettez également à jour votre boucle d’agent :

  • dispatchez les appels d’outils avec name et toolset_name de chaque bloc tool_use ;
  • n’utilisez plus input.action comme clé de routage ;
  • renvoyez toolset_name dans les résultats d’outil.

Haiku 5.5 ajoute également l’outil de navigateur browser_toolset_20260801, non pris en charge par Haiku 4.5. Consultez l’utilisation de l’ordinateur avec Claude Code pour une vue d’ensemble.

5. Ne modifiez pas l’historique avant un bloc de réflexion

Un bloc de réflexion Haiku 5.5 reste valide uniquement si tout le contenu qui le précède est strictement identique. Modifier system, tools ou un message antérieur, puis renvoyer le bloc de réflexion, produit une erreur 400.

// Incorrect : système modifié + bloc de réflexion rejoué = 400
{
  "model": "claude-haiku-5-5",
  "max_tokens": 4096,
  "system": "You are a billing agent. Be brief.",
  "messages": [
    { "role": "user", "content": "Why was I charged twice?" },
    {
      "role": "assistant",
      "content": [
        {
          "type": "thinking",
          "thinking": "",
          "signature": "<from turn 1>"
        },
        { "type": "text", "text": "Checking." }
      ]
    },
    { "role": "user", "content": "Order 4412." }
  ]
}

// Correct : historique inchangé, instruction ajoutée au nouveau tour
{
  "model": "claude-haiku-5-5",
  "max_tokens": 4096,
  "system": "You are a billing agent.",
  "messages": [
    { "role": "user", "content": "Why was I charged twice?" },
    {
      "role": "assistant",
      "content": [
        {
          "type": "thinking",
          "thinking": "",
          "signature": "<from turn 1>"
        },
        { "type": "text", "text": "Checking." }
      ]
    },
    { "role": "user", "content": "Order 4412. Be brief." }
  ]
}

Pour les comptes créés avant le 31 août 2026 à 00:00 UTC, cette erreur n’apparaît que si la requête définit thinking.block_binding.prefix_mismatch_behavior.

Changements silencieux à tester

Même si la requête renvoie un statut 200, vérifiez les comportements suivants.

  • Champ thinking vide par défaut : les blocs de réflexion contiennent un champ thinking vide et une signature. Haiku 4.5 renvoyait une réflexion résumée. Pour l’afficher ou l’enregistrer, définissez :
  {
    "thinking": {
      "type": "adaptive",
      "display": "summarized"
    }
  }
  • La réponse peut commencer par un bloc de réflexion : recherchez les blocs content par leur champ type, jamais par leur position dans le tableau.

  • Environ 30 % de jetons en plus : recomptez vos prompts. Les jetons de réflexion sont inclus dans max_tokens, ce qui peut provoquer stop_reason: "max_tokens" avant toute sortie texte.

  • tool_choice forcé ignore la réflexion : any ou un outil nommé fonctionne, mais la réponse débute par un appel d’outil sans bloc thinking. Pour laisser le modèle raisonner avant l’appel, utilisez :

  {
    "tool_choice": { "type": "auto" }
  }

Puis précisez dans le prompt quand l’outil doit être appelé.

  • Nouveaux refus sans repli automatique : les classificateurs de sécurité cyber, frontier_llm, bio et general_harms peuvent retourner stop_reason: "refusal". Une nouvelle tentative produit généralement le même résultat.

  • Niveau de priorité supprimé : si vous avez un engagement de priorité pour Haiku 4.5, prévoyez la capacité séparément pour Haiku 5.5.

  • Blocs de réflexion liés au compte : ils fonctionnent uniquement dans le compte qui les a produits, ou dans un compte lié. Rejouer une conversation depuis un autre compte perd ce raisonnement.

  • Mise en cache plus accessible : le seuil d’invite cachable descend de 4 096 à 512 jetons. Des prompts système auparavant trop courts peuvent maintenant bénéficier du cache.

Ce qui s’est amélioré

Les chiffres suivants sont rapportés par Anthropic pour Haiku 5.5 avec l’effort maximal. Artificial Analysis a exécuté GDPval-AA et AA-Briefcase indépendamment.

Benchmark Haiku 4.5 Haiku 5.5
GDPval-AA v2.1 (Elo) 735 1620
AA-Briefcase v1.1 (Elo) 614 1578
OSWorld 2.1, sous-ensemble hors ligne 15,7 % 72,4 %
Le dernier examen de l’humanité, avec outils 18,7 % 57,4 %
Terminal-Bench 4.0 0,0 % 39,2 %
SWE-bench Multilingue 67,4 % 83,7 %
Cartographie, sans outils 6,4 % 46,4 %

L’exécution Terminal-Bench de Haiku 4.5 utilisait un budget de réflexion fixe de 63 999 jetons. Avec l’effort medium par défaut, Haiku 5.5 a obtenu 1277 sur GDPval-AA, toujours bien au-dessus de Haiku 4.5.

Box a rapporté des scores supérieurs de 11 points à ceux de Haiku 4.5 pour environ la moitié de la latence. Consultez les benchmarks de Claude Haiku 5.5 pour les tableaux complets.

Anthropic positionne toujours Sonnet 5.5 et Opus 5.5 comme de meilleurs choix pour le codage agentique complexe. Haiku 5.5 vise notamment :

  • la classification ;
  • l’extraction ;
  • la summarisation ;
  • la compaction ;
  • les sous-agents ;
  • l’utilisation du navigateur.

Côté coût, Anthropic indique que Haiku 5.5 est en moyenne environ 75 % moins cher. Cette estimation combine une baisse de 90 % jusqu’à 100 000 jetons et de 50 % au-delà, tout en tenant compte du nouveau tokeniseur. Le prompt système d’utilisation des outils passe aussi de 496 à 286 jetons avec tool_choice: "auto".

Pour les calculs détaillés, consultez la tarification de Claude Haiku 5.5.

Testez la migration dans Apidog

Dans Apidog, créez trois requêtes enregistrées vers https://api.anthropic.com/v1/messages.

Configuration de requêtes dans Apidog

  1. Référence

    Utilisez votre corps Haiku 4.5 actuel et vérifiez un statut 200.

  2. Ancien corps, nouveau modèle

    Changez uniquement model vers claude-haiku-5-5. Vérifiez un statut 400. Gardez une requête de test par changement majeur détecté.

  3. Requête migrée

    Appliquez les corrections nécessaires, puis vérifiez :

    • un statut 200 ;
    • un stop_reason différent de refusal et max_tokens ;
    • la présence d’un bloc texte détecté avec type: "text".

Stockez ANTHROPIC_API_KEY comme variable d’environnement et référencez-la dans l’en-tête x-api-key :

{{ANTHROPIC_API_KEY}}

Ajoutez également l’en-tête :

anthropic-version: 2023-06-01

Comparez usage.input_tokens entre la requête de référence et la requête migrée afin de mesurer l’effet du tokeniseur sur vos prompts réels. Enregistrez ensuite l’ensemble sous forme de scénario de test : si quelqu’un réintroduit temperature, l’exécution échoue avant la production.

Les requêtes de base sont disponibles dans comment utiliser l’API Claude Haiku 5.5.

Si vous utilisez Claude Code, exécutez :

/claude-api migrate this project to claude-haiku-5-5

La commande applique l’échange d’ID de modèle et les corrections de paramètres, puis fournit une liste de contrôle. Notez que l’alias haiku pointe vers Haiku 5.5 uniquement via l’API Anthropic. Consultez Claude Haiku 5.5 dans Claude Code.

FAQ

Claude Haiku 4.5 est-il obsolète ?

Non. Il est listé comme actif, sans date d’obsolescence, et son retrait n’est pas prévu avant le 15 octobre 2026.

Pourquoi ma requête Haiku 4.5 renvoie-t-elle une erreur 400 sur Haiku 5.5 ?

Vérifiez successivement :

  • budget_tokens ;
  • temperature, top_p ou top_k ;
  • un préremplissage de l’assistant ;
  • computer_20250124 ;
  • une modification de l’historique précédant un bloc de réflexion.

Ce sont les cinq causes majeures d’erreur 400 lors de la migration.

Haiku 5.5 est-il moins cher que Haiku 4.5 pour les longues invites ?

Oui. Au-delà de 100 000 jetons, Haiku 5.5 coûte 0,50 $/2,50 $ par million de jetons, contre 1 $/5 $ pour Haiku 4.5. Haiku 4.5 ne peut pas traiter des invites dépassant 200 000 jetons.

Dois-je tout migrer vers Haiku 5.5 ?

Pour les charges de classification, d’extraction et de sous-agents, commencez par un test comparatif sur vos propres prompts et jeux de données. Vous pouvez aussi le comparer à son concurrent le plus proche dans Haiku 5.5 vs GPT-6 Luna.

Étape suivante

Enregistrez votre requête Haiku 4.5 et son équivalent Haiku 5.5 côte à côte. Vérifiez d’abord l’erreur 400 avec l’ancien corps, corrigez chaque incompatibilité, puis basculez le trafic une fois les assertions de la requête migrée validées.

Téléchargez Apidog pour construire cette paire de tests.

📰 Read the original article on Dev.to AI

Originally published by Dev.to AI. Aggregated on AIWithGhost for educational purposes — full credit and traffic to the original publisher.