Dev.to AI 🤖 Ai 👁 0 📖 8 min read

Claude Haiku 5.5 vs Haiku 4.5: Änderungen, Neuerungen und kritische Breaking Changes

Claude Haiku 5.5 (claude-haiku-5-5, veröffentlicht am 7. Oktober 2026) kostet für Prompts bis 100.000 Tokens 90 % weniger als Haiku 4.5: 0,10 $ / 0,50 $ pro Million Eingabe-/Ausgabe-Tokens statt 1 $ / 5 $. Außerdem erwei

Claude Haiku 5.5 vs Haiku 4.5: Änderungen, Neuerungen und kritische Breaking Changes

Claude Haiku 5.5 (claude-haiku-5-5, veröffentlicht am 7. Oktober 2026) kostet für Prompts bis 100.000 Tokens 90 % weniger als Haiku 4.5: 0,10 $ / 0,50 $ pro Million Eingabe-/Ausgabe-Tokens statt 1 $ / 5 $. Außerdem erweitert es das Kontextfenster von 200K auf 1M Tokens und erzielt in allen aufgeführten Start-Benchmarks deutlich höhere Werte. Der Haken: Fünf Anfrageformen, die unter 4.5 funktionierten, lösen jetzt einen 400er-Fehler aus. Weitere Änderungen beeinflussen Antworten und Kosten ohne Fehler.

Apidog noch heute ausprobieren

In diesem Beitrag erhalten Sie eine Seite-an-Seite-Tabelle, Vorher-/Nachher-JSON für jede inkompatible Änderung, eine Liste stiller Änderungen und einen Testplan für Apidog. Das vollständige Datenblatt finden Sie unter Was ist Claude Haiku 5.5?. Falls Sie noch das ältere Modell einsetzen, lesen Sie den Claude Haiku 4.5 API-Leitfaden.

Haiku 4.5 vs. Haiku 5.5 im Überblick

Claude Haiku 4.5 Claude Haiku 5.5
Modell-ID (Claude API) claude-haiku-4-5-20251001 claude-haiku-5-5
Kontext / maximale Ausgabe 200K / 64K 1M / 128K
Eingabe / Ausgabe pro MTok 1 $ / 5 $ 0,10 $ / 0,50 $ bis 100.000 Tokens; 0,50 $ / 2,50 $ darüber
Cache-Lesen / 5m-Schreiben pro MTok 0,10 $ / 1,25 $ 0,01 $ / 0,125 $ bis 100.000; 0,05 $ / 0,625 $ darüber
Batch-Eingabe / -Ausgabe pro MTok 0,50 $ / 2,50 $ 0,05 $ / 0,25 $ bis 100.000; 0,25 $ / 1,25 $ darüber
Thinking Manuelles budget_tokens Nur adaptiv, standardmäßig aktiviert
Effort-Stufen Keine low, medium (Standard), high, xhigh, max
Minimaler cachefähiger Prompt 4.096 Tokens 512 Tokens
Tokenisierer Älter Etwa 30 % mehr Tokens für denselben Text
Nicht-Standard-Sampling-Parameter, Vorbefüllung Akzeptiert 400er-Fehler
Prioritätsstufe Unterstützt Nicht unterstützt
Status Aktiv, Außerbetriebnahme nicht vor dem 15. Okt. 2026 Aktiv, Außerbetriebnahme nicht vor dem 7. Okt. 2027

Haiku 4.5 ist nicht veraltet. Die Modell-Veraltungs-Seite listet es weiterhin als aktiv ohne Verfallsdatum. Sie können daher nach Ihrem eigenen Zeitplan migrieren. Die Ratenbegrenzungen sind bei beiden Modellen gleich.

Die fünf bahnbrechenden Änderungen

Jede der folgenden Änderungen erzeugt bei Haiku 5.5 einen 400er-Fehler für einen Request-Body, der mit Haiku 4.5 noch funktioniert hat. Der Haiku-5.5-Migrationsleitfaden listet diese Änderungen ebenfalls auf.

1. Manuelles Thinking mit budget_tokens

Haiku 5.5 unterstützt ausschließlich adaptives Thinking. Ein festes Token-Budget wird abgelehnt.

// Vorher: Haiku 4.5
{
  "model": "claude-haiku-4-5-20251001",
  "max_tokens": 16000,
  "thinking": {
    "type": "enabled",
    "budget_tokens": 8000
  },
  "messages": [
    {
      "role": "user",
      "content": "Dieses Ticket klassifizieren."
    }
  ]
}

// Nachher: Haiku 5.5
{
  "model": "claude-haiku-5-5",
  "max_tokens": 16000,
  "thinking": {
    "type": "adaptive"
  },
  "output_config": {
    "effort": "medium"
  },
  "messages": [
    {
      "role": "user",
      "content": "Dieses Ticket klassifizieren."
    }
  ]
}

effort ist jetzt Ihr Steuerungshebel. Wenn Sie unter 4.5 ein kleines Thinking-Budget verwendet haben, wählen Sie eine niedrigere Effort-Stufe.

Sie können weiterhin thinking: {"type": "disabled"} senden, aber nur bis einschließlich high. Bei xhigh oder max führt deaktiviertes Thinking ebenfalls zu einem 400er-Fehler.

2. Sampling-Parameter

Entfernen Sie temperature, top_p und top_k aus migrierten Requests. Die einzigen akzeptierten Werte sind:

  • temperature: 1
  • top_p: 0.99

Jeder andere Wert erzeugt einen 400er-Fehler. Das gilt auch für:

  • top_p: 1
  • jedes top_k
  • das gleichzeitige Senden von temperature und top_p
// Vorher: Haiku 4.5
{
  "model": "claude-haiku-4-5-20251001",
  "max_tokens": 1024,
  "temperature": 0.2,
  "top_k": 40,
  "messages": [
    {
      "role": "user",
      "content": "Die Bestell-ID extrahieren."
    }
  ]
}

// Nachher: Haiku 5.5
{
  "model": "claude-haiku-5-5",
  "max_tokens": 1024,
  "messages": [
    {
      "role": "user",
      "content": "Die Bestell-ID extrahieren."
    }
  ]
}

Wenn Sie niedrige Temperatur für konsistente Ausgaben genutzt haben, formulieren Sie die gewünschte Konsistenz explizit im Prompt.

3. Assistenten-Vorbefüllung

Eine abschließende assistant-Nachricht, die das Modell fortsetzen soll, wird in Haiku 5.5 abgelehnt — auch bei deaktiviertem Thinking.

Beenden Sie messages daher immer mit einer user-Nachricht.

// Vorher: Haiku 4.5
{
  "model": "claude-haiku-4-5-20251001",
  "max_tokens": 1024,
  "messages": [
    {
      "role": "user",
      "content": "Das Sentiment als JSON zurückgeben."
    },
    {
      "role": "assistant",
      "content": "{\"sentiment\": \""
    }
  ]
}

// Nachher: Haiku 5.5
{
  "model": "claude-haiku-5-5",
  "max_tokens": 1024,
  "system": "Antworten Sie nur mit einem JSON-Objekt. Keine Präambel.",
  "messages": [
    {
      "role": "user",
      "content": "Das Sentiment als JSON zurückgeben."
    }
  ]
}

Für strikt strukturierte Antworten empfiehlt der Migrationsleitfaden strukturierte Ausgaben oder ein Tool mit Enum-Feldern für Klassifizierungen.

4. Computer Use: computer_20250124 zu computer_toolset_20260801

Auf der Claude API und in Google Cloud unterstützt Haiku 5.5 Computer Use nur über das neue Toolset.

Entfernen Sie außerdem diese Beta-Header, falls Sie sie noch setzen:

  • computer-use-2025-01-24
  • fine-grained-tool-streaming-2025-05-14

Zusammen mit dem neuen Toolset verursachen sie einen 400er-Fehler.

// Vorher: Haiku 4.5
// Header: anthropic-beta: computer-use-2025-01-24
{
  "model": "claude-haiku-4-5-20251001",
  "max_tokens": 4096,
  "tools": [
    {
      "type": "computer_20250124",
      "name": "computer",
      "display_width_px": 1280,
      "display_height_px": 800
    }
  ],
  "messages": [
    {
      "role": "user",
      "content": "Die Einstellungen-Seite öffnen."
    }
  ]
}

// Nachher: Haiku 5.5
// Kein Beta-Header
{
  "model": "claude-haiku-5-5",
  "max_tokens": 4096,
  "tools": [
    {
      "type": "computer_toolset_20260801"
    }
  ],
  "messages": [
    {
      "role": "user",
      "content": "Die Einstellungen-Seite öffnen."
    }
  ]
}

Passen Sie auch Ihre Agenten-Schleife an:

  1. Dispatchen Sie auf name und toolset_name jedes tool_use-Blocks.
  2. Verlassen Sie sich nicht mehr auf input.action.
  3. Geben Sie toolset_name in Tool-Ergebnissen zurück.

Haiku 5.5 unterstützt zusätzlich das Browser-Tool browser_toolset_20260801, das Haiku 4.5 nicht unterstützt. Weitere Hintergründe finden Sie unter Claude Code Computernutzung.

5. Frühere Züge vor einem Thinking-Block bearbeiten

Ein Thinking-Block von Haiku 5.5 bleibt nur gültig, solange alle vorherigen Eingaben unverändert bleiben.

Wenn Sie system, tools oder eine frühere Nachricht ändern und anschließend einen alten Thinking-Block erneut senden, erhalten Sie einen 400er-Fehler. Haiku 4.5 hat diese Prüfung nicht durchgeführt.

// Vorher: Bearbeitetes System + erneut gesendeter Thinking-Block = 400
{
  "model": "claude-haiku-5-5",
  "max_tokens": 4096,
  "system": "Sie sind ein Abrechnungsagent. Fassen Sie sich kurz.",
  "messages": [
    {
      "role": "user",
      "content": "Warum wurde mir doppelt berechnet?"
    },
    {
      "role": "assistant",
      "content": [
        {
          "type": "thinking",
          "thinking": "",
          "signature": "<from turn 1>"
        },
        {
          "type": "text",
          "text": "Überprüfung."
        }
      ]
    },
    {
      "role": "user",
      "content": "Bestellung 4412."
    }
  ]
}

// Nachher: Frühere Züge unverändert, neue Anweisung angehängt
{
  "model": "claude-haiku-5-5",
  "max_tokens": 4096,
  "system": "Sie sind ein Abrechnungsagent.",
  "messages": [
    {
      "role": "user",
      "content": "Warum wurde mir doppelt berechnet?"
    },
    {
      "role": "assistant",
      "content": [
        {
          "type": "thinking",
          "thinking": "",
          "signature": "<from turn 1>"
        },
        {
          "type": "text",
          "text": "Überprüfung."
        }
      ]
    },
    {
      "role": "user",
      "content": "Bestellung 4412. Fassen Sie sich kurz."
    }
  ]
}

Bei Konten, die vor dem 31. August 2026 um 00:00 UTC erstellt wurden, tritt der Fehler nur auf, wenn Requests thinking.block_binding.prefix_mismatch_behavior setzen.

Stille Änderungen, die keinen Fehler auslösen

Diese Änderungen verursachen keinen 400er-Fehler, können aber Ihre Verarbeitung, Token-Kosten und Tests beeinflussen.

  • Thinking-Feld ist standardmäßig leer. Jeder thinking-Block enthält ein leeres thinking-Feld und nur eine signature. Haiku 4.5 gab zusammenfassendes Thinking zurück. Wenn Sie Thinking protokollieren oder anzeigen möchten, setzen Sie:
  {
    "thinking": {
      "type": "adaptive",
      "display": "summarized"
    }
  }
  • Antworten können mit Thinking beginnen. Adaptives Thinking ist standardmäßig aktiv. Suchen Sie Inhaltsblöcke immer anhand von type, nicht anhand eines festen Array-Index.

  • Etwa 30 % mehr Tokens. Der neue Tokenisierer zählt denselben Text als etwa 30 % mehr Tokens. Messen Sie Ihre Prompts neu. Thinking-Tokens zählen außerdem gegen max_tokens; bei einem zu kleinen Limit kann der Request mit stop_reason: "max_tokens" enden, bevor Text ausgegeben wird.

  • Erzwungenes tool_choice überspringt Thinking. any oder ein benanntes Tool funktionieren weiterhin, aber die Antwort beginnt direkt mit dem Tool-Aufruf und enthält keinen thinking-Block. Wenn das Modell zuerst überlegen soll, verwenden Sie:

  {
    "tool_choice": {
      "type": "auto"
    }
  }

Beschreiben Sie im Prompt zusätzlich, wann das Tool verwendet werden soll.

  • Neue Ablehnungen ohne Fallback. Haiku 5.5 nutzt Sicherheitsklassifikatoren wie cyber, frontier_llm, bio und general_harms. Diese können stop_reason: "refusal" zurückgeben. Es gibt kein serverseitiges Fallback; ein erneuter Versuch führt normalerweise erneut zur Ablehnung.

  • Prioritätsstufe entfällt. Falls Sie für Haiku 4.5 eine Priority-Tier-Verpflichtung haben, planen Sie Kapazität für Haiku 5.5 separat.

  • Thinking-Blöcke sind konto-gebunden. Sie funktionieren nur im Konto, das sie erzeugt hat, oder in einem verknüpften Konto. Beim Wiedergeben gespeicherter Konversationen über ein anderes Konto geht diese Argumentation verloren.

  • Caching startet früher. Der minimale cachefähige Prompt sinkt von 4.096 auf 512 Tokens. Dadurch können kurze Systemprompts gecacht werden, die unter Haiku 4.5 nicht cachefähig waren.

Was wurde besser?

Die folgenden Werte wurden von Anthropic für Haiku 5.5 mit maximaler Effort-Stufe gemeldet. Artificial Analysis führte GDPval-AA und AA-Briefcase unabhängig durch.

Benchmark Haiku 4.5 Haiku 5.5
GDPval-AA v2.1 (Elo) 735 1620
AA-Briefcase v1.1 (Elo) 614 1578
OSWorld 2.1, Offline-Subset 15,7 % 72,4 %
Humanity’s Last Exam, mit Tools 18,7 % 57,4 %
Terminal-Bench 4.0 0,0 % 39,2 %
SWE-bench Multilingual 67,4 % 83,7 %
Chartography, ohne Tools 6,4 % 46,4 %

Der Terminal-Bench-Lauf von Haiku 4.5 verwendete ein festes Thinking-Budget von 63.999 Tokens. Mit dem Standardwert medium erreichte Haiku 5.5 bei GDPval-AA 1277 Punkte und lag damit weiterhin deutlich über Haiku 4.5.

Box meldete Ergebnisse, die 11 Punkte höher als bei Haiku 4.5 lagen, bei etwa der halben Latenz. Vollständige Tabellen finden Sie unter Claude Haiku 5.5 Benchmarks.

Anthropic positioniert Sonnet 5.5 und Opus 5.5 weiterhin als bessere Wahl für komplexe agentische Coding-Aufgaben. Haiku 5.5 zielt auf Klassifizierung, Extraktion, Zusammenfassung, Kompaktierung, Subagenten und Browser-Nutzung ab.

Bei den Kosten nennt Anthropic durchschnittlich etwa 75 % Einsparung. Diese Zahl berücksichtigt die 90 % niedrigeren Preise bis 100.000 Tokens, die 50 % niedrigeren Preise darüber sowie die zusätzlichen Tokens des neuen Tokenisierers. Der System-Prompt für Tool-Nutzung schrumpfte bei auto-Tool-Auswahl zudem von 496 auf 286 Tokens.

Ausgearbeitete Kostenbeispiele finden Sie unter Claude Haiku 5.5 Preisgestaltung.

Migration in Apidog testen

Erstellen Sie in Apidog ein Projekt mit drei gespeicherten Requests an:

https://api.anthropic.com/v1/messages

Apidog-Projekt mit API-Anfragen

  1. Baseline: Verwenden Sie Ihren aktuellen Haiku-4.5-Request-Body. Erwartung: Status 200.

  2. Alter Body, neues Modell: Ändern Sie ausschließlich model zu claude-haiku-5-5. Erwartung: Status 400. Speichern Sie für jede auftretende inkompatible Änderung eine Kopie.

  3. Migriert: Verwenden Sie den korrigierten Request-Body. Erwartung:

    • Status 200
    • stop_reason ist weder refusal noch max_tokens
    • Ein Textblock wird anhand von type gefunden

Speichern Sie ANTHROPIC_API_KEY als Umgebungsvariable und referenzieren Sie ihn im x-api-key-Header:

{{ANTHROPIC_API_KEY}}

Setzen Sie zusätzlich diesen Header:

anthropic-version: 2023-06-01

Vergleichen Sie usage.input_tokens zwischen Baseline und migriertem Request. So sehen Sie direkt, wie sich der neue Tokenisierer auf Ihre eigenen Prompts auswirkt.

Speichern Sie die Requests anschließend als Testszenario. Wenn jemand später versehentlich temperature wieder einführt, schlägt der Test fehl — statt erst die Produktion.

Die Request-Grundlagen finden Sie unter So verwenden Sie die Claude Haiku 5.5 API.

Wenn Sie mit Claude Code arbeiten, führt folgender Befehl Modell-ID-Austausch und Parameterkorrekturen durch und liefert anschließend eine Checkliste:

/claude-api migrate this project to claude-haiku-5-5

Beachten Sie: Der Alias haiku wird nur auf der Anthropic API zu Haiku 5.5 aufgelöst. Details finden Sie unter Claude Haiku 5.5 in Claude Code.

FAQ

Ist Claude Haiku 4.5 veraltet?

Nein. Es ist als aktiv ohne Verfallsdatum gelistet. Die Außerbetriebnahme erfolgt nicht vor dem 15. Oktober 2026.

Warum liefert meine Haiku-4.5-Anfrage bei Haiku 5.5 einen 400er-Fehler?

Prüfen Sie auf:

  • budget_tokens
  • temperature, top_p oder top_k
  • Assistenten-Vorbefüllung
  • computer_20250124
  • Änderungen an früheren Zügen vor einem Thinking-Block

Das sind die fünf inkompatiblen Änderungen.

Ist Haiku 5.5 für lange Prompts günstiger als Haiku 4.5?

Ja. Über 100.000 Tokens kostet Haiku 5.5 0,50 $ / 2,50 $ pro Million Tokens — halb so viel wie Haiku 4.5 mit 1 $ / 5 $. Haiku 4.5 kann außerdem keine Prompts über 200.000 Tokens verarbeiten.

Sollte ich alles auf Haiku 5.5 umstellen?

Für Klassifizierung, Extraktion und Subagenten-Aufgaben sollten Sie Haiku 5.5 zuerst testen und dann migrieren. Einen Vergleich mit dem engsten Konkurrenten finden Sie unter Haiku 5.5 vs. GPT-6 Luna.

Nächster Schritt

Speichern Sie Ihre Haiku-4.5-Anfrage neben ihrem Haiku-5.5-Zwilling. Bestätigen Sie zunächst den 400er-Fehler, beheben Sie ihn und leiten Sie den Traffic erst um, wenn die migrierte Anfrage erfolgreich ist.

Apidog herunterladen, um dieses Testpaar zu erstellen.

📰 Read the original article on Dev.to AI

Originally published by Dev.to AI. Aggregated on AIWithGhost for educational purposes — full credit and traffic to the original publisher.