GPT in Claude Code per Proxy: wo es bricht
claude-codegpt-modelsllm-proxy
Wie man das überhaupt anschließt
Claude Code kann auf externe GPT-Modelle über einen Anthropic-kompatiblen Proxy ausgerichtet werden: Für das Tool selbst sieht das wie ein normaler Anthropic-Endpunkt aus, während der Proxy die Anfragen an OpenAI oder einen anderen Anbieter übersetzt. In der offiziellen Anthropic-Dokumentation zu Claude Code passt das in zwei Mechanismen: die Netzwerk-Proxy-Variablen HTTP_PROXY und HTTPS_PROXY sowie das LLM-Gateway-Muster.
Der typische Aufbau ist einfach: Ein lokaler oder Gateway-Proxy wird gestartet, dann erhält Claude Code ANTHROPIC_BASE_URL und ein Token wie ANTHROPIC_AUTH_TOKEN oder ANTHROPIC_API_KEY. Das LiteLLM-Tutorial beschreibt genau diesen Ablauf: Proxy mit litellm --config starten, Anthropic-Format-Kompatibilität prüfen und dann claude ausführen.
Auf dem Papier sieht das nicht nach einem schmutzigen Hack aus. Claude Code muss nicht wissen, dass hinter dem Proxy GPT, Gemini, ein OpenRouter-ähnliches Backend oder ein anderer Router sitzt. Die ganze Magie und der ganze Schmerz liegen in der Übersetzungsschicht: Nachrichten, Tool-Aufrufe, Streaming, Antwortstruktur, Modell-Routing.
Besonders interessant sind Community-Szenarien mit Subagenten. In Reddit-Diskussionen versuchen Leute, einzelne Agenten auf verschiedene Modelle zu mappen, zum Beispiel einen Code-Reviewer auf gpt-4o und einen Datenanalysten auf o3. Das ist nicht mehr nur ein Modellwechsel, sondern der Versuch, das Verhalten eines agentischen Tools mit fremden Komponenten neu zusammenzusetzen.
Wo es anfängt, schiefzulaufen
Das Hauptrisiko liegt nicht darin, dass der Proxy nicht antwortet, sondern dass er fast richtig antwortet. Für einen normalen Chat reicht das, aber Claude Code verlässt sich stark auf Tool-Calling, Streaming-Ausgabe und das korrekte Verständnis von Zwischenergebnissen.
Wenn Anthropic-style Tools mit Verlusten in das Format eines anderen Anbieters übersetzt werden, kann der Agent anfangen, im Kreis zu laufen. Daher die Beschwerden über Subagenten-Spam: Das Modell oder der Proxy lösen immer wieder Delegierungen aus, anstatt die Aufgabe abzuschließen. Im gelieferten Reddit-Kontext ist das ein von der Community berichtetes Verhalten, kein offiziell dokumentierter Claude-Code-Bug.
Ich würde zuerst nicht auf die Qualität der endgültigen Antwort schauen, sondern auf die Spur: Welche Tool-Aufrufe gehen tatsächlich raus, wie kommen die Ergebnisse zurück, wird der Kontext abgeschnitten, bricht das Streaming ab? Agentisches Coden stirbt normalerweise nicht schön, sondern durch kleine Desynchronisationen.
Praktisches Fazit ohne Romantik
Ein Proxy für GPT in Claude Code macht als Ingenieursexperiment oder als Möglichkeit, Gateway-Routing einzubinden, Sinn, aber die Stabilität wird vom schwächsten Formatübersetzer bestimmt. LiteLLM, Bifrost, Kong AI Proxy und GitHub-Proxy-Projekte lösen ein ähnliches Problem, aber ihre Grenzfälle werden unterschiedlich sein.
Es gewinnt nicht das Backend, dessen Modell im Vakuum klüger ist, sondern dasjenige, das das Anthropic-Verhalten für Claude Code besser nachahmt. Wenn Subagenten zu spammen beginnen, ist das fast immer ein Signal nicht für einen einzigen schlechten Prompt, sondern für eine Reibung zwischen der agentischen Logik von Claude Code und der fremden Modellsemantik. Genau dieser Punkt bleibt der nervenaufreibendste im ganzen Aufbau.