KI-Coding in der IDE: Cline, Continue, Kilo Code & Co.
OpenAI-kompatible API für Cline, Continue, Kilo Code, Roo Code, Zed und Aider: Basis-URL, Schlüssel, Modell-IDs und fertige Konfiguration je Werkzeug.
SovrGPT bietet eine OpenAI-kompatible API. Jedes Coding-Werkzeug, das eine eigene Basis-URL akzeptiert, arbeitet damit mit offenen Modellen in europäischen Rechenzentren. Ihre Anfragen gehen an keinen US-Modellanbieter wie OpenAI, Anthropic oder Google.
Sie brauchen drei Angaben:
- Basis-URL:
https://sovrgpt.com/api/v1 - API-Schlüssel: Format
sov_…, anzulegen unter Einstellungen → API-Keys mit Scopechat. Gesendet wird er alsAuthorization: Bearer sov_…. - Modell-ID:
qwen3.6-35b-a3bfür agentisches Arbeiten oder ein Modell ohne Kaltstart aus der Tabelle unten.
Empfohlene Modelle
| Modell-ID | Betrieb | Kontext | Kaltstart | Wofür |
|---|---|---|---|---|
qwen3.6-35b-a3b | selbst betrieben, EU | 131k | gemessen 7–9 min | Vorgabe für Agenten: mehrstufige Aufgaben, Werkzeugketten, Umbauten über mehrere Dateien |
stackit-qwen3.6-27b | Deutschland (STACKIT) | 131k | keiner | sofortige Antworten im Editor |
tensorx-kimi-k2.7-code | europäisches Partner-Rechenzentrum (Irland/Finnland) | 131k | keiner | schwere agentische Läufe; denkt immer mit |
Welche Modelle Ihre Organisation nutzen darf, liefert GET /v1/models, jeweils mit
context_window, effort_levels und cold_start_hint.
Nehmen Sie für Agenten ein Modell mit mindestens 131k Kontext. Clines Systemprompt allein belegt rund 11.700 Token, OpenHands verlangt mindestens 22.000. Dazu kommt der Verlauf: ab etwa Zug 30 liegen 25.000–35.000 Token je Anfrage an. Mit 32k Kontext kompaktiert das Werkzeug ständig, und der Agent scheint den Faden zu verlieren.
Kaltstart und Timeout
Selbst betriebene Modelle laufen auf gemieteten GPU-Servern, die im Leerlauf abschalten. Die erste Anfrage nach einer Pause wartet deshalb mehrere Minuten, danach kommen Antworten in Sekunden. Viele Plugins brechen vorher ab, und der Fehler sieht dann aus wie ein defekter Server.
- Stellen Sie den Timeout Ihres Plugins auf mindestens 900 Sekunden. Die meisten Clients brechen ab Werk nach 60–120 Sekunden ab.
- Oder nehmen Sie ein Modell ohne Kaltstart:
stackit-qwen3.6-27bodertensorx-kimi-k2.7-code.
Einrichtung je Werkzeug
Kilo Code
Kilo Code läuft in VS Code, JetBrains und auf der Kommandozeile, steht unter MIT-Lizenz und hat
eine deutsche Oberfläche. Es lädt die Modellliste selbst von GET /v1/models, Sie tippen also
keine Modell-IDs ab.
Settings → Providers → OpenAI Compatible
| Feld | Wert |
|---|---|
| Base URL | https://sovrgpt.com/api/v1 |
| API Key | sov_… |
| Model | aus der Liste wählen, z. B. qwen3.6-35b-a3b |
Als Datei geht es auch: kilo.jsonc hat dasselbe Format wie opencode.json weiter unten.
Schalten Sie vor dem ersten Lauf die Telemetrie ab und legen Sie die
Freigaben fest.
Cline und Roo Code (VS Code)
API Provider → OpenAI Compatible
| Feld | Wert |
|---|---|
| Base URL | https://sovrgpt.com/api/v1 |
| API Key | sov_… |
| Model ID | qwen3.6-35b-a3b |
| Context Window | 131072 |
| Max Output Tokens | 8192 |
Die letzten beiden Felder müssen Sie von Hand setzen, denn bei einem selbst eingetragenen
Anbieter erkennen Cline und Roo das Kontextfenster nicht. Ist der Wert zu groß, kommt irgendwann
max_tokens must be less than: max_context_length - input_tokens. Ist er zu klein, kompaktiert
das Werkzeug ohne Not.
Continue
~/.continue/config.yaml:
models:
- name: SovrGPT Coder mini
provider: openai
model: qwen3.6-35b-a3b
apiBase: https://sovrgpt.com/api/v1
apiKey: sov_...Continue wartet ab Werk bis zu zwei Stunden auf eine Antwort (requestOptions.timeout, in
Sekunden). Ein Kaltstart passt da hinein, Sie müssen nichts einstellen.
OpenCode
opencode.json:
{
"provider": {
"sovrgpt": {
"npm": "@ai-sdk/openai-compatible",
"options": {
"baseURL": "https://sovrgpt.com/api/v1",
"apiKey": "sov_..."
},
"models": {
"qwen3.6-35b-a3b": { "name": "SovrGPT Coder mini" },
"stackit-qwen3.6-27b": { "name": "SovrGPT · STACKIT (kein Kaltstart)" }
}
}
}
}Zed
settings.json:
{
"language_models": {
"openai_compatible": {
"SovrGPT": {
"api_url": "https://sovrgpt.com/api/v1",
"available_models": [
{ "name": "qwen3.6-35b-a3b", "max_tokens": 131072 }
]
}
}
}
}Den Schlüssel tragen Sie in den Anbieter-Einstellungen von Zed ein, nicht in die settings.json.
Aider
export OPENAI_API_BASE=https://sovrgpt.com/api/v1
export OPENAI_API_KEY=sov_...
aider --model openai/qwen3.6-35b-a3bAider braucht kein Tool-Calling, es arbeitet mit Diff-Formaten. Laut eigener Doku verlieren die meisten Modelle ohnehin „above about 25k tokens“ den Faden.
Qwen Code (Kommandozeile)
~/.qwen/.env:
OPENAI_API_KEY=sov_...
OPENAI_BASE_URL=https://sovrgpt.com/api/v1
OPENAI_MODEL=qwen3.6-35b-a3b
QWEN_CODE_LANG=deQWEN_CODE_LANG=de stellt die Oberfläche auf Deutsch. Ab Werk steht Qwen Code auf dem
Freigabemodus auto, siehe Freigaben.
goose
OPENAI_HOST=https://sovrgpt.com
OPENAI_BASE_PATH=api/v1/chat/completions
OPENAI_API_KEY=sov_...OPENAI_HOST ist nur die Wurzeladresse, der Pfad gehört in OPENAI_BASE_PATH. Ein 404 heißt
fast immer, dass hier etwas nicht stimmt. Den Schlüssel liest goose nicht aus der config.yaml,
er muss als Umgebungsvariable gesetzt sein. Ab Werk arbeitet goose autonom, siehe
Freigaben.
Theia
In den Einstellungen (settings.json):
{
"ai-features.openAiCustom.customOpenAiModels": [
{
"model": "qwen3.6-35b-a3b",
"url": "https://sovrgpt.com/api/v1",
"id": "sovrgpt-coder",
"apiKey": "sov_...",
"developerMessageSettings": "system"
}
]
}OpenHands
Modell openai/qwen3.6-35b-a3b, Base URL https://sovrgpt.com/api/v1, API-Schlüssel sov_….
Tragen Sie das Kontextfenster mit ein: OpenHands nennt 22.000 Token als Minimum und warnt, dass
bei der Vorgabe von 4096 „not even the system prompt will fit“.
Cursor
Cursor nimmt unter Settings → Models eine eigene OpenAI Base URL an. Tragen Sie
https://sovrgpt.com/api/v1 und den sov_…-Schlüssel ein und ergänzen Sie die Modell-ID von
Hand.
Einschränkung: Tab-Vervollständigung und Indexierung laufen über Cursors eigene Server, egal welches Modell Sie wählen. Bei SovrGPT kommen nur Chat- und Agentenanfragen an. Wenn alles über SovrGPT laufen soll, nehmen Sie Cline, Continue, Zed oder OpenCode; dort ist die Basis-URL die einzige Adresse, die das Plugin kennt.
Claude Code und Codex CLI
Beide lassen sich heute nicht anbinden. Claude Code spricht nur das Anthropic-Protokoll, Codex
CLI nur die Responses-API (wire_api = "responses"). SovrGPT bietet die OpenAI-kompatible
Chat-Completions-Schnittstelle, aber weder eine Anthropic-kompatible Route noch /v1/responses.
Telemetrie abschalten
Ihre Modellanfragen gehen an SovrGPT. Mehrere Werkzeuge bauen daneben ab Werk eigene Verbindungen nach außen auf:
| Werkzeug | Was ab Werk läuft | Abschalten |
|---|---|---|
| Kilo Code | eigenes Telemetrie-Paket | in den Einstellungen deaktivieren |
| OpenCode | Sitzungen können geteilt werden | "share": "disabled" in opencode.json |
| Forge | Tracker ist an | FORGE_TRACKER=false |
| Prime Agent | Telemetrie | telemetry.enabled = false |
| Cursor | Tab-Vervollständigung und Indexierung über Cursors eigene Server | nicht abschaltbar |
Die Liste ist nicht vollständig, und die Schalter heißen je nach Version anders. Wenn es rechtlich darauf ankommt, prüfen Sie zusätzlich zu den Einstellungen die Netzwerkverbindungen Ihrer Installation.
Freigaben festlegen
Drei der genannten Werkzeuge schreiben ab Werk Dateien und führen Befehle aus, ohne zu fragen:
| Werkzeug | Werkseinstellung |
|---|---|
| goose | arbeitet autonom |
| Qwen Code | Freigabemodus auto |
| Cline (Kommandozeile) | führt automatisch aus |
Für OpenCode und Kilo Code legen Sie das in der Konfiguration fest:
{
"permission": {
"*": "ask",
"read": "allow",
"grep": "allow",
"glob": "allow"
},
"share": "disabled"
}Lesen, Suchen und Dateilisten laufen damit durch, alles Schreibende fragt nach. Im Unternehmen
legen Sie dieselbe Datei unter %ProgramData%\opencode (Windows) bzw. /etc/opencode/
(Linux/macOS) ab. Dort kann der Nutzer sie nicht überschreiben, Basis-URL und Freigaben sind
damit verbindlich vorgegeben.
Denkaufwand pro Anfrage (reasoning_effort)
Das OpenAI-Feld reasoning_effort (low | medium | high) nehmen wir auf oberster Ebene an,
im Python-SDK über extra_body. Die Übersetzung in den Parameter des jeweiligen Modells übernimmt
SovrGPT. Ob ein Modell den Wert auswertet, steht in effort_levels von GET /v1/models. Ein
leeres Array heißt: Für dieses Modell haben wir keinen wirksamen abgestuften Regler gemessen.
| Modell | effort_levels | Wirkung |
|---|---|---|
qwen3.6-35b-a3b | low, medium, high | Denkbudget 128 / 512 / unbegrenzt Token; bei high rund 14-mal so viel Denken wie bei low |
stackit-qwen3.6-27b | (leer) | Denken über chat_template_kwargs.enable_thinking ein- und ausschalten |
tensorx-kimi-k2.7-code | (leer) | denkt immer mit, nicht abschaltbar |
Erhöhen Sie bei high auch max_tokens, denn der Gedankengang zählt gegen das Antwortbudget.
Mit unbegrenztem Denkbudget und max_tokens 2000 blieb der Antworttext an qwen3.6-35b-a3b leer.
Zurückgezogene Modell-IDs
qwen3-coder-next-fp8 und deepseek-v4-flash gibt es nicht mehr. Eine Anfrage mit einer dieser
IDs endet mit HTTP 404 und dem Code model_withdrawn (siehe
Chat Completions). Tragen Sie stattdessen qwen3.6-35b-a3b ein;
DeepSeek V4 Flash gibt es ohne Kaltstart als tensorx-deepseek-v4-flash. Die Rollennamen
coder, coding, qwen-coder und qwen3-coder zeigen bereits auf qwen3.6-35b-a3b.
Code-Kontext und Gedächtnis: prom.codes
Neben dem Modell zählt, was der Agent über Ihr Repository weiß. prom.codes ist eine eigenständige Plattform aus demselben Haus wie SovrGPT, gehostet in Europa. Sie liefert per MCP Code-Kontext (semantische Suche, Symbolgraph, Referenzen) und ein Gedächtnis, in dem Agenten Fakten, Entscheidungen und Konventionen über Sitzungen hinweg behalten. Beides funktioniert auch einzeln.
Grenzen
- Keine Inline-Vervollständigung: Es gibt keinen FIM-Endpunkt (
fill-in-the-middle), also keinen „Ghost Text“ im Editor. Chat und agentisches Arbeiten funktionieren. usage.cached_tokensist immer 0. Das ist eine Lücke der Inferenz-Software. Werkzeuge, die daraus eine Cache-Quote oder Kosten schätzen, zeigen an dieser Stelle falsche Werte.
Geprüft haben wir die Anbindung (Basis-URL, Schlüssel, Modellliste), Werkzeugaufrufe auch im Streaming, die Kaltstartzeiten und den Denkregler. Nicht geprüft ist ein langer, mehrstufiger Agentenlauf mit einem dieser Werkzeuge. Probleme wie Endlosschleifen, ein verlorenes Werkzeugergebnis oder erschöpfter Kontext zeigen sich meist erst ab etwa Zug 10. Wie gut ein Agent mit unseren Modellen über viele Schritte arbeitet, ist damit offen. Für eine Beschaffung messen wir Ihren Fall auf Anfrage.
Verwandt: Modelle · API-Referenz · MCP-Server
Decision Engine: Anwendungsfälle und Vorlagen
Decision Engine: zehn Vorlagen für Ticket-Routing, Posteingang, Leads, Behördenpost, RAG-Prüfung und KI-Agenten, mit Optionen und Regeln für den Menschen.
Excel-Add-in mit KI
Excel-Add-in mit KI von SovrGPT schreibt Formeln, formatiert und baut Tabellen direkt in Ihrer Mappe. Mit Vorschau, Freigabe und Rückgängig.