SovrGPT Dokumentation

KI-Coding in der IDE: Cline, Continue, Kilo Code & Co.

OpenAI-kompatible API für Cline, Continue, Kilo Code, Roo Code, Zed und Aider: Basis-URL, Schlüssel, Modell-IDs und fertige Konfiguration je Werkzeug.

SovrGPT bietet eine OpenAI-kompatible API. Jedes Coding-Werkzeug, das eine eigene Basis-URL akzeptiert, arbeitet damit mit offenen Modellen in europäischen Rechenzentren. Ihre Anfragen gehen an keinen US-Modellanbieter wie OpenAI, Anthropic oder Google.

Sie brauchen drei Angaben:

  • Basis-URL: https://sovrgpt.com/api/v1
  • API-Schlüssel: Format sov_…, anzulegen unter Einstellungen → API-Keys mit Scope chat. Gesendet wird er als Authorization: Bearer sov_….
  • Modell-ID: qwen3.6-35b-a3b für agentisches Arbeiten oder ein Modell ohne Kaltstart aus der Tabelle unten.

Empfohlene Modelle

Modell-IDBetriebKontextKaltstartWofür
qwen3.6-35b-a3bselbst betrieben, EU131kgemessen 7–9 minVorgabe für Agenten: mehrstufige Aufgaben, Werkzeugketten, Umbauten über mehrere Dateien
stackit-qwen3.6-27bDeutschland (STACKIT)131kkeinersofortige Antworten im Editor
tensorx-kimi-k2.7-codeeuropäisches Partner-Rechenzentrum (Irland/Finnland)131kkeinerschwere agentische Läufe; denkt immer mit

Welche Modelle Ihre Organisation nutzen darf, liefert GET /v1/models, jeweils mit context_window, effort_levels und cold_start_hint.

Nehmen Sie für Agenten ein Modell mit mindestens 131k Kontext. Clines Systemprompt allein belegt rund 11.700 Token, OpenHands verlangt mindestens 22.000. Dazu kommt der Verlauf: ab etwa Zug 30 liegen 25.000–35.000 Token je Anfrage an. Mit 32k Kontext kompaktiert das Werkzeug ständig, und der Agent scheint den Faden zu verlieren.

Kaltstart und Timeout

Selbst betriebene Modelle laufen auf gemieteten GPU-Servern, die im Leerlauf abschalten. Die erste Anfrage nach einer Pause wartet deshalb mehrere Minuten, danach kommen Antworten in Sekunden. Viele Plugins brechen vorher ab, und der Fehler sieht dann aus wie ein defekter Server.

  • Stellen Sie den Timeout Ihres Plugins auf mindestens 900 Sekunden. Die meisten Clients brechen ab Werk nach 60–120 Sekunden ab.
  • Oder nehmen Sie ein Modell ohne Kaltstart: stackit-qwen3.6-27b oder tensorx-kimi-k2.7-code.

Einrichtung je Werkzeug

Kilo Code

Kilo Code läuft in VS Code, JetBrains und auf der Kommandozeile, steht unter MIT-Lizenz und hat eine deutsche Oberfläche. Es lädt die Modellliste selbst von GET /v1/models, Sie tippen also keine Modell-IDs ab.

Settings → Providers → OpenAI Compatible

FeldWert
Base URLhttps://sovrgpt.com/api/v1
API Keysov_…
Modelaus der Liste wählen, z. B. qwen3.6-35b-a3b

Als Datei geht es auch: kilo.jsonc hat dasselbe Format wie opencode.json weiter unten. Schalten Sie vor dem ersten Lauf die Telemetrie ab und legen Sie die Freigaben fest.

Cline und Roo Code (VS Code)

API Provider → OpenAI Compatible

FeldWert
Base URLhttps://sovrgpt.com/api/v1
API Keysov_…
Model IDqwen3.6-35b-a3b
Context Window131072
Max Output Tokens8192

Die letzten beiden Felder müssen Sie von Hand setzen, denn bei einem selbst eingetragenen Anbieter erkennen Cline und Roo das Kontextfenster nicht. Ist der Wert zu groß, kommt irgendwann max_tokens must be less than: max_context_length - input_tokens. Ist er zu klein, kompaktiert das Werkzeug ohne Not.

Continue

~/.continue/config.yaml:

models:
  - name: SovrGPT Coder mini
    provider: openai
    model: qwen3.6-35b-a3b
    apiBase: https://sovrgpt.com/api/v1
    apiKey: sov_...

Continue wartet ab Werk bis zu zwei Stunden auf eine Antwort (requestOptions.timeout, in Sekunden). Ein Kaltstart passt da hinein, Sie müssen nichts einstellen.

OpenCode

opencode.json:

{
  "provider": {
    "sovrgpt": {
      "npm": "@ai-sdk/openai-compatible",
      "options": {
        "baseURL": "https://sovrgpt.com/api/v1",
        "apiKey": "sov_..."
      },
      "models": {
        "qwen3.6-35b-a3b": { "name": "SovrGPT Coder mini" },
        "stackit-qwen3.6-27b": { "name": "SovrGPT · STACKIT (kein Kaltstart)" }
      }
    }
  }
}

Zed

settings.json:

{
  "language_models": {
    "openai_compatible": {
      "SovrGPT": {
        "api_url": "https://sovrgpt.com/api/v1",
        "available_models": [
          { "name": "qwen3.6-35b-a3b", "max_tokens": 131072 }
        ]
      }
    }
  }
}

Den Schlüssel tragen Sie in den Anbieter-Einstellungen von Zed ein, nicht in die settings.json.

Aider

export OPENAI_API_BASE=https://sovrgpt.com/api/v1
export OPENAI_API_KEY=sov_...
aider --model openai/qwen3.6-35b-a3b

Aider braucht kein Tool-Calling, es arbeitet mit Diff-Formaten. Laut eigener Doku verlieren die meisten Modelle ohnehin „above about 25k tokens“ den Faden.

Qwen Code (Kommandozeile)

~/.qwen/.env:

OPENAI_API_KEY=sov_...
OPENAI_BASE_URL=https://sovrgpt.com/api/v1
OPENAI_MODEL=qwen3.6-35b-a3b
QWEN_CODE_LANG=de

QWEN_CODE_LANG=de stellt die Oberfläche auf Deutsch. Ab Werk steht Qwen Code auf dem Freigabemodus auto, siehe Freigaben.

goose

OPENAI_HOST=https://sovrgpt.com
OPENAI_BASE_PATH=api/v1/chat/completions
OPENAI_API_KEY=sov_...

OPENAI_HOST ist nur die Wurzeladresse, der Pfad gehört in OPENAI_BASE_PATH. Ein 404 heißt fast immer, dass hier etwas nicht stimmt. Den Schlüssel liest goose nicht aus der config.yaml, er muss als Umgebungsvariable gesetzt sein. Ab Werk arbeitet goose autonom, siehe Freigaben.

Theia

In den Einstellungen (settings.json):

{
  "ai-features.openAiCustom.customOpenAiModels": [
    {
      "model": "qwen3.6-35b-a3b",
      "url": "https://sovrgpt.com/api/v1",
      "id": "sovrgpt-coder",
      "apiKey": "sov_...",
      "developerMessageSettings": "system"
    }
  ]
}

OpenHands

Modell openai/qwen3.6-35b-a3b, Base URL https://sovrgpt.com/api/v1, API-Schlüssel sov_…. Tragen Sie das Kontextfenster mit ein: OpenHands nennt 22.000 Token als Minimum und warnt, dass bei der Vorgabe von 4096 „not even the system prompt will fit“.

Cursor

Cursor nimmt unter Settings → Models eine eigene OpenAI Base URL an. Tragen Sie https://sovrgpt.com/api/v1 und den sov_…-Schlüssel ein und ergänzen Sie die Modell-ID von Hand.

Einschränkung: Tab-Vervollständigung und Indexierung laufen über Cursors eigene Server, egal welches Modell Sie wählen. Bei SovrGPT kommen nur Chat- und Agentenanfragen an. Wenn alles über SovrGPT laufen soll, nehmen Sie Cline, Continue, Zed oder OpenCode; dort ist die Basis-URL die einzige Adresse, die das Plugin kennt.

Claude Code und Codex CLI

Beide lassen sich heute nicht anbinden. Claude Code spricht nur das Anthropic-Protokoll, Codex CLI nur die Responses-API (wire_api = "responses"). SovrGPT bietet die OpenAI-kompatible Chat-Completions-Schnittstelle, aber weder eine Anthropic-kompatible Route noch /v1/responses.

Telemetrie abschalten

Ihre Modellanfragen gehen an SovrGPT. Mehrere Werkzeuge bauen daneben ab Werk eigene Verbindungen nach außen auf:

WerkzeugWas ab Werk läuftAbschalten
Kilo Codeeigenes Telemetrie-Paketin den Einstellungen deaktivieren
OpenCodeSitzungen können geteilt werden"share": "disabled" in opencode.json
ForgeTracker ist anFORGE_TRACKER=false
Prime AgentTelemetrietelemetry.enabled = false
CursorTab-Vervollständigung und Indexierung über Cursors eigene Servernicht abschaltbar

Die Liste ist nicht vollständig, und die Schalter heißen je nach Version anders. Wenn es rechtlich darauf ankommt, prüfen Sie zusätzlich zu den Einstellungen die Netzwerkverbindungen Ihrer Installation.

Freigaben festlegen

Drei der genannten Werkzeuge schreiben ab Werk Dateien und führen Befehle aus, ohne zu fragen:

WerkzeugWerkseinstellung
goosearbeitet autonom
Qwen CodeFreigabemodus auto
Cline (Kommandozeile)führt automatisch aus

Für OpenCode und Kilo Code legen Sie das in der Konfiguration fest:

{
  "permission": {
    "*": "ask",
    "read": "allow",
    "grep": "allow",
    "glob": "allow"
  },
  "share": "disabled"
}

Lesen, Suchen und Dateilisten laufen damit durch, alles Schreibende fragt nach. Im Unternehmen legen Sie dieselbe Datei unter %ProgramData%\opencode (Windows) bzw. /etc/opencode/ (Linux/macOS) ab. Dort kann der Nutzer sie nicht überschreiben, Basis-URL und Freigaben sind damit verbindlich vorgegeben.

Denkaufwand pro Anfrage (reasoning_effort)

Das OpenAI-Feld reasoning_effort (low | medium | high) nehmen wir auf oberster Ebene an, im Python-SDK über extra_body. Die Übersetzung in den Parameter des jeweiligen Modells übernimmt SovrGPT. Ob ein Modell den Wert auswertet, steht in effort_levels von GET /v1/models. Ein leeres Array heißt: Für dieses Modell haben wir keinen wirksamen abgestuften Regler gemessen.

Modelleffort_levelsWirkung
qwen3.6-35b-a3blow, medium, highDenkbudget 128 / 512 / unbegrenzt Token; bei high rund 14-mal so viel Denken wie bei low
stackit-qwen3.6-27b(leer)Denken über chat_template_kwargs.enable_thinking ein- und ausschalten
tensorx-kimi-k2.7-code(leer)denkt immer mit, nicht abschaltbar

Erhöhen Sie bei high auch max_tokens, denn der Gedankengang zählt gegen das Antwortbudget. Mit unbegrenztem Denkbudget und max_tokens 2000 blieb der Antworttext an qwen3.6-35b-a3b leer.

Zurückgezogene Modell-IDs

qwen3-coder-next-fp8 und deepseek-v4-flash gibt es nicht mehr. Eine Anfrage mit einer dieser IDs endet mit HTTP 404 und dem Code model_withdrawn (siehe Chat Completions). Tragen Sie stattdessen qwen3.6-35b-a3b ein; DeepSeek V4 Flash gibt es ohne Kaltstart als tensorx-deepseek-v4-flash. Die Rollennamen coder, coding, qwen-coder und qwen3-coder zeigen bereits auf qwen3.6-35b-a3b.

Code-Kontext und Gedächtnis: prom.codes

Neben dem Modell zählt, was der Agent über Ihr Repository weiß. prom.codes ist eine eigenständige Plattform aus demselben Haus wie SovrGPT, gehostet in Europa. Sie liefert per MCP Code-Kontext (semantische Suche, Symbolgraph, Referenzen) und ein Gedächtnis, in dem Agenten Fakten, Entscheidungen und Konventionen über Sitzungen hinweg behalten. Beides funktioniert auch einzeln.

Grenzen

  • Keine Inline-Vervollständigung: Es gibt keinen FIM-Endpunkt (fill-in-the-middle), also keinen „Ghost Text“ im Editor. Chat und agentisches Arbeiten funktionieren.
  • usage.cached_tokens ist immer 0. Das ist eine Lücke der Inferenz-Software. Werkzeuge, die daraus eine Cache-Quote oder Kosten schätzen, zeigen an dieser Stelle falsche Werte.

Geprüft haben wir die Anbindung (Basis-URL, Schlüssel, Modellliste), Werkzeugaufrufe auch im Streaming, die Kaltstartzeiten und den Denkregler. Nicht geprüft ist ein langer, mehrstufiger Agentenlauf mit einem dieser Werkzeuge. Probleme wie Endlosschleifen, ein verlorenes Werkzeugergebnis oder erschöpfter Kontext zeigen sich meist erst ab etwa Zug 10. Wie gut ein Agent mit unseren Modellen über viele Schritte arbeitet, ist damit offen. Für eine Beschaffung messen wir Ihren Fall auf Anfrage.

Verwandt: Modelle · API-Referenz · MCP-Server

KI-Coding in der IDE: Cline, Continue, Kilo Code & Co.