Zum Hauptinhalt springen

CLI Agents

CLI-Coding-Agenten laufen im Terminal statt in einem Editor. Sie lesen und schreiben Dateien, führen Befehle aus und rufen Tools selbstständig auf, gesteuert von einem Modell deiner Wahl. Weil mittwald AI Hosting die OpenAI-API spricht, funktioniert jeder Agent, der einen eigenen OpenAI-kompatiblen Endpoint akzeptiert, damit zusammen, und dein Code samt Prompts bleibt dabei auf Infrastruktur in Deutschland.

Für Agenten, die stattdessen in einem Editor laufen, siehe IDE Integration.

Was ein Agent vom Endpoint braucht

Ein Coding-Agent braucht drei Dinge über reinen Chat hinaus, und mittwald AI Hosting bietet alle drei:

  • Einen OpenAI-kompatiblen /v1/chat/completions-Endpoint. Darauf zeigt in jedem Agenten die Einstellung baseURL oder base_url.
  • Streaming-Antworten, damit die Ausgabe entsteht, während sie generiert wird, statt am Ende in einem Block anzukommen.
  • Tool Calling. Das ist der wichtigste Punkt und der, an dem es gegen Nicht-OpenAI-Endpoints am häufigsten scheitert. Ein Agent ohne Tool Calling kann keine Datei lesen und keinen Befehl ausführen, er kann nur reden. Geprüft und funktionsfähig auf Qwen3.5-122B-A10B-FP8, Qwen3.8-27B-NVFP4, Qwen3.6-35B-A3B-FP8 und gpt-oss-120b.

Beispiele für unterstützte Agenten

Diese drei sind hier dokumentiert, weil sie vollständig gegen mittwald AI Hosting getestet wurden. Jeder Agent, den du auf einen eigenen OpenAI-kompatiblen Endpoint zeigen lassen kannst, funktioniert genauso.

AgentKonfigurationsdateiMCP-UnterstützungSkills
Hermes Agent~/.hermes/config.yamlEingebaut (hermes mcp add)Eingebaut, plus Registries
Pi~/.pi/agent/models.jsonÜber die Erweiterung pi-mcp-adapterVerzeichnis-Discovery oder --skill
opencode~/.config/opencode/opencode.jsonEingebaut (mcp-Konfigurationsblock)~/.config/opencode/skills/

Modellwahl

Alle Modelle stehen in der Dokumentation zu KI-Modellen. Für agentische Arbeit:

EinsatzzweckModellKontext
HauptmodellQwen3.5-122B-A10B-FP8245.760
Schnellere StandardwahlQwen3.8-27B-NVFP4256.000
Subagenten, günstige TurnsQwen3.6-35B-A3B-FP8256.000
Reasoning-lastige Arbeitgpt-oss-120b131.072
Routing, KlassifikationQwen3.5-0.8B262.144
Dokumente und BilderGLM-OCRsiehe Modellseite

Bildverständnis (Vision) ist nicht auf einen einzigen Eintrag hier beschränkt: Qwen3.5-122B-A10B-FP8, Qwen3.8-27B-NVFP4 und Qwen3.6-35B-A3B-FP8 akzeptieren allesamt Bildeingaben als Base64-kodierte Data-URLs, wobei Qwen3.8-27B-NVFP4 Anfragen auf 5 Bilder begrenzt.

Starte mit Qwen3.5-122B-A10B-FP8 als Hauptmodell. Unterstützt ein Agent eigene Modelle pro Subagent, setze die Subagenten auf Qwen3.6-35B-A3B-FP8 – ihre Arbeit besteht meist aus Suchen und Zusammenfassen, und das schnellere Modell hält lange Sessions reaktionsfähig.

Schnellstart

  1. AI-Hosting-API-Key holen im Bereich AI-Hosting deines mStudio-Projekts — siehe API-Key einrichten.
  2. Agenten wählen aus der Tabelle oben und dessen Seite folgen.
  3. Endpoint konfigurieren als https://llm.aihosting.mittwald.de/v1.
  4. Tool Calling prüfen, bevor die eigentliche Arbeit beginnt. Jede Anleitung enthält dafür einen Verifikationsschritt.

Kontext unter Kontrolle halten

Ein großes Kontextfenster ist kein Grund, mehr zu senden. Agenten verbrauchen Kontext am schnellsten durch Dateiinhalte und Befehlsausgaben.

  • Verweise gezielt auf einzelne Dateien und Funktionen statt auf ganze Repositories.
  • Nutze temperature bei 0,2 oder darunter für Edits und Tool Calls, damit Ergebnisse reproduzierbar bleiben.
  • Erhöhe max_tokens erst, wenn eine Antwort tatsächlich abgeschnitten wird.
  • Unterstützt der Agent Compaction oder Zusammenfassung, lass sie in langen Sessions aktiviert.

Disclaimer

Drittanbieter-Tools, MCP-Server und externe Links werden zur Vereinfachung bereitgestellt, ohne Gewährleistung oder Empfehlung. Nutze sie auf eigenes Risiko, prüfe Lizenzen und Datenschutzrichtlinien und vergib nur die nötigen Berechtigungen (Least Privilege). Sende keine sensiblen Daten an externe Services, sofern nicht nötig und erlaubt.