Architektur
Wie die Desktop-Laufzeit Modellaufrufe in zuverlässige Agentensitzungen verwandelt: Streaming-Schleifen, Tool-Routing, absturzsicherer Zustand, Anbieterabstraktion und Kontextverwaltung.
Der Orkas-Blog erklärt, wie Orkas als primär lokaler Open-Source-Desktop-Client KI-Agenten mit Ihren eigenen Modellschlüsseln koordiniert. Diese Entwicklungsnotizen behandeln die Agent-Harness-Laufzeit, Multi-Agenten-Orchestrierung, lokale Selbstentwicklung, Anbieter-Routing, Gedächtnis, Kontextkomprimierung und die Sicherheitsentscheidungen hinter direktem Modellverkehr zum Anbieter. Jeder Artikel dient als praktische Referenz für Entwickler, Betriebsverantwortliche und KI-Entwickler, die primär lokale KI-Agenten-Workflows bewerten.
Wie die Desktop-Laufzeit Modellaufrufe in zuverlässige Agentensitzungen verwandelt: Streaming-Schleifen, Tool-Routing, absturzsicherer Zustand, Anbieterabstraktion und Kontextverwaltung.
Wie ein leitender Agent eine Anfrage zerlegt, Unteragenten einsetzt, Kontext zwischen Schritten weitergibt und sich vom Scheitern einer Aufgabe erholt.
Warum Orkas Arbeitsbereichsdaten und Modellschlüssel auf dem Rechner des Nutzers hält und warum der Datenverkehr mit Ihrem eigenen Anbieter direkt dorthin geht statt über Orkas-Server.
Der offizielle Server ist nur für Studio verfügbar, externes Scripting war das schon immer, und der Umweg für die kostenlose Edition gilt inzwischen als unbestätigt statt als nachweislich nicht mehr funktionierend.
Hinter einem Begriff verbergen sich drei Aufgaben. Welche Teile sich wirklich automatisieren lassen, welche in menschlicher Hand bleiben und welche Belege vor jedem Schnitt nötig sind.
Ein Shop mit zwei Personen erhielt ein Angebot über $3000 plus $400 pro Monat. Was Sie dafür bekommen, was CiteScore, Otterly und AppearAI verlangen und wie Sie die Prüfung selbst an einem Nachmittag durchführen.
Dreißig Bestellungen am Tag, eine Stunde Kopieren und Einfügen. Die nützliche Variante zeigt nur die vier Zeilen, die nicht zusammenpassen.
Sieben Kontrollen, die Praktiker verlangen, bevor ein Agent ein Budget ändern darf, und eine ehrliche Tabelle der vier, die Orkas nicht bietet.
In fünf Schritten prüfen, wie Assistenten in Ihrer Kategorie Empfehlungen geben und warum Antworten ohne Markenbezug fast nie Ihre eigene Website zitieren.
App ID, Cert ID, RuName und eine Marktplatz-ID. Eines davon ist keine URL, und daran scheitern die meisten Einrichtungen.
Kein Entwicklerprogramm und keine Warteschlange für die Prüfung, denn der Server gehört Ihnen. Zwei Fehlerquellen bleiben, und beide sind unauffällig.
Claude hat keinen Etsy-Konnektor und Etsy bietet keinen MCP-Server. Vier Wege über Drittanbieter und die eine Hürde, an der sie alle stoppen.
Was ein MCP-Server für Seller Central abdeckt, die SP-API-Arbeit, die niemand zuerst erwähnt, und woher das Wissen zur Produktvermarktung kommen muss.
Shopify bietet zwei MCP-Server, und der einfache kann Ihren Shop nicht sehen. Die Entscheidung über Berechtigungsbereiche und warum Schreibzugriffe eine Freigabe brauchen.
Eine Agentur verkauft drei trennbare Leistungen — Kapazität, Fachwissen und Ergebnisverantwortung — gebündelt auf einer Rechnung. Die meisten Unternehmen brauchen weniger als drei. Kapazität kann eine einzelne Person inzwischen viel günstiger bereitstellen; die anderen beiden haben sich kaum verändert. So finden Sie heraus, was Sie tatsächlich einkaufen.
Gehen Sie davon aus, was Sie verdienen müssen, nicht davon, was andere verlangen. Ein Preisrechner für Ihren Browser, die Berechnung dahinter, wo Sie echte Marktzahlen finden und vier Möglichkeiten, Ihren Preis bei einem bestehenden Kunden zu erhöhen.
Die sechs Abschnitte, die Kunden tatsächlich lesen, was jeweils hineingehört und in welcher Reihenfolge Sie sie schreiben sollten — dazu eine bereits ausgefüllte Word- und Excel-Vorlage und eine Anleitung in zwei Schritten, die beide erzeugt. Keine E-Mail-Adresse erforderlich.
Kimi K3 wuchs von 1T auf 2.8T Parameter, und das ist die am wenigsten interessante Zahl im Bericht. Die Architektur skaliert entlang von Sequenz, Tiefe und Breite — und eine Änderung ersetzt einen ganzen GPU-Codepfad durch eine einzige untere Schranke. Was jede Richtung bringt, was sie im Serving-Stack kostet und welche Branchengewohnheit das Paper stillschweigend aufgibt.
Fast jeder Agent komprimiert bei einem bestimmten Prozentsatz des Fensters und verwirft die ältesten Gesprächsschritte. Dieser Schwellenwert weiß, dass der Platz knapp wird; er weiß nichts darüber, was gefahrlos verloren gehen darf. Warum die Markov-Eigenschaft von Meilensteinen eine Annahme statt einer Tatsache ist und warum sie für die Komprimierung viel strenger gelten muss als für das Training.
Orkas speichert dauerhafte Planmeilensteine und erfasst getrennt davon auf Host-Seite, was jeder Tool-Aufruf tatsächlich geändert hat. Nichts verbindet beides, sodass ein Schritt als abgeschlossen gilt, sobald das Modell dies sagt. Wie BEACON seinen Detektor positioniert, welche drei Ebenen aufzubauen sind und welches Kriterium dem Paper fehlt.
Orkas hat drei Schutzmechanismen gegen Schleifen, und keiner erkennt ein leistungsfähiges Modell im Stillstand — denn alle drei fragen, ob es sich wiederholt, und ein festgefahrenes Modell tut das nie. Der blinde Fleck, die von BEACON übernommene ergebnisbezogene Definition von Fortschritt und was zuerst gemessen werden sollte.
Eine genaue Lektüre von BEACON der Zhejiang University: Warum Agenten für langfristige Aufgaben unter RL zusammenbrechen, wie eine an Meilensteinen verankerte Zuordnung von Lernerfolg das behebt und warum eine Metrik ihrem eigenen Entwurf zu widersprechen scheint, bis man die Mathematik nachvollzieht.
Zitiert zu werden ist keine Frage des Rankings. Es geht darum, den Abruf zu überstehen und dann die zitierenswerte Passage zu sein — die drei OpenAI-Bots, die von robots.txt verdeckte CDN-Zugangshürde und warum ein Fakt hinter JavaScript nicht existiert.
Claude Code und Codex haben unterschiedliche Stärken. Nutzen Sie beide gemeinsam — mit Terminals und Git-Worktrees oder über einen Orkas Commander, der beide in einem einzigen Chat orchestriert.
Wie Orkas Nutzerdaten zwischen Geräten synchronisiert: mit verschlüsselter Übertragung, Inhaltsspeicherung, serverseitig verantworteten Commits, Kontosperren, Synchronisierungsregeln, modellgestützter Konfliktbehandlung, Löschbestätigung und Papierkorb.
Wie Orkas sein Agentenfundament innerhalb der Versionsreihe 1.0 erneuert hat: eine prozessinterne Laufzeit, Anbieterrotation, dynamische Gruppenchat-Orchestrierung, offenes Hosting, Gedächtnis und Selbstentwicklung.
Einblick in die Multi-Agenten-Orchestrierung von Orkas: Ein leitender Agent macht aus einer Anfrage einen Plan, setzt Unteragenten nach Abhängigkeiten ein, übergibt Kontext zwischen Schritten und erholt sich von Fehlern.
Die Iterationsrate, nicht der Preis pro Sekunde, ist der wichtigste Kostentreiber. Woher die Wiederholungsversuche kommen und wie Sie die Checkliste aus der Praxis zum Standard machen.
Was primär lokale KI bedeutet — Ihre Daten, API-Schlüssel und der Modellverkehr bleiben auf Ihrem eigenen Rechner statt in der Cloud eines Anbieters —, warum das für den Datenschutz wichtig ist und wie ein Agent mit eigenem API-Schlüssel tatsächlich funktioniert.
Wie Orkas Modellaufrufe in eine zuverlässige Desktop-Agentenlaufzeit verwandelt: Streaming-Ausführungsschleifen, Tool-Routing, Kontextkomprimierung, Anbieterabstraktion, Gedächtnis und absturzsichere Sitzungen.
Einblick in den lokalen Selbstentwicklungszyklus von Orkas: leichtgewichtige Signale, Reflexion im Hintergrund, ausführbare Skills, Skill-Metriken und Schutzmechanismen gegen falsche Lerneffekte.
Orkas ist ein lokal ausgerichteter Open-Source-KI-Desktop-Client für macOS und Windows. Statt mit einem einzelnen Assistenten zu chatten, steuern Sie ein Agententeam: Ein leitender Agent verantwortet Ihr Ziel und zieht Unteragenten hinzu, die Skills zur Ausführung der Arbeit aufrufen. Sie können optional von Orkas verwaltete offizielle Modelle nutzen oder Ihren eigenen Anbieter über OAuth oder einen API-Schlüssel verbinden; Ihr Arbeitsbereich ist standardmäßig lokal ausgerichtet.
Local First bedeutet, dass Ihre Daten und die Kontrolle auf Ihrem Gerät bleiben. Chats, Dateien, Wissensbasis, Erinnerung und verschlüsselte Modellschlüssel liegen standardmäßig auf Ihrem Rechner. Mit Ihrem eigenen Anbieter geht der Modell-Datenverkehr direkt von Ihrem Computer zu diesem Anbieter und nicht über Orkas-Server; offizielle Modelle nutzen den verwalteten Modelldienst von Orkas.
Ein leitender Agent liest Ihr Ziel, zerlegt es in Schritte und wählt Unteragenten nach Aufgabe und Fähigkeiten aus. Jeder Unteragent arbeitet in seinem eigenen begrenzten Kontext und ruft Skills auf — Websuche, Codeausführung, Datei-Ein-/Ausgabe, Wissensdatenbanksuche und Konnektoren —, um Ergebnisse zu liefern. Der leitende Agent gibt jedem Unteragenten nur das Nötige mit. Das senkt Tokenkosten und hält Zuständigkeiten klar.
Typische Anwendungen sind Recherche und Analyse, Schreiben und Bearbeiten, Programmierung mit nativen oder externen CLI-Agenten wie Claude Code, Codex und OpenClaw, Datenarbeit, Lernen und Office-Dokumente. Außerdem können Sie eine wiederkehrende Aufgabe einmal in einen wiederverwendbaren Unteragenten umwandeln und ihn bei Bedarf jederzeit im Chat aufrufen.
Die aktuelle öffentliche Version ist eine Desktop-App für macOS und Windows; das iOS-Fernsteuerungsrelay ist deaktiviert, und es gibt keinen Web-Client. Sie können optional von Orkas verwaltete offizielle Modelle nutzen oder einen Anbieter über OAuth oder einen API-Schlüssel verbinden. Die Nutzung Ihres eigenen Schlüssels rechnet Ihr Anbieter ab; verwaltete Funktionen verbrauchen Orkas-Credits. Die Ausgabequalität hängt vom verbundenen Modell ab. Die optionale Synchronisierung mehrerer Geräte speichert synchronisierte Daten auf Orkas-Servern, und die kostenlose Edition sendet begrenzte Nutzungsanalysen.