Arquitetura
Como o runtime desktop transforma chamadas de modelo em sessões confiáveis de agentes: loops em streaming, roteamento de ferramentas, estado tolerante a falhas, abstração de provedores e gestão de contexto.
O Blog do Orkas explica como o Orkas funciona como um cliente desktop open source e local-first para coordenar agentes de IA com suas próprias chaves de modelo. Estas notas de engenharia cobrem o runtime Agent Harness, orquestração multiagente, autoevolução local, roteamento de provedores, memória, compactação de contexto e as decisões de segurança por trás do tráfego direto ao provedor.
Como o runtime desktop transforma chamadas de modelo em sessões confiáveis de agentes: loops em streaming, roteamento de ferramentas, estado tolerante a falhas, abstração de provedores e gestão de contexto.
Como um agente líder decompõe uma solicitação, despacha subagentes, passa contexto entre etapas e se recupera quando uma tarefa falha.
Por que o Orkas mantém dados do workspace e chaves de modelo na máquina do usuário e por que o tráfego do seu próprio provedor vai diretamente a ele, sem passar pelos servidores do Orkas.
Uma agência vende três coisas separáveis — capacidade, especialização, responsabilização — empacotadas em uma nota só, e a maioria das empresas precisa de menos de três. Capacidade ficou muito mais barata de produzir sozinho; as outras duas quase não se moveram. Como descobrir qual delas você está comprando.
Parta do quanto você precisa ganhar, não do quanto os outros cobram. Uma calculadora de preços que roda no navegador, a aritmética por trás dela, onde estão os números reais de mercado e quatro formas de aumentar a taxa com um cliente que você já tem.
As seis seções que um cliente de fato lê, o que vai em cada uma e a ordem em que realmente se deve escrevê-las — além de um modelo Word e Excel já preenchido e a receita de duas etapas que gera os dois. Sem pedir e-mail.
O Kimi K3 passou de 1T para 2,8T de parâmetros, e esse é o número menos interessante do relatório. A arquitetura escala em sequência, profundidade e largura — e uma das mudanças substitui todo um caminho de código de GPU por um único limite inferior. O que cada direção compra, quanto custa na camada de serving e um hábito da indústria que o artigo abandona discretamente.
Quase todo agente compacta em uma porcentagem da janela e descarta os turnos mais antigos. Esse limite sabe que você está sem espaço; não sabe nada sobre o que é seguro perder. Por que a propriedade de Markov de marcos é uma suposição e não um fato, e por que a compactação a exige de forma muito mais estrita que o treinamento.
O Orkas registra marcos duráveis do plano e, separadamente, fatos do lado do host sobre o que cada chamada de ferramenta realmente mudou. Nada conecta os dois, então uma etapa conta como concluída quando o modelo diz que está. Como o BEACON posiciona seu detector, as três camadas a construir e um critério que o artigo não tem.
O Orkas tem três proteções contra loop, e nenhuma captura um modelo capaz que estagna — porque as três perguntam se ele está se repetindo, e um modelo travado nunca se repete. O ponto cego, a definição de progresso do lado da saída emprestada do BEACON, e o que medir primeiro.
Uma leitura atenta do BEACON, da Universidade de Zhejiang: por que agentes de longo horizonte colapsam sob RL, como o crédito ancorado em marcos resolve isso, e uma métrica que parece contradizer o próprio design até você refazer a matemática.
Ser citado não é ranquear. É sobreviver à recuperação e então ser o trecho que vale a pena citar — os três bots da OpenAI, a porta do CDN que o robots.txt esconde e por que um fato atrás de JavaScript não existe.
Claude Code e Codex se destacam em coisas diferentes. Use-os juntos — com terminais e git worktrees, ou com um Commander do Orkas que orquestra os dois em um único chat.
Como o Orkas sincroniza dados do usuário com transferência criptografada, armazenamento de conteúdo, commits no servidor, locks por conta, regras de sincronização, tratamento de conflitos assistido por modelo, confirmação de exclusão e lixeira.
Como o Orkas reconstruiu sua base de agentes na linha 1.0: runtime no processo, rotação de provedores, orquestração dinâmica de grupo, hospedagem aberta, memória e autoevolução.
Por dentro da orquestração multiagente do Orkas: um agente líder transforma uma solicitação em plano, despacha subagentes por dependência, passa contexto entre etapas e se recupera de falhas.
O fator dominante é a taxa de iteração, não o preço por segundo. De onde vêm as repetições e como tornar o checklist da prática o padrão.
O que IA local-first significa — seus dados, chaves de API e tráfego de modelo ficam na sua máquina, não na nuvem de um fornecedor — por que isso importa para privacidade e como um agente com sua própria chave funciona.
Como o Orkas transforma chamadas de modelo em um runtime confiável de agentes desktop: loops em streaming, roteamento de ferramentas, compactação de contexto, abstração de provedores, memória e sessões tolerantes a falhas.
Por dentro do loop local de autoevolução do Orkas: sinais leves, reflexão em segundo plano, habilidades executáveis, métricas de habilidades e proteções contra aprender a lição errada.
Orkas é um cliente de IA desktop open source, local-first para macOS e Windows. Em vez de conversar com um único assistente, você dirige uma equipe de agentes: um agente líder é dono do seu objetivo e recruta subagentes que convocam habilidades para fazer o trabalho. Você pode usar modelos oficiais opcionais gerenciados pelo Orkas ou conectar seu próprio provedor por OAuth ou chave de API; seu espaço de trabalho é local-first por padrão.
Local-first significa que seus dados e controle permanecem no seu dispositivo. Seus chats, arquivos, base de conhecimento, memória e chaves de modelo criptografadas ficam em sua máquina por padrão. Com seu próprio provedor, o tráfego de modelo vai diretamente do seu computador para ele e não passa pelos servidores do Orkas como proxy; os modelos oficiais usam o serviço de modelo gerenciado do Orkas.
Um agente líder lê sua meta, divide-a em etapas e recruta subagentes por tarefa e capacidade. Cada subagente trabalha em seu próprio contexto limitado e chama habilidades – pesquisa na web, execução de código, E/S de arquivos, pesquisa na base de conhecimento e conectores – para entregar. O lead passa a cada subagente apenas o que ele precisa, o que mantém o custo do token baixo e as responsabilidades limpas.
Os usos comuns incluem pesquisa e análise, escrita e edição, codificação com agentes CLI nativos ou externos, como Claude Code, Codex e OpenClaw, trabalho de dados, aprendizagem e documentos de escritório. Você também pode transformar uma tarefa recorrente em um subagente reutilizável uma vez e invocá-lo no chat sempre que precisar.
A versão pública atual é um app desktop para macOS e Windows; o relay de controle remoto iOS está desabilitado e não há cliente web. Modelos oficiais usam créditos Orkas, ou você conecta seu provedor e é cobrado por ele. A sincronização opcional armazena os dados escolhidos no Orkas.