Price war no mid-tier, orquestração AX e avatar em tempo real
Resumo da semana
Olá, bem-vindo à edição 04.
Entre 18 e 24 de setembro de 2026, a conversa de engenharia de IA girou em torno de três eixos que se cruzam: quanto custa rodar um agent competente no mid-tier, como orquestrar e autenticar esses agents em produção, e como a presença do agent deixa de ser só texto. No dia 22, Anthropic e OpenAI apertaram o preço no meio da pirâmide com Claude Opus 5.5, GPT-6 Sol e GPT-6 Luna, enquanto Astra e Fable seguem no topo mais caro. No mesmo dia o Google open-sourcou o AX, um runtime declarativo para agents long-running. Em seguida veio a Credentials API dos Managed Agents, com o segredo fora do sandbox e injetado pelo proxy de egress. No dia 23 a Meta mostrou o Muse Realtime Avatar, embodiment em subsegundo sincronizado com a voz. E no dia 21, xAI e Xiaomi publicaram no mesmo índice o Grok 4.7 fechado e o MiMo-V2.6 aberto.
A ideia desta edição é a de sempre: contar o que mudou, por que o desenho importa para quem constrói sistemas de IA, e apontar as fontes originais.
Claude Opus 5.5
O que aconteceu
Em 22 de setembro de 2026 a Anthropic lançou o Claude Opus 5.5 (claude-opus-5-5), primeiro modelo da família Claude 5.5. Em termos práticos: desempenho no patamar de Fable 5.1 em boa parte do trabalho agentic e de coding, com preço e eficiência pensados para quem já rodava Opus em produção e sentia o custo.
O preço de lista fica em US$4 por milhão de tokens de input e US$20 de output, cerca de 20% abaixo do Opus 5. Leituras de cache caem para US$0,20 por milhão (redução de cerca de 60%), o que pesa bastante em sessões agentic longas, onde a maior parte do input costuma ser cache. A Anthropic reporta cerca de 40% menos custo típico em workloads padrão e saída cerca de 30% mais rápida que Opus 5. Contexto de 1M de tokens e saída máxima de 128k. Thinking adaptativo fica sempre ligado (não dá para desligar), com esforço padrão medium. Há fast mode separado, mais caro, para quem precisa de latência menor.
Do lado de produto e segurança, Opus 5.5 chega com safeguards no estilo Fable em biologia e cybersecurity, preserved thinking anti-distilação, System Card no mesmo dia e avaliação externa pré-release (incluindo Frontier Design e METR). A empresa diz que o modelo é o mais forte até agora no behavioral audit automatizado interno. Disponibilidade: Claude Platform, Amazon Bedrock, Google Cloud e Azure/Foundry, com ID claude-opus-5-5 (ou anthropic.claude-opus-5-5 no Bedrock).
Para quem migra de Opus 5, a documentação lista breaking changes importantes: thinking obrigatório, forced tool use passa a retornar erro, thinking blocks amarrados ao modelo e à conversa, e a tool antiga de computer use computer_20251124 deixa de ser aceita na Claude API e no Google Cloud. Sonnet 5.5 e Haiku 5.5 ficaram só como teaser “coming soon”. Em resumo: não é o Fable/Mythos da edição 01 nem o alignment assessment cyber da edição 02. É Opus-tier com preço, eficiência e contrato de API novos.
Fontes originais
- Anthropic, Introducing Claude Opus 5.5 (22 set 2026): https://www.anthropic.com/claude-opus-5-5
- Claude Docs, Opus 5.5 overview: https://platform.claude.com/docs/en/models/opus-5-5/overview
- Anthropic, Claude Opus 5.5 System Card (PDF): https://www-cdn.anthropic.com/fc1b44717c85dc068bc6ba5024219938094694bd/Claude%20Opus%205.5%20System%20Card.pdf
- Simon Willison, Claude Opus 5.5, GPT-6 Sol, GPT-6 Luna, and a new price war (22 set 2026): https://simonwillison.net/2026/Sep/22/opus-and-sol-and-luna/
GPT-6 Sol e GPT-6 Luna
O que aconteceu
Também em 22 de setembro de 2026 a OpenAI lançou GPT-6 Sol (gpt-6-sol) e GPT-6 Luna (gpt-6-luna), posicionados como o braço mais barato e mais escalável da família GPT-6, depois do flagship Astra. Sol mira coding e workflows agentic complexos a US$2 / US$10 por milhão de tokens (input/output). Luna mira volume e tarefas focadas a US$0,10 / US$0,50. Em ambos os casos, a OpenAI fala em cerca de 50% abaixo do preço promocional dos equivalentes GPT-5.6. Contexto de cerca de 1,05M de tokens e saída máxima de 128k.
O rollout cobre API, Codex e ChatGPT Work (Plus, Pro, Business, Enterprise e Edu). Luna também chega para Free e Go no app desktop. Nos docs oficiais, reasoning.effort aceita none, low, medium (default), high, xhigh e max. Responses API traz tools built-in e function calling; Chat Completions só com reasoning_effort em none para function calling. Há appendix de safety Sol/Luna no System Card do GPT-6 Astra no mesmo dia.
Junto com Opus 5.5, o anúncio fecha o que a curadoria desta semana chama de price war do mid-tier: Astra e Fable permanecem no patamar de cerca de US$10 / US$50, enquanto Sol, Luna, Opus 5.5 e, no dia anterior, Grok 4.7 disputam o meio da pirâmide com tokenomics bem mais agressiva. Simon Willison montou a tabela do dia e destacou que GPT-6 Luna está entre os modelos mais baratos que a OpenAI já publicou, atrás só de nanos bem mais fracos.
Para quem desenha frota de agents, a mensagem prática é de rota por tarefa: Luna para alto volume e loops baratos, Sol para coding/agentic mais pesado, Astra (ou Fable) quando o caso realmente precisa do topo. Não confundir com GPT-6 Astra da edição 01: aqui o peso é eficiência e preço para escala, não o launch do flagship.
Fontes originais
- OpenAI Docs, GPT-6 Sol: https://developers.openai.com/api/docs/models/gpt-6-sol
- OpenAI Docs, GPT-6 Luna: https://developers.openai.com/api/docs/models/gpt-6-luna
- OpenAI Community, Announcing GPT-6 Sol and GPT-6 Luna (22 set 2026): https://community.openai.com/t/announcing-gpt-6-sol-and-gpt-6-luna-in-the-api-codex-and-chatgpt/1399925
- OpenAI, Safety appendix Sol/Luna (GPT-6 Astra System Card): https://deploymentsafety.openai.com/gpt-6-astra/sec:appendix-sol-luna
- Simon Willison, Claude Opus 5.5, GPT-6 Sol, GPT-6 Luna, and a new price war (22 set 2026): https://simonwillison.net/2026/Sep/22/opus-and-sol-and-luna/
Google AX: orquestrador open source para agents
O que aconteceu
Em 22 de setembro de 2026 o Google tornou público o AX (Apache 2.0; GitHub google/ax, site agentexecutor.io): um runtime declarativo, estilo Kubernetes, para executar e escalar workloads de agents autônomos. A peça roda sobre o Agent Substrate e trata cada agent como actor stateful, não como microsserviço request-response nem como batch que termina e some.
O problema que o AX ataca é operacional. Agents ficam longos períodos ociosos esperando modelo, API externa ou humano, intercalados com rajadas de compute em reasoning e tool use. Manter sandbox ligado o tempo todo desperdiça máquina; cold start clássico de container atrasa o loop interativo. AX checkpointa o estado, suspende o actor e retoma em intervalo subsegundo, multiplexando várias tarefas em workers compartilhados.
O control plane expõe quatro primitives CRD no grupo ax.io/v1alpha1: Task (ciclo de vida, limites de CPU/memória e referências), Workspace (montagem pré-execução: git, MCP, skills, goals em linguagem natural para bootstrap), Gateway (allowlist de egress, portas e injeção de credenciais em requests de saída) e Model (parâmetros de provider, runtime e secrets no Kubernetes). A CLI ax (Go) cobre apply, watch, ssh, suspend e resume. O control plane sobe em Kubernetes (fluxo com ko e Redis no namespace ax-system).
A cobertura da InfoQ e as discussões da comunidade reforçam o posicionamento: AX é primitivo de compute/orquestração para frotas long-running e sandboxes de eval/RL, não um framework de grafo de aplicação no estilo LangGraph ou CrewAI. Há quem elogie o custo de idle e quem critique o overhead de cluster, registry e CRDs. Distinto do Google Home MCP (edição 03) e do ADK Kotlin (edição 02): aqui o evento da semana é o open-source de AX; o blog Agent Executor de maio funciona só como precursor.
Fontes originais
- GitHub, google/ax: https://github.com/google/ax
- InfoQ, Google Open-Sources AX… (22 set 2026): https://www.infoq.com/news/2026/09/google-ax-orchestrator/
- Google Cloud Blog, Agent Executor (contexto, 20 mai 2026): https://cloud.google.com/blog/products/ai-machine-learning/agent-executor-googles-distributed-agent-runtime
Credentials API nos Managed Agents (Gemini)
O que aconteceu
Por volta de 23 de setembro de 2026 (docs com “Last updated 2026-09-23 UTC”; preview antigravity-preview-09-2026) o Google documentou a Credentials API para Managed Agents na Gemini API. A ideia central é simples e forte: o agent precisa falar com GitHub, Jira, Slack ou MCP remoto sem que o token exista dentro do sandbox Linux efêmero nem seja legível pelo modelo.
Você cria um credential write-only (bearer_token, oauth2 ou environment_variable), referencia o ID no allowlist de rede ou na tool MCP, e um egress proxy resolve e injeta o header (por padrão Authorization: Bearer …, ou header/prefix custom) no fio, na hora do request. Endpoints de list/get devolvem só metadados (id, type, status, timestamps), nunca o segredo. OAuth2 faz refresh automático; PATCH rotaciona o valor sem reescrever rules de allowlist, tools ou env vars. Para SDKs que leem process env, o tipo environment_variable coloca placeholder no container e só substitui o valor real em requests para trusted_domains.
Na prática isso muda o desenho do harness seguro: segredo deixa de ser arquivo no workspace ou variável plaintext no prompt. Literal em env continua legível pelo sandbox (docs avisam: use para NODE_ENV, não para token). Credential e transform/headers podem coexistir na mesma rule; o credential aplica primeiro e o transform sobrescreve chaves conflitantes. O agente de preview citado nas samples é antigravity-preview-09-2026.
Distinto do Home MCP da edição 03 (porta para a casa inteligente) e do post de julho sobre background/MCP remoto: o ângulo novo é arquitetura de identidade do agent. É peça de hardening que muda como se desenha allowlist, rotação e blast radius quando o agent tem egress.
Fontes originais
- Google AI for Developers, Credentials in managed agents (atualizado 23 set 2026): https://ai.google.dev/gemini-api/docs/agent-credentials
- Google AI for Developers, Antigravity agent: https://ai.google.dev/gemini-api/docs/antigravity-agent
- Yahoo Tech / cobertura, Google ships managed agent harness…: https://tech.yahoo.com/ai/gemini/articles/google-ships-managed-agent-harness-110926492.html
Muse Realtime Avatar (Meta)
O que aconteceu
Em 23 de setembro de 2026 a Meta Research apresentou o Muse Realtime Avatar: tecnologia de embodiment que transforma o Muse Realtime Voice em avatar expressivo e interativo em conversa ao vivo. Condicionado a mídia de referência (retrato, ilustração full-body, até animais e objetos), o sistema gera vídeo causal sincronizado com a fala, mantendo aparência e maneirismos coerentes de um turno para o outro.
A arquitetura compartilha o mesmo stream de speech VQs do Muse Realtime Voice. Um decoder de áudio vira voz; o avatar, um Diffusion Transformer audio-driven, consome o mesmo stream e produz chunks de vídeo (448×768 a 25 fps) com janela rolante de latents recentes. Assim voz, lábio e expressão ficam alinhados sem um pipeline separado e dessincronizado.
O salto de serving vem de destilação teacher→student: o teacher bidirecional usa 40 passos de difusão com CFG (cerca de 120 avaliações por chunk); o student causal com KV cache fixo chega a 2 avaliações sem guidance, redução de cerca de 60×, com preferência de raters quase empatada com o teacher. Em serving, a Meta cita KV cache persistente, batching latency-aware, QAT 4-bit, CUDA Graphs e motor próprio de inferência de vídeo. Latência reportada: cerca de 870 ms do fim do turno do usuário até o primeiro byte de voz+vídeo sincronizados. Em um GB200, até 12 sessões concorrentes de geração de vídeo (~8× frente ao baseline BF16 de dois passos). Watermark Meta Video Seal sem latência extra. Em call nativo, raters preferiram Muse frente a Runway Characters e HeyGen LiveAvatar na maioria das dimensões avaliadas.
Distinto do Muse Secure VM da edição 02 (sandbox consumer): aqui o peso é stack de inferência realtime + embodiment. Muse é 18+. Nem todos os exemplos do blog estão no app.
Fontes originais
- Meta AI Research, Bringing Your Muse to Life (23 set 2026): https://research.meta.ai/blog/bringing-your-muse-to-life
- Runtime Wire, Meta Muse Realtime Avatar: https://runtimewire.com/article/meta-muse-realtime-avatar
- The Verge, Meta Muse AI agent video chat…: https://www.theverge.com/tech/999454/meta-muse-ai-agent-video-chat-connect-2026
Grok 4.7 e MiMo-V2.6 Pro/Flash
O que aconteceu
Em 21 de setembro de 2026, no mesmo dia, xAI lançou o Grok 4.7 e a Xiaomi publicou pesos MIT do MiMo-V2.6-Pro e do MiMo-V2.6-Flash. É o par fechado versus aberto que completa a price war do mid-tier desta semana, um dia antes de Sol/Luna e Opus 5.5.
Grok 4.7 mira coding e knowledge work, com preço a partir de US$2 / US$6 por milhão (input/output), o mesmo ticket e velocidade do Grok 4.6 segundo a xAI, e disponibilidade em Cursor, Grok Build, API, harnesses e routers. A empresa descreve base maior, RL mais longo em tarefas de muitas horas, melhor verificação do próprio trabalho e um stack novo de safeguards (jailbreak/refusals, dual-use cyber e bio). Há variante fast com o dobro da velocidade de output ao dobro do preço.
Do lado aberto, MiMo-V2.6-Pro traz MoE esparso com 1,02T de parâmetros totais e 42B ativos, contexto de 1M, omnimodal (texto, imagem, vídeo, áudio). Flash fica em 309B totais / 15B ativos. Pesos no Hugging Face sob MIT; serving via SGLang/vLLM e também API Xiaomi, OpenRouter e produtos MiMo. Cobertura independente (DataNorth) coloca Pro em cerca de 46,32 no Artificial Analysis Intelligence Index v4.3, empatado com Grok 4.7, a cerca de US$0,435 / US$0,87 por milhão na API Xiaomi frente a US$2 / US$6 do Grok. Flash entra a cerca de US$0,14 / US$0,28. Há ainda Pro-UltraSpeed, cerca de 20× a velocidade de output do Pro a 10× o preço. Xiaomi não publica orientação clara de hardware para self-host do Pro; tratar benches agenticos vendor-run com cautela até reprodução externa.
Não é Nex-N2.5-mini (edição 02) nem “volume models” genéricos da edição 01: é pressão direta no preço e no serving open-weights do mid-tier, no mesmo índice e na mesma janela da guerra de token.
Fontes originais
- xAI, Introducing Grok 4.7 (21 set 2026): https://x.ai/news/grok-4-7
- Hugging Face, XiaomiMiMo/MiMo-V2.6-Pro-RL: https://huggingface.co/XiaomiMiMo/MiMo-V2.6-Pro-RL
- DataNorth, Xiaomi releases MiMo-V2.6-Pro and Flash (22 set 2026): https://datanorth.ai/news/xiaomi-releases-mimo-v2-6-pro-and-flash
- Simon Willison, Claude Opus 5.5, GPT-6 Sol, GPT-6 Luna… (menciona Grok 4.7 / MiMo no “ontem”): https://simonwillison.net/2026/Sep/22/opus-and-sol-and-luna/
Demais da curadoria
- Amazon SageMaker HyperPod Inference Gateway (18 set 2026): add-on EKS com routing GPU-aware (KV cache, queue depth, LoRA residency, prefix hit) via Envoy e Body-Based Router; claims de redução forte de first-token frente a round-robin em coberturas agregadoras. Preferimos Demais porque a primária What’s New oficial ficou menos clara no Scout. Docs de caching/routing: https://docs.aws.amazon.com/sagemaker/latest/dg/sagemaker-hyperpod-model-deployment-caching-routing.html · Feed: https://aws-news.com/article/2026-09-18-introducing-amazon-sagemaker-hyperpod-inference-gateway
- WorkOS / Forkast e o mapa das “four credential architectures” (egress proxy Google, tokens short-lived Rubrik×Anthropic, Entra MCP Firewall, NVIDIA OpenShell): útil como contexto do destaque Credentials, não como destaque próprio.
- Opus 5.5 em effort max no teste do pelican SVG do Simon Willison: estourou o teto de 128k de thinking sem devolver SVG. Anecdote de produto, não destaque.
- Sonnet 5.5 / Haiku 5.5: teaser Anthropic apenas.
Conclusões
A semana 18-24 de setembro desenhou um mapa claro do mid-tier e da infra ao redor. Token ficou mais barato onde a maior parte da frota realmente roda (Opus 5.5, Sol, Luna, Grok 4.7, MiMo). Orquestração deixou de ser só framework de grafo e ganhou runtime declarativo com suspend/resume (AX). Identidade do agent saiu do arquivo no sandbox e foi para proxy de egress com credential write-only (Credentials API). E a presença do agent deixou de ser só voz: Muse Realtime Avatar coloca embodiment em latência de conversa. O fio comum não é “mais um número no leaderboard”. É envelope de custo, de ciclo de vida do actor, de segredo no fio e de serving realtime. Para quem constrói, a pergunta útil da semana é: qual modelo cabe em cada rota de preço, onde o agent dorme sem queimar GPU, quem injeta a credencial, e o que o usuário vê quando a resposta chega em menos de um segundo.