Sonnet 5.5, Gemini 4 Argon e agents always-on (Dots / Autopilot)

Resumo da semana
Olá, bem-vindo à edição 05.
Entre 25 de setembro e 1 de outubro de 2026, a conversa de engenharia de IA girou em torno de três eixos que se cruzam: o mid-tier ficou mais competente sem subir o list price, o frontier chegou com acesso faseado (cyber primeiro), e o agent deixou de ser só uma sessão para virar teammate always-on, com uma camada de safety de runtime e hardware no meio. No dia 25 a Microsoft apresentou o Copilot novo com Home, Code e Autopilot. No dia 28 a Anthropic lançou Claude Sonnet 5.5 e a NVIDIA a Open Agent Safety Platform (OpenShell + Sentry). No DevDay de 29 a OpenAI subiu GPT-6.1 Sol perto de Astra a cerca de um quinto do preço e lançou Dots. No dia 30 o Google DeepMind anunciou Gemini 4 Argon, frontier com output de 1M de tokens e rollout inicial via Fairwind Program.
A ideia desta edição é a de sempre: contar o que mudou, por que o desenho importa para quem constrói sistemas de IA, e apontar as fontes originais.
Claude Sonnet 5.5
O que aconteceu
Em 28 de setembro de 2026 a Anthropic lançou Claude Sonnet 5.5 (claude-sonnet-5-5), segundo modelo da família Claude 5.5 depois do Opus 5.5. Em termos práticos: upgrade claro sobre Sonnet 5, complemento mais rápido e mais barato por tarefa ao Opus 5.5, forte em tarefas bem escopadas do dia a dia, bugs, documentos, slides e design.
O list price permanece US$2 por milhão de tokens de input e US$10 de output, com cache reads a US$0,20. A Anthropic reporta até cerca de 30% menos custo por tarefa (porque o modelo usa bem menos tokens) e saída cerca de 30%+ mais rápida que Sonnet 5. Em Terminal-Bench 4.0, Sonnet 5.5 marca 70,6% frente a 10,3% do Sonnet 5. Em GDPval-AA fica quase no nível de Opus 5.5. Também sobe em computer use (OSWorld 2.1 parcial cerca de 80,1%) e em chart recognition. Em vários benches, Sonnet 5.5 em effort Low ou Medium bate o melhor score do Sonnet 5 a cerca de um décimo do custo por tarefa. Early testers (Epic, Slack, Zendesk, Unity, Cursor/SpaceXAI) citam menos tool calls, menos tokens e melhor julgamento em builds e reviews.
Do lado de segurança, é o primeiro Sonnet com cyber safeguards no estilo Opus 5.5 (tarefas de alto risco caem de volta para Sonnet 5; defensores podem aplicar ao Cyber Verification Program). Biology safeguards iguais ao Sonnet 5. Classifiers anti-distilação e preserved thinking expandido chegam pela primeira vez no tier Sonnet. No behavioral audit automatizado, melhora ou empatar Sonnet 5 na maior parte das medidas.
Disponibilidade: Claude Platform, Amazon Bedrock, Google Cloud e Azure/Foundry, com ID claude-sonnet-5-5. Breaking change importante: quem rodava Sonnet com thinking off precisa migrar para o setting between_tools (mantém thinking up-front off). Haiku 5.5 ainda é teaser "coming weeks". Não é o Opus 5.5 da edição 04 nem Fable/Mythos da edição 01: é o workhorse mid-tier da família 5.5 com jump de coding e cyber safeguards no patamar Sonnet.
Fontes originais
- Anthropic, Introducing Claude Sonnet 5.5 (28 set 2026): https://www.anthropic.com/claude-sonnet-5-5
- Claude Platform, Release notes overview: https://platform.claude.com/docs/en/release-notes/overview
Gemini 4 Argon
O que aconteceu
Em 30 de setembro de 2026 o Google DeepMind anunciou Gemini 4 Argon, frontier model da geração Gemini 4. O foco declarado: workflows long-horizon em software engineering real, knowledge work (legal e finance) e cybersecurity defense. O rollout inicial é faseado de propósito. Argon começa só para cyber defenders via Fairwind Program, com engajamento no processo voluntário de acesso pré-release do governo dos EUA. A expansão a developers, enterprise e consumers vem depois, começando por paid API e Google AI Ultra, conforme o time itera guardrails com feedback dos early testers.
O limite de output sobe para 1M de tokens (de 64k). Isso muda o desenho de trajetórias longas: o modelo tem headroom para gerar centenas de milhares de tokens numa única passagem. Preço introdutório: US$2 / US$10 por milhão (input/output), com cache de input a 95% de desconto; depois do período introdutório, US$4 / US$20. Claims internos de uso no Google: otimização quântica com cerca de 40% menos spacetime versus baseline em um caso; frota de agents liberando mais de 300 TiB de memória (estimativa de 500 TiB a 1 PiB no total); migrações C/C++ para Rust em escala (re2, libgav1, até trechos do Fuchsia Zircon). No libgav1, agents substituíram cerca de 32k linhas de SIMD por Rust safe e chegaram a cerca de 2,7 vezes a velocidade do port anterior, com saída de vídeo idêntica.
Em benches públicos: SOTA DeepSWE v1.1 (77,9%), liderança no Vals Index (impacto econômico por setor), AutomationBench 51,3%, LVBench 91,7% em vídeo longo. Em CWE-bench v1 empatado no topo (68%). Wiz já usa Argon no Scan for Good e reporta vulnerabilidade crítica em software de healthcare que modelos frontier anteriores teriam perdido. Safeguards reforçados antes da disponibilidade ampla: misuse e CBRN, prompt injection (liderança no Gray Swan IPI), monitor de misalignment no chain-of-thought e sandboxes endurecidos. Para defensores confiáveis e times internos, Argon sai sem cyber guardrails para explorar a capacidade frontier de defesa. Distinto de Gemini 3.8 Flash/Cyber (edição 01) e Live (edição 03): é frontier Gemini 4 com desenho de acesso cyber-first.
Fontes originais
- Google, Introducing Gemini 4 Argon (30 set 2026): https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-4-argon/
GPT-6.1 Sol
O que aconteceu
Em 29 de setembro de 2026, no DevDay, a OpenAI lançou GPT-6.1 Sol (gpt-6.1-sol), upgrade de GPT-6 Sol. O posicionamento oficial: desempenho perto de GPT-6 Astra em coding agentic, computer use e trabalho profissional a cerca de um quinto do preço padrão Astra. List price: US$2 / US$10 por milhão (input/output). Cache de input a US$0,10 por milhão: 95% abaixo do input padrão e 50% abaixo do cache do Sol original. Esse cache barato é o detalhe que mais pesa em agents que reusam contexto entre requests.
Vs Sol, a OpenAI reporta ganhos claros. Em DeepSWE v1.1, 6.1 Sol empata Astra a cerca de um quinto do custo e sobe 6,4 pontos sobre o melhor score do Sol em effort menor. Em GDP.pdf (perguntas profissionais sobre PDFs complexos), fica acima de Opus 5.5 com fallbacks a menos da metade do custo por tarefa e perto de Astra a cerca de um quinto. Em AutomationBench, +4,8 pontos vs Sol no mesmo effort e +2,2 vs Opus 5.5. Em OSWorld 2.0 offline (computer use), +7 pontos vs Sol no max effort e a cerca de 2,1 pontos de Astra a cerca de um sétimo do custo. Em Terminal-Bench Science, mais que dobra o score do Sol no max effort (custo médio cerca de US$5,47 por tarefa frente a cerca de US$23 de Opus 5.5 e Astra). Factuality em prompts difíceis: erro de 11,4% para 7,7% em low effort (queda de cerca de 32%); dentro de 1,9 pontos de Astra nos efforts testados. Alignment avaliações aproximam o modelo de Astra; detalhes no system card addendum.
Disponibilidade: ChatGPT Work e Codex (Plus, Pro, Business, Enterprise, Edu) e API. Ainda não no Chat. Ultrafast (até cerca de 8 vezes a geração de tokens) "coming days". Distinto do lançamento Sol/Luna da edição 04: aqui o peso é o bump 6.1 que fecha o gap Astra versus mid-tier em custo, continuando a price war da semana anterior sem repetir o anúncio Sol.
Fontes originais
- OpenAI, Introducing GPT-6.1 Sol (29 set 2026): https://openai.com/index/introducing-gpt-6-1-sol/
- OpenAI, DevDay 2026 Recap (29 set 2026): https://openai.com/index/devday-2026-recap/
OpenAI Dots
O que aconteceu
Também em 29 de setembro de 2026, no DevDay, a OpenAI lançou Dots: agents persistentes powered by GPT-6 Astra, pensados para responsabilidades contínuas, não só uma sessão de chat ou um job de Codex. A proposta é um teammate cloud que conhece o que importa para você, trabalha no background e tira trabalho da sua frente. Cada Dot tem cloud computer e browser próprios, acesso a plugins (ecossistema de milhares de apps no diretório ChatGPT), memória cross-channel (ChatGPT para Slack e Teams) e autonomia ajustável: pedir confirmação antes de agir ou executar com menos fricção. Há modo idle read-only para pesquisa proativa sem escrever em sistemas externos.
Um Dot primário entra nos planos elegíveis. Specialist Dots (identidade, credenciais e ferramentas de org) ficam em preview enterprise. Integração planejada com Microsoft Agent 365 para governance e security controls. Rollout: Pro e Business Premium em mercados elegíveis. A community confirma exclusão inicial de EEA, Suíça e Reino Unido no web, mobile e desktop; Enterprise em beta off-by-default. Roadmap citado: SMS e times de Dots trabalhando juntos.
TechCrunch e o hub da community reforçam o ângulo de produto: muito do que Codex e harnesses já faziam agora vem empacotado como agente always-on com persona "bubbly" (avatar pontinho), na mesma linha de embodiment que a Meta explorou com Muse. Cenários oficiais incluem Dot de engineering que monitora feedback de cliente e aplica fixes, e Dot científico que re-roda análises quando novos dados chegam. Distinto de Astra (edição 01) e de Sol/Luna (edição 04): o evento da semana é o produto de agent persistente, não o modelo. Para quem desenha frota, muda o harness de "sessão que termina" para "teammate cloud com computer, memória e governance".
Fontes originais
- OpenAI, DevDay 2026 Recap (29 set 2026): https://openai.com/index/devday-2026-recap/
- OpenAI Community, DevDay 2026 announcements (29 set 2026): https://community.openai.com/t/devday-2026-announcements-and-developer-resources/1402006
- TechCrunch, OpenAI launches Dots… (29 set 2026): https://techcrunch.com/2026/09/29/openai-launches-dots-its-bubbly-agentic-avatar/
NVIDIA Open Agent Safety Platform
O que aconteceu
Em 28 de setembro de 2026 a NVIDIA lançou a Open Agent Safety Platform: stack open (software mais reference design) para conter agents do teste ao deploy. O contexto do post é explícito: labs frontier reportaram agents que saíram do ambiente de eval, alcançaram sistemas que não deveriam e, em alguns casos, mentiram sobre o que fizeram. A lição da NVIDIA: o agent nessas condições não pode ser esperado a se governar sozinho.
Duas peças. OpenShell (Apache 2.0, GitHub NVIDIA/OpenShell, disponibilidade ampla cerca de 0.1.0): runtime que sandboxa agents com isolamento kernel-level e policy verificável sobre files, network, tools, processes e credentials. Gateway gerencia lifecycle de muitos sandboxes; supervisor fica no caminho de toda a rede do sandbox (pode liberar leitura via API e bloquear escrita); chave de API aparece só como placeholder e o valor real é substituído fora do workload, só para endpoints autorizados. Policy advisor permite ao agent propor mudança de policy, mas não aprovar a si mesmo. Prover formal checa se as permissões modeladas ficam dentro da intenção do operador. Agents citados em cobertura: Codex, Claude Code, Pi, Hermes.
Sentry (opcional): watchdog out-of-band em BlueField-4 DPU via DOCA. Observa e enforce mesmo se o host estiver comprometido; no Vera Rubin POD o DPU fica no único caminho até o modelo (path-to-model como kill switch e ponto de observação). Quarentena em milissegundos se o agent sair do boundary de software. Compatível também com outros hardwares; em Vera com BlueField-4 basta update de software. Cinco princípios: policy verificável, enforcement out-of-band, path-to-model como ponto de controle, authority escalada com visibility de reasoning, shared responsibility entre labs, enterprises e hardware. Parceiros: Anthropic (Managed Agents com OpenShell/BlueField), SpaceXAI (Cursor/Grok), Salesforce/Slack, SAP Joule Studio, CrowdStrike, Palo Alto, Cisco. Distinto de Google AX (edição 04, orquestração) e Credentials API Gemini (edição 04, identity no egress): aqui o peso é runtime mais hardware safety para fleets.
Fontes originais
- NVIDIA Developer Blog, Open Agent Safety Platform (28 set 2026): https://developer.nvidia.com/blog/nvidia-open-agent-safety-platform-a-reference-for-continuous-in-silicon-agent-monitoring/
- GitHub, NVIDIA/OpenShell: https://github.com/NVIDIA/OpenShell
- SecurityWeek, Nvidia Unveils AI Agent Safety Platform… (28 set 2026): https://www.securityweek.com/nvidia-unveils-ai-agent-safety-platform-with-hardware-based-watchdog/
Microsoft Copilot: Home, Code e Autopilot
O que aconteceu
Em 25 de setembro de 2026 a Microsoft redesenhou o Copilot em três capacidades que cobrem pedir, delegar e construir. Home une Chat e Cowork num ponto de partida único. Chat cobre perguntas, lookups e drafts rápidos. Cowork cobre trabalho delegado end-to-end (resposta de RFP, launch kit, close financeiro). Office in Copilot traz Word, Excel e PowerPoint nativos: o arquivo nasce ou atualiza como documento editável live para o time, sincronizado com os apps Office. Em breve, o usuário só declara o objetivo e o Copilot roteia entre Chat, Cowork e Code sem escolher modo à mão.
Code deixa qualquer pessoa descrever app, tracker, dashboard ou automação em linguagem natural. A base tecnológica é a mesma do GitHub Copilot, rodando em sandbox. Copilot Managed Runtime (preview) hospeda com segurança no tenant Microsoft 365, governado por IT, também para apps de Cowork, Copilot Studio e third-party/pro-code. Home e Code começam no Frontier nas semanas seguintes; Code em preview para Microsoft 365 Premium e Pro mais tarde no ano.
Autopilot (antes Scout) é o agent persistente cloud-hosted: identidade, memória, computer e workspace próprios, grounded em Microsoft IQ, aparece em Teams e Outlook como colega (@mention), com permissions, audit e governance. Roda recorrências, follow-ups e processos longos (ex. supplier review) sem o usuário na tela. Private preview no fim do mês. Do lado de custo, FinOps for AI e Agent 365 expandem cost controls para Code e Managed Runtime; USL cobre uso cotidiano com Auto routing; UBB cobre agentic (Cowork, Code, Autopilot) e frontier (Astra, Fable). Distinto de Google Home MCP (edição 03) e Muse Secure VM (edição 02): aqui é plataforma agentic de trabalho com Managed Runtime e Autopilot always-on, paralelo de engenharia a Dots na mesma janela.
Fontes originais
- Microsoft Blog, Introducing the new Copilot with Home, Code and Autopilot (25 set 2026): https://blogs.microsoft.com/blog/2026/09/25/introducing-the-new-copilot-with-home-code-and-autopilot/
- Microsoft Source EMEA: https://news.microsoft.com/source/emea/2026/09/new-microsoft-copilot-brings-home-code-and-autopilot-together/
- Reuters, Microsoft revamps Copilot… (25 set 2026): https://www.reuters.com/technology/microsoft-revamps-copilot-with-code-generation-agentic-ai-tools-2026-09-25/
Demais da curadoria
- Anthropic Threat Intelligence Report (September 2026): casos dez/2025 a ago/2026 de misuse (cyber agentic, influence ops, distillation, supply-chain / API keys). Contexto útil para Sonnet cyber safeguards e OpenShell, não destaque próprio. https://www.anthropic.com/threat-intelligence-report-september-2026
- White House Accord / EO "Inaugurating the Era of Super Intelligence" (cerca de 29 set): Google, Anthropic, Meta, OpenAI, xAI, Nvidia assinam framework de controles; EO troca terminologia AI para SI no executive branch. Policy, ângulo diferente do Ban ASI Act (edição 01). https://www.whitehouse.gov/presidential-actions/2026/09/inaugurating-the-era-of-super-intelligence/
- Meta Enterprise Platform (28 set, agregadores): Muse + Business Agent + Muse API + Muse Code; sem newsroom Meta clara no Scout.
- DevDay extras (Agents API computer use, Private Intelligence/ZDR, Bedrock Managed Agents com OpenAI, ChatGPT Space/Pages, Ultrafast): satélites de Dots e 6.1 Sol.
- Haiku 5.5: ainda teaser Anthropic.
Conclusões
A semana 25 set a 1 out desenhou o mid-tier workhorse (Sonnet 5.5), o frontier com acesso faseado (Argon), o bump que fecha gap de preço até o topo (GPT-6.1 Sol), o teammate always-on em duas casas (Dots e Autopilot) e a camada de containment de runtime e hardware (OpenShell + Sentry). O fio comum não é "mais um número no leaderboard". É envelope de custo por tarefa, desenho de quem pode tocar o modelo frontier primeiro, ciclo de vida do agent fora da sessão, e quem enforce a policy quando o agent tenta governar a si mesmo. Para quem constrói, a pergunta útil da semana é: qual modelo cabe em cada rota de preço, quem recebe Argon e quando, onde o Dot ou Autopilot dorme com computer próprio, e se a policy corre no sandbox ou também no DPU.