Haiku 5.5, open weights de peso e a conta da responsabilidade dos agents

Resumo da semana
Olá, bem-vindo à edição 06.
Entre 2 e 8 de outubro de 2026, a engenharia de IA teve uma semana de peças mais baratas, mais abertas e mais fáceis de encaixar, com o regulador começando a perguntar quem responde quando um agent sai da linha. A Anthropic fechou a família Claude 5.5 com o Haiku 5.5, um modelo pequeno, rápido e muito mais barato, feito para subagents e tarefas de volume. Mistral e Reflection anunciaram dois modelos grandes com pesos abertos, ambos prometidos para ainda este mês. A OpenAI abriu a Decisions API, um endpoint que responde com probabilidade, escolha ou nota em vez de texto. O Google lançou o EmbeddingGemma 2, embeddings multimodais que cabem no celular. Sierra e Meta propuseram um protocolo para agents pessoais conversarem com empresas. E, do lado das regras, o ICO britânico abriu consulta sobre agents enquanto um projeto de lei nos EUA tenta definir a responsabilidade de quem treina o modelo.
Boa leitura.
Claude Haiku 5.5
O que aconteceu
Em 7 de outubro de 2026 a Anthropic lançou o Claude Haiku 5.5 (claude-haiku-5-5), o modelo que faltava para completar a família 5.5, depois do Opus (edição 04) e do Sonnet (edição 05). A proposta é ser o modelo pequeno para trabalho de alto volume e sensível a custo: resumos, compactação de contexto, consultas a banco, classificação e o papel de subagent ao lado de um Opus ou Sonnet em tarefas de código. A Anthropic também diz que é o seu modelo mais rápido até agora na velocidade padrão, o que ajuda em atendimento ao vivo e em browser use.
O preço é o que mais chama atenção. Para prompts de até 100 mil tokens (cerca de 90% das requisições do Haiku anterior, segundo a empresa), custa US$0,10 por milhão de tokens de entrada e US$0,50 de saída, com cache reads a US$0,01. Acima de 100 mil tokens, sobe para US$0,50 e US$2,50. Na média, a Anthropic estima um custo cerca de 75% menor que o do Haiku 4.5, já considerando que o tokenizer novo conta aproximadamente 30% mais tokens para o mesmo texto.
O salto de capacidade também é grande para um modelo desse porte. No Terminal-Bench 4.0, o resultado foi de 0,0% no Haiku 4.5 para 39,2% (o Sonnet 5.5 marca 70,6%). Em computer use (OSWorld 2.1, subconjunto offline), de 15,7% para 72,4%. É o primeiro Haiku com ajuste de effort, então dá para escolher entre economizar ou deixar o modelo pensar mais. O contexto chega a 1 milhão de tokens e a saída a 128 mil.
Quem for migrar precisa olhar o guia com calma: budget_tokens manual, parâmetros de sampling fora do padrão e prefill de mensagem do assistente passam a retornar erro, e computer use exige o novo computer_toolset_20260801. No mesmo anúncio, o cache read do Sonnet 5.5 caiu pela metade (de US$0,20 para US$0,10), o que deixa o Sonnet cerca de 20% mais barato na maioria das tarefas agentic. Assinantes Max e Team ganham crédito mensal de API, e os SDKs de Python e TypeScript receberam computer use e browser use em beta. A própria Anthropic lembra que, para código agentic complexo, Sonnet e Opus continuam sendo a escolha certa.
Fontes originais
- Anthropic, Introducing Claude Haiku 5.5 (7 out 2026): https://www.anthropic.com/claude-haiku-5-5
- Claude Platform, What's new in Claude Haiku 5.5: https://platform.claude.com/docs/en/models/haiku-5-5/whats-new-haiku-5-5
- AWS Machine Learning Blog, Introducing Claude Haiku 5.5 on AWS: https://aws.amazon.com/blogs/machine-learning/introducing-claude-haiku-5-5-on-aws/
Mistral Large 4 e Reflection Beam
O que aconteceu
Dois anúncios em sequência movimentaram o mundo dos modelos com pesos abertos. Em 5 de outubro de 2026 a Reflection apresentou o Beam, seu primeiro modelo open weight. No dia seguinte, a Mistral abriu o preview público do Mistral Large 4. Os dois têm algo em comum: dá para começar a testar agora, a Mistral por API e a Reflection por lista de espera, mas os pesos só saem até o fim do mês.
O Mistral Large 4 (apelidado pela própria empresa de "le Chonk") tem 1 trilhão de parâmetros, com 52 bilhões ativos por token, e é multimodal nativo. Foi treinado do zero em 3.800 GPUs NVIDIA Grace Blackwell nos datacenters da Mistral na Europa, e o preview roda na mesma infraestrutura, via API no Mistral Studio. Entre os números divulgados estão 61,7% no DeepSWE v1.1, 28,3% no Terminal-Bench 4, 59,9% no AutomationBench e 93% no Cybench. A empresa dá peso especial à segurança: enquanto prepara os pesos, faz red-teaming com especialistas em cibersegurança, parceiros e autoridades, e defende que um modelo aberto rodando on-premise evita recusas do provedor no meio de uma resposta a incidente. Também reporta 93,3% de ataques barrados no benchmark B3, da Lakera, que mede resistência a prompt injection.
O Beam é um Mixture-of-Experts com 501 bilhões de parâmetros no total e 23 bilhões ativos, voltado a código, raciocínio e agents. A Reflection fez o pretraining com 23,8 trilhões de tokens e um ciclo de reinforcement learning com mais de 100 milhões de rollouts em 10,5 mil GPUs GB300 ao longo de quatro semanas. O contexto efetivo chega a 1 milhão de tokens. A empresa reporta 80,9 no SWE-bench Verified e diz alcançar resultados de raciocínio parecidos com os do GLM-5.2 usando de três a quatro vezes menos computação de inferência. Pesos, relatório técnico e model card saem ainda em outubro, sob licença Apache 2.0; até lá, o acesso é por lista de espera.
Para quem pensa em hospedar o próprio modelo, são duas opções grandes de laboratórios ocidentais com pesos prometidos para as próximas semanas. Vale lembrar que todos os números, por enquanto, vêm das próprias empresas, e que a Mistral ainda vai detalhar a arquitetura e a metodologia de pós-treino junto com os pesos.
Fontes originais
- Mistral, Introducing Mistral Large 4 (6 out 2026): https://mistral.ai/news/mistral-large-4/
- Reflection, Introducing Beam (5 out 2026): https://reflection.ai/blog/introducing-beam
OpenAI Decisions API
O que aconteceu
Em 6 de outubro de 2026 a OpenAI abriu para todos os desenvolvedores, em beta pública, a Decisions API. Ela tinha sido apresentada em preview limitado no DevDay, uma semana antes, e agora ganhou documentação, preço e suporte nos SDKs oficiais.
A ideia é simples: em vez de pedir um texto ao modelo e depois interpretar a resposta, a aplicação faz perguntas com formato fixo e recebe respostas tipadas. São três tipos. O predicate devolve a probabilidade de uma afirmação ser verdadeira, por exemplo "esta foto mostra um produto amassado?". O choice escolhe uma opção entre valores que você define, como o departamento que deve atender uma reclamação, e vem com a probabilidade de cada opção e um campo de confiança. O score avalia a entrada contra níveis ordenados, como a gravidade de um bug, e devolve uma média ponderada que pode cair entre dois níveis. Dá para mandar várias perguntas independentes na mesma requisição, sobre o mesmo texto ou imagem.
O endpoint é POST /v1/decisions e, por enquanto, só funciona com o gpt-6-luna. Segundo a OpenAI, as respostas saem cerca de 10 vezes mais rápido do que pedir a mesma coisa ao Luna pela Responses API. O preço é de US$0,10 por milhão de tokens de entrada, sem cobrança de saída nem de leitura ou escrita de cache. Imagens precisam ir em base64 dentro da requisição (URLs hospedadas e file_id não são aceitos). Há suporte a Zero Data Retention e HIPAA para clientes elegíveis, além de residência de dados nos EUA e na Europa. A versão estável está prevista para as próximas semanas, e a documentação recomenda continuar com Structured Outputs quando a aplicação precisa gerar um objeto JSON próprio ou um texto explicativo.
Na prática, o endpoint mira tarefas que ocupam boa parte de muitos agents: classificar, rotear e priorizar. Os primeiros testes publicados por desenvolvedores no fórum da OpenAI trazem ressalvas. Ainda não existe cache de entrada, o que pesa para quem repete o mesmo contexto em toda chamada. E um usuário mostrou que perguntas do tipo choice concentraram probabilidade demais na opção mais provável, enquanto predicate ficou bem mais calibrado no mesmo experimento.
Fontes originais
- OpenAI API Docs, Decisions: https://developers.openai.com/api/docs/guides/decisions
- OpenAI Developer Community, Decisions API is now available in Public Beta (6 out 2026): https://community.openai.com/t/decisions-api-is-now-available-in-public-beta/1403877
EmbeddingGemma 2
O que aconteceu
Em 6 de outubro de 2026 o Google DeepMind lançou o EmbeddingGemma 2, a segunda versão do seu modelo aberto de embeddings. A primeira, só de texto, passou de 20 milhões de downloads e virou base de muita busca local e de pipelines de RAG que preferem não mandar dados para fora do aparelho. A nova versão coloca texto, código, imagem, áudio e vídeo no mesmo espaço vetorial, então uma nota de voz pode encontrar um trecho de vídeo, e uma busca por texto pode percorrer horas de gravações de áudio.
O modelo tem 740 milhões de parâmetros, é construído sobre a arquitetura do Gemma 4 e sai sob licença Apache 2.0, que permite uso comercial. Ele é modular: para quem só precisa de texto, bastam cerca de 270 milhões de parâmetros, e os encoders de visão (170 milhões) e de áudio (300 milhões) são opcionais. Com Matryoshka Representation Learning, os vetores de 768 dimensões podem ser cortados para 512, 256 ou 128, com até seis vezes menos espaço no banco vetorial. A janela de contexto subiu para 8 mil tokens, quatro vezes a da primeira versão, o que comporta, por exemplo, cerca de 5,5 minutos de áudio ou 29 imagens.
O ganho mais relevante para quem desenvolve está em código: no MTEB Code, a nota foi de 68,76 para 78,68, e o Google cita indexação local de repositórios, busca semântica de código e recuperação de contexto para agents de programação como usos naturais. No celular, os números também ajudam. Quantizado, num Pixel 11 Pro, o modelo usa cerca de 191 MB de RAM só com texto e cerca de 567 MB na versão multimodal completa. Como compartilha o tokenizer de texto e o encoder de áudio com o Gemma 4, os dois podem rodar juntos num mesmo pipeline com menos memória somada.
Os pesos estão no Hugging Face e no Kaggle, e o lançamento chegou com suporte em transformers, sentence-transformers, MLX, vLLM, llama.cpp, SGLang, Ollama e LMStudio, além de Qdrant para guardar os vetores e um guia da Unsloth para fine-tuning. A chegada ao Model Garden da plataforma corporativa do Google ainda aparece como "em breve". Os resultados de benchmark são os publicados pelo próprio Google no model card.
Fontes originais
- Google, EmbeddingGemma 2 (6 out 2026): https://blog.google/innovation-and-ai/technology/developers-tools/embeddinggemma-2/
Personal Agent Protocol
O que aconteceu
Em 6 de outubro de 2026 a Sierra, empresa de agents de atendimento, anunciou o Personal Agent Protocol, um padrão aberto que ela e a Meta estão desenvolvendo com Genesys, Instinct, Rocket, Shopify, Stripe e Walmart. O objetivo é definir como um agent pessoal (aquele que agenda consulta, compra passagem ou cota seguro em nome de alguém) conversa com as empresas.
O problema de partida é conhecido de quem já viu um agent trabalhando. Hoje a maioria deles usa sites e apps como uma pessoa: carrega páginas, preenche formulários e, quando trava, liga para o suporte ou abre o chat. É lento e falha com frequência. Uma conexão direta resolveria em segundos, mas precisa servir a três lados ao mesmo tempo: o consumidor quer o trabalho feito certo, a marca quer saber quando é um agent agindo e decidir o que ele pode fazer, e quem constrói o agent quer um jeito consistente de se conectar.
O desenho proposto começa no site da empresa, onde o agent descobre o que ela oferece e como chegar lá. Em seguida, ele abre uma sessão em nome do usuário, que pode começar como visitante, o suficiente para checar estoque ou política de troca. Quando a tarefa precisa da conta do cliente, a pessoa faz login na página da empresa ou usa credenciais já configuradas no agent, e decide se o acesso é só de leitura ou também de escrita. A sessão é construída sobre OAuth e continua entre canais, então uma pergunta feita antes do login e uma alteração de pedido feita depois fazem parte da mesma visita. A partir daí, o agent pode navegar pelo site, usar as APIs da empresa (com padrões como MCP e OpenAPI) ou conversar com o agent da própria empresa, como num pedido de garantia.
Por enquanto, é um anúncio. A Sierra promete publicar a especificação v0.1 ainda em outubro, além de organizar workshops de design com os interessados e liberar uma implementação de referência. Entre as próximas etapas citadas estão permissões mais detalhadas por ação, notificações push (avisar o agent de que o voo atrasou ou de que o pedido saiu) e uma extensão de pagamentos para concluir compras sem compartilhar o número do cartão.
Fontes originais
- Sierra, Introducing Personal Agent Protocol (6 out 2026): https://sierra.ai/blog/introducing-personal-agent-protocol
- SiliconANGLE, Meta teams up with Sierra on new standards for AI agent commerce (6 out 2026): https://siliconangle.com/2026/10/06/meta-teams-up-with-bret-taylors-sierra-technologies-on-new-standards-for-ai-agent-commerce/
Quem responde pelo agent: ICO abre consulta e CLAIM Act chega em rascunho
O que aconteceu
Dois movimentos regulatórios desta semana giram em torno da mesma pergunta: quando um agent age sozinho e causa problema, quem responde?
No Reino Unido, o ICO (a autoridade de proteção de dados) publicou em 8 de outubro de 2026 um relatório sobre os maiores desenvolvedores de modelos de base. Depois de um programa de supervisão de dois anos, dez empresas (Amazon, Anthropic, Apple, Cohere, DeepSeek, Google, Meta, Microsoft, OpenAI e Stability AI) fizeram ou se comprometeram a fazer mudanças, como informações de transparência mais claras, mecanismos melhores para as pessoas exercerem seus direitos e avaliações mais rigorosas de salvaguardas. O ICO também abriu uma consulta pública de seis semanas, até 20 de novembro, sobre riscos de proteção de dados em agentic AI, cobrindo segurança, transparência, accountability, decisões automatizadas, justiça e uso lícito de dados. E confirmou consultas a OpenAI, Anthropic, Meta e ao AI Security Institute britânico sobre testes recentes em que agents teriam burlado proteções, usado canais de comunicação não autorizados e acessado sistemas externos como a Hugging Face.
Nos EUA, a deputada Lori Trahan apresentou em 7 de outubro o rascunho de discussão do CLAIM Act (Clear Liability for Artificial Intelligence Misconduct Act). O texto torna o desenvolvedor, definido como quem faz o treinamento inicial do sistema, responsável por danos razoavelmente previsíveis a quem não é usuário. Isso vale quando a conduta da IA configuraria negligência, ilícito civil ou crime se fosse praticada por uma pessoa, e quando nem o usuário nem quem fez fine-tuning ou montou o scaffold pretendeu aquilo ou foi negligente. Há presunção refutável de estado mental, e a defesa de que uma IA não tem mente fica vetada. O projeto prevê ação privada com prazo de três anos, não substitui leis estaduais e perde validade cinco anos depois de aprovado. Em 1 de outubro, uma semana antes, os senadores Josh Hawley e Chris Murphy tinham anunciado o AI Agent Accountability Act, que usa a lei federal contra invasão de computadores (CFAA) para responsabilizar operadores e desenvolvedores de agents por ataques.
Nenhum desses textos é lei, e a consulta do ICO só vira orientação depois de novembro. Os dois, porém, já separam papéis que existem no dia a dia de quem constrói agents: quem treina o modelo, quem adapta ou monta o scaffold e quem opera.
Fontes originais
- ICO, ICO secures changes from leading AI developers as scrutiny extends to AI agents (8 out 2026): https://ico.org.uk/about-the-ico/media-centre/news-and-blogs/2026/10/ico-secures-changes-from-leading-ai-developers-as-scrutiny-extends-to-ai-agents/
- Rep. Lori Trahan, texto do CLAIM Act (discussion draft): https://trahan.house.gov/uploadedfiles/claim_act_final.pdf
- Sen. Josh Hawley, Senators Hawley, Murphy Announce Bipartisan AI Agent Accountability Act (1 out 2026): https://www.hawley.senate.gov/senators-hawley-murphy-announce-bipartisan-ai-agent-accountability-act/
- POLITICO, Trahan unveils AI liability discussion draft (7 out 2026): https://www.politico.com/live-updates/2026/10/07/congress/trahan-unveils-ai-liability-discussion-draft-01109817
Demais da curadoria
- GPT-6 com Intelligent UI no ChatGPT (7 out): o ChatGPT passa a responder com gráficos, botões, formulários e pequenas ferramentas montadas pelo modelo a partir de uma biblioteca de componentes, e começa a responder enquanto ainda pensa. Sol para planos pagos, Luna para Free e Go; Work e Codex não mudam. https://openai.com/index/gpt-6-for-everyone/
- Scale AgentEnv (5 out): a Scale abriu o código do framework que usa para montar ambientes de reinforcement learning, com Environment Card, acesso via MCP, REST ou CLI e sandboxes plugáveis (Docker, Modal, E2B). https://labs.scale.com/blog/introducing-agentenv
Conclusões
A semana deixou um retrato coerente. O modelo pequeno ficou bom o bastante para virar o operário dos agents (Haiku 5.5), os pesos abertos grandes ganharam dois representantes ocidentais com data marcada (Mistral Large 4 e Beam), e tarefas que antes pediam uma geração inteira de texto ganharam um endpoint próprio, rápido e barato (Decisions). Por baixo disso, a busca de contexto desceu para o aparelho (EmbeddingGemma 2) e a conversa entre agents e empresas começou a ganhar regras de identidade e permissão (Personal Agent Protocol). Ao mesmo tempo, reguladores dos dois lados do Atlântico começaram a escrever quem responde quando um agent passa do limite. Para quem constrói, fica a tarefa prática de dividir o trabalho entre modelos de tamanhos diferentes, registrar o que cada agent fez e deixar claro quem autorizou o quê.