Tudo que a redação publicou, em ordem cronológica. Cada item traz origem, fontes e tempo de leitura.
RESEARCH Cada Classificador de Guardrail Testado Falha em Verificação Formal de Segurança
RESEARCH Prova Matemática Mostra que Atenção em Transformers Estabiliza Previsivelmente
RESEARCH Agentes de IA Contornam Engenharia de Software, Arriscam Falhas em Produção
RESEARCH SLIM melhora performance de agentes LLM em 7 pontos percentuais
RESEARCH Shepherd Aumenta Precisão de Agentes em 90% Com Rastreamento por Bifurcação
RESEARCH WildClawBench: Claude Opus Atinge 62% em Avaliação de Agent em Ambiente Real
RESEARCH Modelos Sparse MoE Emparelham com Transformers Densos a 3× Mais Rápido em Inferência
RESEARCH Otimizador Muon Atinge 2× de Velocidade sobre AdamW no Treinamento de LLM em Produção
RESEARCH CIVeX Registra Zero Execuções Falsas em Workflows Confundidos
RESEARCH Artigo Desmonta Alegação sobre Descoberta Causal em Modelos de Previsão
RESEARCH Modelos Congelados Codificam Papéis Semânticos Sem Fine-Tuning
RESEARCH Flow-OPD Eleva Precisão do Stable Diffusion para 92 de 63
RESEARCH Conformal Path Reasoning reduz conjuntos de respostas em grafos de conhecimento em 40 por cento
RESEARCH Time de Los Alamos Treina Modelo de 8B que Generaliza em Benchmarks de Raciocínio
RESEARCH Contexto Mais Longo Degrada Cooperação de LLM, Revela Estudo
RESEARCH AutoTTS Reduz Custos de Inferência em 69,5% com Scaling Adaptativo em Tempo de Teste
RESEARCH Imposto de Acoplamento: Modo de Raciocínio Reduz Precisão Sob Limites de Token
RESEARCH Modelos Frontier Discordam sobre Políticas Ambíguas, DRIP-R Mostra
RESEARCH ActCam Controla Câmeras de Vídeo e Personagens Sem Fine-Tuning
RESEARCH Optimizer-Model Consistency Reduz Forgetting de LLMs no Fine-tuning
RESEARCH Precisão do Resolvedor de Matemática em IA Sobe 21.4% Com Geração Baseada em Verificador
RESEARCH Análise Arena: 66% dos Votos no Ranking se Cancelam
RESEARCH SIRA Supera Recuperação Densa Sem Treinamento ou Infraestrutura GPU
RESEARCH UniPool reduz orçamento de parâmetros MoE em 34 a 58 por cento
RESEARCH IA Matemática da DeepMind Atinge 48% em Problemas de Nível Pesquisa
RESEARCH MoEs esparsos mantêm precisão com poda de 87.5% dos pesos
RESEARCH Pesquisadores de Rice e Apple reduzem FID 22% na geração de imagens com correção de tokens
RESEARCH Entropia do Primeiro Token Rival Detecção de Alucinação Multi-Amostra
RESEARCH MRI-Eval Encontra LLMs com 97% em Flashcards, 30% em Recordação Livre
RESEARCH Q2RL Atinge 100% de Sucesso em Inserção de Pino, Superando BC e IBRL
RESEARCH Purdue e Georgia Tech Provam que Transformers Extraem Features Não-lineares em Contexto
RESEARCH LongSeeker Supera Competidores em Tarefas de Longo Horizonte
RESEARCH Sistema Agentic da Verkor Encerra RTL-para-Layout em 80 Horas
RESEARCH LLMs Multi-Agent Perdem Um Terço da Qualidade Mas Sinalizam Caminho para Recuperação
RESEARCH Testes de Segurança Falham Quando o Modelo do Claude Esconde Suspeitas no Seu Interior
RESEARCH Mozilla Encontrou 12 Bugs Críticos do Firefox Usando Claude Mythos
RESEARCH SymptomAI Supera Clínicos 2.47x em Ensaio Real
RESEARCH OpenSeeker-v2 supera Tongyi da Alibaba em benchmarks de busca agentic
RESEARCH Recomendador automático de agentes reduz etapas de engenharia de sistemas multi-agentes para uma
RESEARCH Framework Dreadnode Reduz Red Teaming de IA de Semanas para Horas