Tudo que a redação publicou, em ordem cronológica. Cada item traz origem, fontes e tempo de leitura.
RESEARCH Agentes Auto-Modificáveis Aumentam Pontuação de Benchmark para 0.61
RESEARCH DeltaBox reduz latência de checkpoint de agentes IA para 14 milissegundos
RESEARCH LCGuard Corrige Vazamento de KV-Cache em Sistemas Multi-Agent
RESEARCH Framework DelTA Melhora Raciocínio ao Corrigir Atribuição de Crédito em Nível de Token
RESEARCH Equilibrium Reasoners elevam precisão do Sudoku de 2,6% para 99% via test-time scaling
RESEARCH CARV da NVIDIA reduz computação de destilação 3D em 2–3×
RESEARCH Uma regra de hiperparâmetro captura a maioria dos ganhos de μP
RESEARCH RELEX reconstrói checkpoints RLVR a partir de 15% dos dados de treinamento
RESEARCH Pesquisadores de Pequim divulgam DeepWeb-Bench, expondo falhas de derivação em IA de fronteira
RESEARCH Fine-tuning apaga cadeias de raciocínio enquanto precisão se mantém alta
RESEARCH OlmoEarth v1.1 da Allen AI reduz computação em inferência de satélite em 3x
RESEARCH Modelos de IA Médica Subestimam Autonomia do Paciente
RESEARCH Pesquisadores Mapeiam Taxas de Alucinação por Tamanho de Modelo e Frequência de Dados
RESEARCH RRFP Atinge 2.77× de Throughput em Treinamento Pipeline-Parallel Multimodal
RESEARCH DashAttention alcança 75% de esparsidade mantendo precisão da atenção completa
RESEARCH EnvFactory eleva precisão de chamada de ferramentas do Qwen3 em 15% com dados sintéticos
RESEARCH Busca de Memória Substitui Atenção Linear em Prefixos Longos
RESEARCH Métricas do SAEBench Classificam SAEs de Forma Invertida, Auditoria Constata
RESEARCH Sistema Autônomo de Previsão de Doenças Supera Ensemble do CDC em Testes Cegos
RESEARCH FORGE Reduz Falhas de Agentes para 1% Sem Fine-Tuning do Modelo
RESEARCH Grep Supera Busca Vetorial em Recuperação Inline de Agentes
RESEARCH Agentes Frontier Alcançam 25% em Teste de Previsão do Mundo Real
RESEARCH Microsoft Detecta que GPT-5 Falha Contra Ataques Implausíveis
RESEARCH Modelos de ML Científico Discordam em 16% das Previsões Apesar de Accuracy Coincidente
RESEARCH Formalização de LLM Detecta 18.8% de Requisitos Ambíguos em Especificações de Segurança
RESEARCH TFlow reduz tokens de inferência multi-agente em 83% via injeção de pesos
RESEARCH Negligência de Negação Eleva Taxa de Crenças Falsas para 88,6% em LLMs Fine-Tuned
RESEARCH Por que Agentes em Produção Falham Sem Infraestrutura de Harness
RESEARCH Framework de Berkeley Reduz Latência de Agentes 1.3–2.2×
RESEARCH KV-Fold Estende Contexto de Transformers até 128K Sem Retreinamento
RESEARCH IBM Aumenta Precisão de Busca Zero-Shot 25% Com Refinamento de Query via LLM
RESEARCH Modelo Attractor de 27M Supera GPT o3 em Quebra-Cabeças de Lógica
RESEARCH Reward Hacking Não Detectado no Treinamento com Verificador Único
RESEARCH Aprendizado Sparse-to-Dense Eleva Scores MATH para 78.5% em Modelos Pequenos
RESEARCH Perdas padrão de balanceamento de carga degradam especialização de experts em SMoE em 3x