Tudo que a redação publicou, em ordem cronológica. Cada item traz origem, fontes e tempo de leitura.
RESEARCH OlmoEarth v1.1 da Allen AI reduz computação em inferência de satélite em 3x
RESEARCH Modelos de IA Médica Subestimam Autonomia do Paciente
RESEARCH Pesquisadores Mapeiam Taxas de Alucinação por Tamanho de Modelo e Frequência de Dados
RESEARCH RRFP Atinge 2.77× de Throughput em Treinamento Pipeline-Parallel Multimodal
RESEARCH DashAttention alcança 75% de esparsidade mantendo precisão da atenção completa
RESEARCH EnvFactory eleva precisão de chamada de ferramentas do Qwen3 em 15% com dados sintéticos
RESEARCH Busca de Memória Substitui Atenção Linear em Prefixos Longos
RESEARCH Métricas do SAEBench Classificam SAEs de Forma Invertida, Auditoria Constata
RESEARCH Sistema Autônomo de Previsão de Doenças Supera Ensemble do CDC em Testes Cegos
RESEARCH FORGE Reduz Falhas de Agentes para 1% Sem Fine-Tuning do Modelo
RESEARCH Grep Supera Busca Vetorial em Recuperação Inline de Agentes
RESEARCH Agentes Frontier Alcançam 25% em Teste de Previsão do Mundo Real
RESEARCH Microsoft Detecta que GPT-5 Falha Contra Ataques Implausíveis
RESEARCH Modelos de ML Científico Discordam em 16% das Previsões Apesar de Accuracy Coincidente
RESEARCH Formalização de LLM Detecta 18.8% de Requisitos Ambíguos em Especificações de Segurança
RESEARCH TFlow reduz tokens de inferência multi-agente em 83% via injeção de pesos
RESEARCH Negligência de Negação Eleva Taxa de Crenças Falsas para 88,6% em LLMs Fine-Tuned
RESEARCH Por que Agentes em Produção Falham Sem Infraestrutura de Harness
RESEARCH Framework de Berkeley Reduz Latência de Agentes 1.3–2.2×
RESEARCH KV-Fold Estende Contexto de Transformers até 128K Sem Retreinamento
RESEARCH IBM Aumenta Precisão de Busca Zero-Shot 25% Com Refinamento de Query via LLM
RESEARCH Modelo Attractor de 27M Supera GPT o3 em Quebra-Cabeças de Lógica
RESEARCH Reward Hacking Não Detectado no Treinamento com Verificador Único
RESEARCH Aprendizado Sparse-to-Dense Eleva Scores MATH para 78.5% em Modelos Pequenos
RESEARCH Perdas padrão de balanceamento de carga degradam especialização de experts em SMoE em 3x
RESEARCH VECA Reduz Custo de Inferência em Vision Transformers para Tempo Linear
RESEARCH Benchmark MEME encontra 97% de falha em tarefas de memória de agentes
RESEARCH RuDE Prevê Sucesso de Fine-Tuning Sem Treinamento
RESEARCH RubricEM do Google treina agentes de pesquisa sem ground truth
RESEARCH Cada Classificador de Guardrail Testado Falha em Verificação Formal de Segurança
RESEARCH Prova Matemática Mostra que Atenção em Transformers Estabiliza Previsivelmente
RESEARCH Agentes de IA Contornam Engenharia de Software, Arriscam Falhas em Produção
RESEARCH SLIM melhora performance de agentes LLM em 7 pontos percentuais
RESEARCH Shepherd Aumenta Precisão de Agentes em 90% Com Rastreamento por Bifurcação
RESEARCH WildClawBench: Claude Opus Atinge 62% em Avaliação de Agent em Ambiente Real
RESEARCH Modelos Sparse MoE Emparelham com Transformers Densos a 3× Mais Rápido em Inferência
RESEARCH Otimizador Muon Atinge 2× de Velocidade sobre AdamW no Treinamento de LLM em Produção
RESEARCH CIVeX Registra Zero Execuções Falsas em Workflows Confundidos
RESEARCH Artigo Desmonta Alegação sobre Descoberta Causal em Modelos de Previsão
RESEARCH Modelos Congelados Codificam Papéis Semânticos Sem Fine-Tuning