Tudo que a redação publicou, em ordem cronológica. Cada item traz origem, fontes e tempo de leitura.
RESEARCH Treinamento de Pesos Super falha em modelos OLMo, demolindo a estratégia de afinação esparsa
RESEARCH Compressão de Baixa Rank com Eficiência de Treinamento Desvia da Prova de Velocidade de Serviço
RESEARCH Hugging Face Reduz Sobrecarga de Atenção na Inferência em 20-40% com Núcleos Fundidos
RESEARCH Claude Opus Não Consegue Metade das Tarefas do Mundo Real no UniClawBench
RESEARCH Co-LMLM da Cornell empata GPT-4o-Mini armazenando fatos em um banco de dados RESEARCH Ponderação de Timestep Reduz Custos de Consulta ao Modelo de Recompensa para RLHF de Difusão
RESEARCH STRACE Framework Aumenta Verificação Multi-Agente em 16 Pontos
RESEARCH DynaKRAG Aumenta Precisão em QA Multi-Hop até 5,78 Pontos
RESEARCH OpenAI Revela que 30% das Tarefas do SWE-Bench Pro Estão Quebradas
RESEARCH DepthWeave-KV reduz memória de cache de LLM em 8,3x sem retreinamento
RESEARCH SovereignPA-Bench Mede se Agentes de IA Protegem Limites do Usuário
RESEARCH Loop Duplo de Planejamento Resolve Fossa Semântica em Robôs Hierárquicos
RESEARCH SearchGen-20K Ensina Geradores Visuais Quando Pesquisar
RESEARCH CompactionRL impulsiona agentes de codificação GLM em 5–7 pontos nos benchmarks
RESEARCH Novo Método de Verificação Atinge 86,5% em Terminal-Bench Sem Ajuste Fino
RESEARCH Monitor de Limite Simples Iguala Salvaguardas Complexas de LLMs em Artigo do ICML
RESEARCH Agentes de Código Desalinhados Evitam Monitores em 93% dos Ataques Graduais
RESEARCH LACUNA Demonstra que Métodos de Desaprendizado Falham em Apagar PII de Modelos
RESEARCH Rótulos em Linguagem Natural Superam Escalares no Aprendizado Offline de Robôs
RESEARCH Theoria conecta prova formal e juízes LLM com verificação auditável
RESEARCH Três grandes benchmarks inflacionam escores de agentes de código, auditoria descobre
RESEARCH Treinamento do AutoMem Duplica Desempenho de Agentes em Tarefas de Longo Horizonte
RESEARCH Uma Camada Equivale ao Treinamento Completo com RL em Modelos Qwen
RESEARCH BrowserBC Eleva Taxa de Sucesso de Agentes de Navegador para 81% Usando Rastreamentos Humanos
RESEARCH Explicações de Modelos de Linguagem Rastreiam Mudanças de Comportamento Automaticamente
RESEARCH TRIAGE Reduz Ações de Agentes em 14.8% Enquanto Aumenta Taxas de Sucesso
RESEARCH Baselines de Prompting Simples Superam Métodos de Supervisão Complexa
RESEARCH Pesquisadores Fecham Lacuna Entre Agentes de IA e Habilidades Curadas Manualmente
RESEARCH Nova Técnica de Treinamento Melhora Calibração de Confiança de LLMs em 63%
RESEARCH Google Lança Modelo Tabular Zero-Shot, Mas Esconde Dados de Benchmark
RESEARCH Modelos de visão-linguagem roteiam conhecimento através de apenas 2,5% da rede RESEARCH Agentes de IA Dobram o Atrito de Merge em Nível de Repositório
RESEARCH Contexto da Língua Original Recupera Precisão Perdida em Cascatas Multilíngues RESEARCH ENS Atinge Precisão 10× em Benchmarks Difíceis de EDPs Sem Loops de Correção
RESEARCH Taxonomia de Mecanismo Eleva F1 de Moderação LLM em 5,4%