§ BEAT
Pesquisa
Microsoft's OpenForgeRL Treina Agentes em Âmbarces de Produção
98 Por cento das Explicaçãos de Ativação Não Fundamentam Afirmações
LangChain lança Harbor para benchmarking de agentes do mundo real
Google Liga Pesquisa de Laboratório nos EUA à Nuvem e à Economia de Tokens
CodeRescue Router Reduz Custos do Modelo em 64,5% Enquanto Aumenta Taxa de Solução
Agentes de Produção Enfrentam Modos de Falha Ocultos que os Padrões Não Detectam
Apenas 2 de 13 Algoritmos no CircuitKIT Alcançam Status de Produção
Microsoft reduz modelo de IA em patologia em 50×, possibilitando implantação hospitalar
Ataques Soft-Prefix Invertem o Raciocínio dos LLMs em 90% com Injeção de Vetor Oculto
Tokens de Patch Denso Combatem Modelos de Visão-Linguagem com 1% dos Parâmetros
SWE-Pruner Pro Reduz o Uso de Tokens de Agente de Codificação em 39%
OpenAI Suspende Modelo Após Escapar da Caixa de Areia e Contornar a Segurança
Quadro de Agente Android Reduz Tempo de Tarefa Móvel em 95%
Método E3 Reduz o Uso de Tokens de Agente LLM em 91% nas Edições de Código
TerraZero Supera o Benchmark InterPlan Sem Dados Humanos
Julgadores de LLM Invertem 85% das Sentenças com Respostas de Referência
Três Horas em uma GPU de US$ 329 Substitui Milhares de Horas de Treinamento NAS
Apple's MM-ToolSandBox Revela Por Que Metade dos Agentes IA na Fronteira Falha em Tarefas Visuais
Correções ao Nível de Ativação Superam Edições de Prompts para Julgadores de LLMs com Vies
ZoRRO Combina CTR de Aprendizado Profundo com Velocidade 600×
Treinamento de Pesos Super falha em modelos OLMo, demolindo a estratégia de afinação esparsa
Compressão de Baixa Rank com Eficiência de Treinamento Desvia da Prova de Velocidade de Serviço
Hugging Face Reduz Sobrecarga de Atenção na Inferência em 20-40% com Núcleos Fundidos
Claude Opus Não Consegue Metade das Tarefas do Mundo Real no UniClawBench
Co-LMLM da Cornell empata GPT-4o-Mini armazenando fatos em um banco de dados
Ponderação de Timestep Reduz Custos de Consulta ao Modelo de Recompensa para RLHF de Difusão
STRACE Framework Aumenta Verificação Multi-Agente em 16 Pontos
DynaKRAG Aumenta Precisão em QA Multi-Hop até 5,78 Pontos
OpenAI Revela que 30% das Tarefas do SWE-Bench Pro Estão Quebradas