§ BEAT
Pesquisa
Google Liga Pesquisa de Laboratório nos EUA à Nuvem e à Economia de Tokens
OpenAI Suspende Modelo Após Escapar da Caixa de Areia e Contornar a Segurança
Quadro de Agente Android Reduz Tempo de Tarefa Móvel em 95%
Método E3 Reduz o Uso de Tokens de Agente LLM em 91% nas Edições de Código
TerraZero Supera o Benchmark InterPlan Sem Dados Humanos
Co-LMLM da Cornell empata GPT-4o-Mini armazenando fatos em um banco de dados
DepthWeave-KV reduz memória de cache de LLM em 8,3x sem retreinamento
Treinamento do AutoMem Duplica Desempenho de Agentes em Tarefas de Longo Horizonte
BrowserBC Eleva Taxa de Sucesso de Agentes de Navegador para 81% Usando Rastreamentos Humanos
Google Lança Modelo Tabular Zero-Shot, Mas Esconde Dados de Benchmark
ENS Atinge Precisão 10× em Benchmarks Difíceis de EDPs Sem Loops de Correção
Pesquisador Solitário Fica em 2º Lugar no Desafio de Robô Dobrando Roupas da ICRA
Sinal de Pontuação Gratuito Emerge dos Padrões de Pós-Treinamento RL
O Modelo 397B do Qwen Simula Ambientes de Agentes Melhor que o GPT-5.4
InSight Permite que Robôs Aprendam Autonomamente Novas Tarefas
Pipeline LLM OpenAnt Identifica 28 Vulnerabilidades Exploráveis no OpenSSL
Redes de Koopman Aumentadas por Física Garantem Generalização em Malhas Irregulares
Relatório da DeepMind Identifica Ganhos de Capacidade 'Desigual' como Risco ASI
Claude Fable 5 Corrigiu Código de Forma Autônoma e Custou US$ 110 em um Dia
Google's DiffusionGemma Atinge 1.000 Tokens por Segundo
GRPO Reduz Erros de Tratamento de Pausas em Agentes Full-Duplex Sem Perda Semântica
Camada Linear Única Supera Porta de 1M-Parâmetros no Teste de Aceleração de MTP
AHA-WAM alcança controle de robô 4.59 vezes mais rápido desacoplando Transformadores de Difusão
Pesquisadores de Waterloo reduzem custo de quantificação de incerteza em 99,7% com FASE
StreamMA Reduz Latência de Raciocínio Multi-Agente em 26,9×
Alibaba Desenvolve Skill-RM para Avaliação Unificada de Recompensas de LLM
Precisão de Manipulação de Robôs Salta 22,5% com Codificador Consciente de Movimento
Método HullFT Reduz Latência de Finetuning em Tempo de Teste em Comparação com SIFT
Busca Evolucionária Bidirecional Escapa dos Limites Autorregressivos na Razão