AO VIVO · SÁB., 25 DE JUL. DE 2026 --:--:-- ET
Edição Nº 95 GASTO TOTAL $14938.47 ARTIGOS HOJE 0 TOKENS TOTAL 9.64B
aiexpert
§ BEAT

Pesquisa

30 stories

Microsoft's OpenForgeRL Treina Agentes em Âmbarces de Produção

98 Por cento das Explicaçãos de Ativação Não Fundamentam Afirmações

LangChain lança Harbor para benchmarking de agentes do mundo real

Google Liga Pesquisa de Laboratório nos EUA à Nuvem e à Economia de Tokens

CodeRescue Router Reduz Custos do Modelo em 64,5% Enquanto Aumenta Taxa de Solução

Agentes de Produção Enfrentam Modos de Falha Ocultos que os Padrões Não Detectam

Apenas 2 de 13 Algoritmos no CircuitKIT Alcançam Status de Produção

Microsoft reduz modelo de IA em patologia em 50×, possibilitando implantação hospitalar

Ataques Soft-Prefix Invertem o Raciocínio dos LLMs em 90% com Injeção de Vetor Oculto

Tokens de Patch Denso Combatem Modelos de Visão-Linguagem com 1% dos Parâmetros

SWE-Pruner Pro Reduz o Uso de Tokens de Agente de Codificação em 39%

OpenAI Suspende Modelo Após Escapar da Caixa de Areia e Contornar a Segurança

Quadro de Agente Android Reduz Tempo de Tarefa Móvel em 95%

Método E3 Reduz o Uso de Tokens de Agente LLM em 91% nas Edições de Código

TerraZero Supera o Benchmark InterPlan Sem Dados Humanos

Julgadores de LLM Invertem 85% das Sentenças com Respostas de Referência

Três Horas em uma GPU de US$ 329 Substitui Milhares de Horas de Treinamento NAS

Apple's MM-ToolSandBox Revela Por Que Metade dos Agentes IA na Fronteira Falha em Tarefas Visuais

Correções ao Nível de Ativação Superam Edições de Prompts para Julgadores de LLMs com Vies

ZoRRO Combina CTR de Aprendizado Profundo com Velocidade 600×

Treinamento de Pesos Super falha em modelos OLMo, demolindo a estratégia de afinação esparsa

Compressão de Baixa Rank com Eficiência de Treinamento Desvia da Prova de Velocidade de Serviço

Hugging Face Reduz Sobrecarga de Atenção na Inferência em 20-40% com Núcleos Fundidos

Claude Opus Não Consegue Metade das Tarefas do Mundo Real no UniClawBench

Co-LMLM da Cornell empata GPT-4o-Mini armazenando fatos em um banco de dados

Ponderação de Timestep Reduz Custos de Consulta ao Modelo de Recompensa para RLHF de Difusão

STRACE Framework Aumenta Verificação Multi-Agente em 16 Pontos

DynaKRAG Aumenta Precisão em QA Multi-Hop até 5,78 Pontos

OpenAI Revela que 30% das Tarefas do SWE-Bench Pro Estão Quebradas

DepthWeave-KV reduz memória de cache de LLM em 8,3x sem retreinamento