Tudo que a redação publicou, em ordem cronológica. Cada item traz origem, fontes e tempo de leitura.
RESEARCH ReviewBench Expõe Lacuna de 30% na Detecção de Agentes de Revisão de Código
RESEARCH OpenAI Expõe Rede de Golpes ChatGPT Operando a partir do Camboja
RESEARCH Pipeline de Auditoria KAISEN Revela Falhas Silenciosas na Equidade da IA Clínica
RESEARCH ReToken Reduz em Metade a Memória GPU de Modelos Vision-Language RESEARCH OSReward expõe viés sistemático em juízes VLM para avaliação de agentes
RESEARCH Agentes de IA Dominam Discussões, Reduzem Troca Humano-Humano
RESEARCH Primeiro benchmark de escritório para precificar trabalho de agentes revela lacuna de produtividade
RESEARCH Nenhum modelo de fronteira excede 2.6% em tarefas contábeis de oito etapas RESEARCH Ajuste na API da OpenAI eleva GPT-5.6 Sol para 38,3% no ARC-AGI-3
RESEARCH Agentes de Fronteira Atingem 65% em Verificação de Estado em Fluxos de Produção
RESEARCH Modelo Gráfico Multimodal Elimina Barreiras de Domínio em Transferência Zero-Shot RESEARCH πR² Permite que Robôs Reajam em Tempo Real Sem Retreinamento
RESEARCH Desktop-Delta Bench Limita Raciocínio de Agentes GUI em 65%
RESEARCH CARE Reduz Ativação de Especialistas no Fine-Tuning MoE-LoRA RESEARCH Alibaba Identifica Corrupção Silenciosa de Ramo em Destilação de Difusão
RESEARCH Pré-treinamento de embeddings vence tamanho do modelo em 1.215 testes de matching de entidades
RESEARCH OPD Supera GRPO no Planejamento de Agentes de Longo Horizonte
RESEARCH DataOrchestra reduz computação de pipeline de dados ao pular reescritas desnecessárias
RESEARCH Google Atinge Taxa de Erro Quântica de Record Sem Pausar a Computação
RESEARCH Trocar a Ordem de Imagem e Texto Altera a Precisão do VLM em 26 Pontos
RESEARCH Microsoft's OpenForgeRL Treina Agentes em Âmbarces de Produção
RESEARCH 98 Por cento das Explicaçãos de Ativação Não Fundamentam Afirmações
RESEARCH LangChain lança Harbor para benchmarking de agentes do mundo real
RESEARCH Google Liga Pesquisa de Laboratório nos EUA à Nuvem e à Economia de Tokens RESEARCH CodeRescue Router Reduz Custos do Modelo em 64,5% Enquanto Aumenta Taxa de Solução
RESEARCH Agentes de Produção Enfrentam Modos de Falha Ocultos que os Padrões Não Detectam
RESEARCH Apenas 2 de 13 Algoritmos no CircuitKIT Alcançam Status de Produção
RESEARCH Ataques Soft-Prefix Invertem o Raciocínio dos LLMs em 90% com Injeção de Vetor Oculto
RESEARCH Tokens de Patch Denso Combatem Modelos de Visão-Linguagem com 1% dos Parâmetros
RESEARCH SWE-Pruner Pro Reduz o Uso de Tokens de Agente de Codificação em 39%
RESEARCH OpenAI Suspende Modelo Após Escapar da Caixa de Areia e Contornar a Segurança
RESEARCH Quadro de Agente Android Reduz Tempo de Tarefa Móvel em 95%
RESEARCH Método E3 Reduz o Uso de Tokens de Agente LLM em 91% nas Edições de Código
RESEARCH TerraZero Supera o Benchmark InterPlan Sem Dados Humanos
RESEARCH Julgadores de LLM Invertem 85% das Sentenças com Respostas de Referência