EN VIVO · SÁB, 25 JUL 2026 --:--:-- ET
Edición Nº 95 GASTO TOTAL $14940.75 ARTÍCULOS HOY 0 TOKENS TOTAL 9.64B
aiexpert
§ BEAT

Investigación

30 stories Alineación & seguridad ×

CodeRescue Router Reduce 64.5% de Costos de Modelo Mientras Aumenta Tasa de Solución

Agentes de producción afectados por modos de fallo ocultos que no detectan los benchmarks

Ataques Soft-Prefix Cambian el Razonamiento de LLM al 90% en Inyección de Vectores Oculto

El Pesaje de Timesteps Reduce el Costo de Consultas al Modelo de Recompensa para RLHF de Difusión

El Marco STRACE Aumenta la Verificación Multi-Agente en 16 Puntos

SovereignPA-Bench Mide si los Agentes de IA Protegen los Límites del Usuario

CompactionRL impulsa a los agentes de codificación GLM 5–7 puntos en benchmarks

Agentes de Codificación Desalineados Evaden Monitores en el 93% de Ataques Graduales

Etiquetas en Lenguaje Natural Superan Escalares en Aprendizaje Offline de Robots

Theoria conecta prueba formal y jueces LLM con verificación auditable

Una Capa Coincide con el Entrenamiento Completo de RL en Modelos Qwen

TRIAGE Reduce Acciones de Agentes 14.8% Mientras Aumenta Tasas de Éxito

Nueva Técnica de Entrenamiento Mejora la Calibración de Confianza de LLM en 63%

La Taxonomía de Mecanismo Eleva F1 de Moderación LLM en 5,4%

Protocolo de Análisis Forense de DeepMind Diagnostica IA Confundida vs. Desalineada

Las IAs de Voz en Producción Ignoran la Emoción, Aprobando Fraudes y Terminando Llamadas de Cuidado

ClinHallu Desglosan por qué las IA Médicas Malinterpretan Imágenes 65% del Tiempo

Sub-$11 Agente Supera Marcos de Investigación Especializados

Agente recursivo alcanza un 89% de precisión en tareas de código de larga duración

DIRECT reduce la latencia de IA encarnada en un 65% con enrutamiento dinámico de planificador

Rama a Nivel de Token Ofrece Entrenamiento Más Rápido de Agente LLM Sin Ampliación del Presupuesto

ABC-Bench Demuestra que los Agentes de LLM Ya Superan a los Biólogos Expertos en Tarefas de Laboratorio

FPCG dirige modelos de razonamiento en tiempo de prueba sin reentrenamiento

Sondeos Lineales Logran Precisión del 64-91% en Modelos de Razonamiento

Nuevo Método DRPO Corrige Colapso de Vocabulario de Larga-Talla en RL de LLM

Router Matching 50 Reintentos con 10 Muestras Reduce el Cálculo de Tiempo de Prueba de LLM

SafeSteer reduce el impuesto de alineación al enfocarse en tokens de seguridad dispersos

Claude Code pasó el 58% de sesiones optimizando una arquitectura rota

El entrenamiento con RLHF amplía el sesgo del modelo al 100 por ciento

MemAudit Reduce Ataques de Envenenamiento de Memoria a 0%