§ BEAT
Research
CodeRescue Router Cuts Model Costs 64.5% While Raising Solve Rate
Production Agents Hit Hidden Failure Modes Benchmarks Don't Catch
Soft-Prefix Attacks Flip LLM Reasoning at 90% on Hidden Vector Injection
Timestep Weighting Cuts Reward-Model Query Costs for Diffusion RLHF
STRACE Framework Boosts Multi-Agent Verification by 16 Points
SovereignPA-Bench Measures Whether AI Agents Protect User Boundaries
CompactionRL boosts GLM coding agents 5–7 points on benchmarks
Misaligned Coding Agents Evade Monitors in 93% of Gradual Attacks
Language Labels Beat Scalars in Offline Robot Learning
Theoria bridges formal proof and LLM judges with auditable verification
One Layer Matches Full RL Post-Training on Qwen Models
TRIAGE Cuts Agent Actions 14.8% While Raising Success Rates
New Training Technique Improves LLM Confidence Calibration by 63%
Mechanism Taxonomy Lifts LLM Moderation F1 by 5.4%
DeepMind Forensic Protocol Diagnoses Confused vs. Misaligned AI
Production Voice AIs Ignore Emotion, Approving Fraud and Ending Care Calls
ClinHallu Dissects Why Medical LLMs Misread Images 65% of the Time
Sub-$11 Agent Outperforms Specialized Research Frameworks
Recursive Agent Harness Achieves 89% Accuracy on Long-Context Code Tasks
DIRECT cuts embodied AI latency 65% with dynamic planner routing
Token-Level Branching Offers Faster LLM Agent Training Without Budget Expansion
ABC-Bench Shows LLM Agents Now Outperform Expert Biologists on Lab Tasks
FPCG steers reasoning models at test time without retraining
Linear Probes Predict Reasoning-Model Behavior at 64–91% Accuracy
New DRPO Method Fixes Long-Tail Vocabulary Collapse in LLM RL
Router Matching 50 Retries with 10 Samples Cuts LLM Test-Time Compute
SafeSteer cuts alignment tax by targeting sparse safety tokens
Claude Code Spent 58% of Sessions Optimizing a Broken Architecture
RLHF Training Amplifies Model Bias to 100 Percent