Agent Memory Is a Surface for Endogenous Authorization Laundering Paper • 2609.01836 • Published 4 days ago • 6
Evaluating the Hidden Costs of Personalization in Large Language Models Paper • 2608.28833 • Published 8 days ago • 28
On the Design of Qwen3.8-Next Architecture: Evaluation, Efficiency, and Training Stability Paper • 2608.30320 • Published 5 days ago • 51
StateM: Reaching 95.3% Raw Accuracy, or a \$15 Frontier Run, on Terminal-Bench 2.1 via Harness Scaling Paper • 2608.15089 • Published 21 days ago • 446
BDH-CQ: In-Context Learning with Recurrent Latent Reasoning Paper • 2608.09888 • Published 26 days ago • 772
Alaya-EVOKE: From Linear-Scaling Supervision to Endless World Paper • 2608.13546 • Published 23 days ago • 165
LLMRouter: Unified Infrastructure for Developing, Evaluating, and Deploying LLM Routers Paper • 2608.06867 • Published 29 days ago • 111
AutoDesign: Meta-Harness Optimization for Long-Horizon Agentic Design Paper • 2608.13560 • Published 23 days ago • 55
Spark-to-Paper: End-to-End Research Paper Generation as a Composable Skill Paper • 2608.11924 • Published 24 days ago • 290
Mechanist: AI as a Scientific Instrument for Discovering the Mechanisms of Intelligence Paper • 2608.12036 • Published 24 days ago • 86
Progressive Agent Skill Generation via Reinforcement Learning Paper • 2608.01678 • Published Aug 3 • 60
RW-Voice-EQ Bench: A Real World Benchmark for Evaluating Voice AI Systems Paper • 2607.14846 • Published Jul 16 • 11
DataFlow-Harness: A Grounded Code-Agent Platform for Constructing Editable LLM Data Pipelines Paper • 2607.16617 • Published Jul 18 • 144