OmniaBench: Benchmarking General AI Agents Across Diverse Scenarios Paper • 2607.14989 • Published Jul 16
WorkSurface-Bench: Benchmarking Enterprise Agents on Multi-Surface Knowledge Routing Paper • 2607.25765 • Published Jul 28