Sign in

Jonathan Bragg

@jbragg.bsky.social
261 followers 24 following 7 posts

Leading agents R&D at AI2. AI & HCI research scientist. jonathanbragg.com

PostsRepliesMedia
Jonathan Bragg @jbragg.bsky.social · 06/11/2025
Agent benchmarks don't measure true *AI* advances We built one that's hard & trustworthy: 👉 AstaBench tests agents w/ *standardized tools* on 2400+ scientific research problems 👉 SOTA results across 22 agent *classes* 👉 AgentBaselines agents suite 🆕 arxiv.org/abs/2510.21652 🧵👇
AstaBench with abstract measurement icons
171