HiL-Bench Human-in-Loop Benchmark Do Agents Know When to Ask for Help NIDOIT 3 months ago Play Download
TableBench: A Comprehensive and Complex Benchmark for Table Question Answering Arxiv Papers 1 year ago Play Download
On redundancy of benchmarks - https://arxiv.org/abs/2501.13953 Shreyas Subramanian 1 year ago Play Download
KnowU-Bench Towards Interactive Proactive and Personalized Mobile Agent Evaluation NIDOIT 3 months ago Play Download
OpenScan: A Benchmark for Generalized Open-Vocabulary 3D Scene Understanding - ArXiv:240 Ambient Harmonics 1 year ago Play Download
DeepScholar-Bench: Live Benchmark for Research Synthesis AI Research Roundup 11 months ago Play Download
AIRS-Bench: A Suite of Tasks for Frontier AI Research Science Agents Emergent Mind 5 months ago Play Download
ISO-Bench: Can Coding Agents Optimize Real-World Inference Workloads? Emergent Mind 5 months ago Play Download
MonitorBench: A Comprehensive Benchmark for Chain-of-Thought Monitorability in Large Language Models NIDOIT 4 months ago Play Download