Paper·Multi-environment agents
THUDM
AgentBench
A benchmark proposal for evaluating LLMs as agents across multiple environments and task categories.
Research papers that clarify task design, tool use, simulated users, grading, leakage, and long-horizon evaluation.
A benchmark proposal for evaluating LLMs as agents across multiple environments and task categories.