GPT、Claude、Qwen、DeepSeek 等模型的工具使用、任务规划与自主执行能力。
数据更新于
2026-07-21 23:44:09
截至 2026年7月,本页覆盖 Aider-Polyglot,
ench 2.0, Tool Decathlon 等评测基准,聚焦 大模型 Agent 能力评测排行榜
方向的模型对比。
基准评测
Agent能力评测
Aider-Polyglot τ²-Bench
AI
本文转载自:未知来源
原文链接:https://www.store.datalearner.com/leaderboards/category/agent?benchmark=Terminal+Bench+2.0&licenseType=closed&modelSize=100b&modelType=coderLLM
本文由 XZ导师app 自动发布 | 发布时间:2026/7/26 14:34:22