[NS :
最近用开源Agent框架Metis1.1.0跑了一轮Terminal-Bench2.1,结果比我预期的更有意思。这次固定了模型、版本、89个任务、运行环境和预算,只更换Agent框架:Metis+DeepSeekV4Flash:73/89,82.02%OpenCode+DeepSeekV4Flash:60/89,6
wholiver] 我做了一个 Agent,他把 deepseek 的编程性能推到了 Fable 5 的等级最近用开源Agent框架Metis1.1.0跑了一轮Terminal-Bench2.1,结果比我预期的更有意思。这次固定了模型、版本、89个任务、运行环境和预算,只更换Agent框架:Metis+DeepSeekV4Flash:73/89,82.02%OpenCode+DeepSeekV4Flash:60/89,6