快讯

腾讯T1专攻Agent长任务:连续操作300多轮,跑分涨20分

9月11日,腾讯把Qwen3.5-122B-A10B专门拿去练终端Agent,做出了T1。它主要处理Linux终端里的复杂任务,单个任务最多能连续调用工具300多轮。Terminal-Bench2.1得分从底模的43.8%升到64.0%,涨了20.2分。这20.2分里,大头来自强化学习。SFT只把分数拉到49.4%,后面的强化学习又涨了14.6分。团队准备了约1.5万个终端任务,每个任务都配有自动测试。 Agent没把整个任务做完,只要完成了其中一些要求,也能拿到相应奖励。长任务还有一个麻烦。Agent真正干活和之后拿这段经历训练时,同一句内容可能被重新切成不同token,MoE也可能换一批专家处理。T1会把当时生成的token和选中的专家都记下来,训练时直接照着重放,把这种训推偏差压低了约三分之一。