June 24, 2026 Tmax: A simple recipe for terminal agents 最强开源终端代理 RL 训练方案,通过 TMAX-15K 数据集和 DPPO 训练实现 Terminal-Bench 2.0 上 27% 的最优性能 llm reasoning reinforcement-learning agent terminal-agent software-engineering