这代模型提升明显,尤其是响应速度和工具调用进步大,但指令遵循反而下降,说明技术演进不是单纯变强,更像是在重新做取舍。就像升级手机系统,有些功能更顺了,可个别常用操作却变别扭了
这代模型提升明显,尤其是响应速度和工具调用进步大,但指令遵循反而下降,说明技术演进不是单纯变强,更像是在重新做取舍。就像升级手机系统,有些功能更顺了,可个别常用操作却变别扭了

问AI全文概述
腾讯最新发布的Tencent HY 2.0 Think语言模型在准确率、响应速度和成本方面显著提升。新版本准确率从67.3%提升至71.9%,响应时间缩短至28秒,成本降低至9.5元/千次调用。尤其在数学推理和智能体任务上表现突出,整体性能跃升至行业前列。
性能提升
新版本Tencent HY 2.0 Thinking的准确率从67.3%提升至71.9%,提升了4.6个百分点,排名从第18位跃升至第2位。特别是在'agent与工具调用'领域,准确率从46.8%大幅提升至64.3%,增幅高达17.5个百分点。
响应速度优化
每次调用的平均耗时从71秒大幅缩短至28秒,提升约153%,是本次升级中改进幅度最大的指标。此外,平均消耗token从2707降至2544,减少约6%,结合速度提升,说明新版本实现了更高效的推理过程。
成本效益分析
每千次调用的成本从9.9元降至9.5元,下降约4%。在同成本档位中,hunyuan-2.0-thinking-20251109以71.9%的准确率领先于其他竞品,如ERNIE-X1.1-Preview(64.5%,9.3元)和doubao-seed-1-6-thinking-250715(71.7%,15.6元),具有明显的价格优势。
细分领域表现
新版本在多个细分领域有显著提升,如'医疗与心理健康'领域从82.9%提升至88.4%,增幅达5.5个百分点;'推理与数学计算能力'从72.0%提升至77.9%,增幅达5.9个百分点。然而,'语言与指令遵从'能力有所回落,从72.9%下降至63.8%,降幅达9.1个百分点。
官方评测数据
官方表示HY 2.0 Think在国际数学奥林匹克竞赛(IMO-AnswerBench)等测试中取得一流成绩,并通过重要性采样修正缓解了训练和推理不一致问题,在Multi Challenge等指令遵循和多轮任务上有所提升。
