小逸仙仙
关注

这代模型提升明显,尤其是响应速度和工具调用进步大,但指令遵循反而下降,说明技术演进不是单纯变强,更像是在重新做取舍。就像升级手机系统,有些功能更顺了,可个别常用操作却变别扭了

腾讯 Tencent HY 2.0 Think 实测
小值帮你总结了文章的亮点,可以提升阅读效率哦
AI为你总结
问AI

全文概述

腾讯最新发布的Tencent HY 2.0 Think语言模型在准确率、响应速度和成本方面显著提升。新版本准确率从67.3%提升至71.9%,响应时间缩短至28秒,成本降低至9.5元/千次调用。尤其在数学推理和智能体任务上表现突出,整体性能跃升至行业前列。

性能提升

新版本Tencent HY 2.0 Thinking的准确率从67.3%提升至71.9%,提升了4.6个百分点,排名从第18位跃升至第2位。特别是在'agent与工具调用'领域,准确率从46.8%大幅提升至64.3%,增幅高达17.5个百分点。

响应速度优化

每次调用的平均耗时从71秒大幅缩短至28秒,提升约153%,是本次升级中改进幅度最大的指标。此外,平均消耗token从2707降至2544,减少约6%,结合速度提升,说明新版本实现了更高效的推理过程。

成本效益分析

每千次调用的成本从9.9元降至9.5元,下降约4%。在同成本档位中,hunyuan-2.0-thinking-20251109以71.9%的准确率领先于其他竞品,如ERNIE-X1.1-Preview(64.5%,9.3元)和doubao-seed-1-6-thinking-250715(71.7%,15.6元),具有明显的价格优势。

细分领域表现

新版本在多个细分领域有显著提升,如'医疗与心理健康'领域从82.9%提升至88.4%,增幅达5.5个百分点;'推理与数学计算能力'从72.0%提升至77.9%,增幅达5.9个百分点。然而,'语言与指令遵从'能力有所回落,从72.9%下降至63.8%,降幅达9.1个百分点。

官方评测数据

官方表示HY 2.0 Think在国际数学奥林匹克竞赛(IMO-AnswerBench)等测试中取得一流成绩,并通过重要性采样修正缓解了训练和推理不一致问题,在Multi Challenge等指令遵循和多轮任务上有所提升。

暂无评论,打开APP参与讨论