新模型编程能力提升明显,尤其在代码重构和调试上的表现,对开发者来说实用性很强,值得关注
新模型编程能力提升明显,尤其在代码重构和调试上的表现,对开发者来说实用性很强,值得关注

问AI全文概述
Anthropic发布了Claude 4.1 Opus,显著提升了编程、智能体任务和推理能力。新模型在编程基准测试中表现优异,尤其在SWE-bench Verified和Terminal-Bench中超越了竞争对手。此次发布旨在强化AI编程市场的护城河,并为即将到来的竞争做准备。
编程能力提升
Claude 4.1 Opus在软件工程基准测试SWE-bench Verified中得分74.5%,相比前代提升了2个百分点,超过OpenAI的o3模型和谷歌Gemini 2.5 Pro。在代理终端编程测试Terminal-Bench中,得分43.3%,比前代提高了4.1个百分点,远超竞争对手。
智能体任务改进
新模型增强了执行复杂任务的智能体能力,在多文件代码重构等复杂任务上表现出色。日本电商巨头乐天集团反馈称,新模型能精准定位并修正问题,避免引入新的错误,极大提升了调试效率。
推理能力保持稳定
尽管在编程领域取得了显著进展,Claude 4.1 Opus在研究生水平推理能力GPQA Diamond测试中的表现与前代持平,落后于Gemini 2.5 Pro和OpenAI o3。这表明其改进主要集中在编程领域。
商业表现及未来计划
Anthropic年化经常性收入从10亿美元增至接近50亿美元,驱动增长的核心是其在AI编程领域的技术壁垒。公司正在进行一轮高达50亿美元的融资,计划在未来几周内发布更大幅度的模型改进,以应对即将到来的GPT-5竞争。
