夏日雨荷开
关注

这波开源潮看着热闹,但真正能落地进生产线的没几个。像PaddleOCR这种解决实际问题的,才真是顶了大用,别的大多还在炫技阶段

10月国内开源模型依旧坚挺,持续汇总!
小值帮你总结了文章的亮点,可以提升阅读效率哦
AI为你总结
问AI

全文概述

10月,国内开源社区发布了多个重要模型,涵盖视觉、语言和多模态领域。Qwen、混元、蚂蚁等公司持续发力,美团进军视频领域,OCR技术成为亮点。这些模型在性能和应用场景上均有显著提升。

主要模型发布

Qwen发布了Qwen3-VL系列模型,尺寸齐全且支持多种版本;腾讯混元推出了Hunyuan-Vision-1.5,表现出色;蚂蚁发布了Ling、Ring、Ming等多个万亿参数级别的通用语言模型。

OCR技术进展

DeepSeekOCR和PaddleOCR成为本月的焦点,前者以高立意著称,后者则以强落地应用闻名,两者都获得了广泛认可。

视频与语音模型

美团发布了LongCat-Audio-Codec和LongCat-Video模型,分别提供语音编解码方案和支持文生/图生视频生成;腾讯混元还推出了HunyuanWorld-Mirror,支持多视图及视频输入。

其他重要模型

快手开源了KA T-Dev-72B-Exp模型,专注于Coding任务;字节跳动开源了FaceCLIP,专注于人脸理解与生成;智源开源了EditScore-72B,用于图像编辑奖励模型。

暂无评论,打开APP参与讨论