当前位置:首页 > 科技资讯 > 正文

大模型进化:从问答到执行,国产AI的新挑战

1月27日,备受瞩目的两家国内大模型初创公司,不约而同地发布了其最新、最重要的开源更新:

DeepSeek推出了DeepSeek-OCR 2,这是其去年震撼行业的DeepSeek-OCR的一次关键升级;Kimi也发布了K2.5,继续推进其超长上下文、多模态与“智能化”之路。

表面上看,这是两种不同方向的模型迭代。

DeepSeek-OCR 2重新探讨了“模型应如何‘读’信息”,通过新的视觉编码机制,让大模型学习人类的视觉逻辑,将原本庞大冗长的文本输入压缩为更高密度的“视觉语义”。

简而言之,它试图改变AI“读文档”的方式,使模型无需逐字逐句地“硬读”,而是像人类一样先审视版面、抓住重点,再理解含义。这意味着未来让AI帮你读长文档、查资料、整理表格,可能会更快、更经济、更可靠。

大模型进化:从问答到执行,国产AI的新挑战 大模型 AI进化 执行能力 视觉编码 第1张

Kimi K2.5则走向另一个方向:不仅回答问题,更将AI推向“能干活”的层面。更长的记忆、更强的多模态理解,加上对复杂任务的分解和执行能力,使得它更接近“数字助理”的体验,而不仅仅是一个只会对话的聊天窗口。

Kimi自称为迄今为止最智能、最全能的模型,同时支持视觉与文本输入、思考与非思考模式、对话与Agent任务。

大模型进化:从问答到执行,国产AI的新挑战 大模型 AI进化 执行能力 视觉编码 第2张

一个聚焦于语言模型输入效率的变革,一个聚焦于通用智能与复杂任务协作能力。但在同一时间点,它们共同指向了一个更重要的问题:大模型的能力升级,正从“参数和对话能力”,转向更底层、更工程化的能力重构。

AI正在升级的,已经不仅仅是更聪明的大脑。

从输入到执行:国产AI的两条升级路径

去年发布的DeepSeek-OCR首次让行业意识到,大模型基于单词和Token逐个输入的方式可以被重新设计。最新发布的DeepSeek-OCR 2更是解决了一个更具体、更困难的问题:模型究竟该如何“读”一份复杂的文档。

过去,AI处理文档的方式非常机械。无论是PDF、合同还是财报,本质上都是先被拆成一段段文字,再按顺序塞进模型。这种方式的问题显而易见:

一方面,长文档会迅速消耗上下文窗口,成本高、效率低;另一方面,表格、多栏排版、注释和正文之间的关系,在“拆字”的过程中经常被破坏。

DeepSeek在OCR-2中给出的答案,是进一步强化其“视觉编码”思路,不再把文档当作一串文字,而是当作一个需要被“阅读”的视觉对象。

相比一代,OCR 2的关键变化不仅仅是压缩率,而是引入了更接近人类阅读习惯的逻辑,从上一代的CLIP(切片)架构转向以Qwen2为基础的LM(语言模型)视觉编码器。模型不再是同时、平均地处理整页内容,而是学会区分结构:

哪里是标题,哪里是表格,哪些信息彼此相关,哪些需要先读、哪些可以后看。

大模型进化:从问答到执行,国产AI的新挑战 大模型 AI进化 执行能力 视觉编码 第3张

换句话说,它开始理解“版面本身就是信息的一部分”。

这种变化带来的直接价值,并非体现在“模型更聪明”这样的抽象评价上,而是体现在一系列非常具体的体验提升上。例如,当你让AI帮你快速阅读一份几十页的报告时,它无需逐字阅读就能给出结论;在处理复杂表格时,也不再频繁出现列错位、字段错配的问题。

更重要的是,由于输入被高度压缩,同样的任务可以用更低的成本、更短的时间完成。这也是为什么DeepSeek-OCR 2对真正的AI应用来说意义更大——它有潜力让AI更适合被放入真实的文档流程中,无论是检索、比对、摘要还是结构化信息抽取。

相比之下,DeepSeek-OCR 2重新设计了AI的“输入端”,而Kimi K2.5则关注AI代理完成复杂任务的能力。

事实上,今天的问题再复杂,AI也能回答;但一旦涉及多步骤、多材料、需要反复引用上下文的任务时,模型就容易“忘前忘后”或停留在建议层面。尽管AI的能力已经相当成熟,但许多用户仍会面临类似的体验。

Kimi在K2.5中继续将重心放在“长记忆+多模态+智能体”这条路上上,本质上是在尝试让AI从“答题模式”走向“执行模式”。

大模型进化:从问答到执行,国产AI的新挑战 大模型 AI进化 执行能力 视觉编码 第4张

这也是Kimi K2.5强调自己“更全能”的原因所在。它追求的并非某一个能力点的极限而是能否承接更长、更复杂、更接近真实工作的任务链条。

大模型的这一轮:开始卷“能否真正用起来”

从DeepSeek-OCR 2和Kimi K2.5向外看会发现最近半年的一批主流大模型的升级方向其实非常一致。无论是OpenAI的GPT-5.2、Anthropic的Claude 4.5还是Google的Gemini 3再到字节跳动的豆包 1.8和阿里巴巴的千问 Qwen3-Max-Thinking它们都不约而同地将重心从“模型有多强”挪到了一个更现实的问题上:

让AI更深一步进入真实的工作环境。

首先被集体拉高的便是“记忆”。

过去大模型更像是短期对话高手擅长当下回答却很难长期协作。一旦任务变长材料变多就需要用户不断重复背景。最近这一批模型的升级几乎都在解决这个痛点:更长的上下文更稳定的状态保持让模型能够跟着任务一路往前走而不是走两步就“失忆”。

其次是对“看”的重新理解。

如果说过去的多模态更多是“能识图”那么现在的升级重点便是“能否看懂”。DeepSeek-OCR 2代表了一种更激进也更务实的方向:不再把视觉当成文字的前置步骤而是直接将视觉当作信息本身让模型像人一样先理解结构版面和关系再进入语义层。

大模型进化:从问答到执行,国产AI的新挑战 大模型 AI进化 执行能力 视觉编码 第5张

现实世界的信息原本就不是一行一行排好的文本。当模型开始真正理解“图像里信息是如何组织的”AI才可能更自然地嵌入真实环境而不仅仅停留在纯文本的对话框里。

写在最后

没有哪个模型实现了“通用智能(AGI)”但将时间线拉长一点看更多变化发生在不那么“夺目”的地方:输入方式被重新设计任务开始被拆解和接管模型被要求在更长时间、更复杂流程中保持稳定。

当模型开始被认真地放入真实的日常生活和工作环境中被反复验证、反复调用它的价值衡量标准也随之改变。不再是谁的参数更大回答更惊艳而是谁更省成本、更少出错、更值得长期依赖。