据 AI 前线 9 月 3 日报道,原 DeepSeek 核心研究员魏浩然已带队转入百度基础模型研发部,出任文心大模型多模态算法负责人。多模态模型能同时理解文字、图片、音频或视频,直接关系到模型处理文档、图像等真实任务的能力。对百度来说,这次引援补上的正是文心技术版图中的关键一环。
魏浩然此前长期研究视觉语言模型和文档智能,并曾是 DeepSeek-OCR、DeepSeek-OCR 2 论文第一作者。报道还称,他今年上半年加入百度后负责 OCR 等方向,并带队研发了 6 月开源的 Unlimited OCR。OCR 是把图片或扫描件中的文字转成机器可处理内容的技术。结合 7 月孙天祥接掌百度基础模型研发部,这轮人事变化显示,百度正把更多研发责任交给年轻技术骨干,也折射出中国头部模型团队对核心研究人才的争夺仍在升温。相关任职与团队安排目前主要来自 AI 前线的知情人士报道。