新闻中心 >> 公司新闻 >>

DeepSeek新应用!这群杭州90后做的事上热搜

2025-02-25 14:15:24

东坡肉、蘑菇炒青菜、清蒸鲫鱼、虾仁豆腐……做了满满一桌菜,拍张照片扔给AI,问它:图片里的哪种食物蛋白质含量最高?哪道菜尿酸偏高的人不宜多吃?

AI深度思考了几秒钟,打出推理全过程,最后在图片上将答案圈了出来。

这是学会推理的多模态大模型,未来在日常生活中的一个应用小场景。此前,这种“长眼睛”、擅长推理的AI还停留在想象阶段。不过最近,来自杭州Om AI Lab的一群95后,已经成功地将DeepSeek-R1的训练方法,从纯文本领域迁移到视觉语言领域,打开了多模态大模型的更多想象空间。

他们还将这个名叫VLM-R1的项目开源,发布在全球最大的代码托管平台GitHub上,上线仅一周,就获得各国开发者给出的2.7k Stars(星标),并在2月21日登上热(rè)门(mén)趋势榜。这一成绩在这个开源社区(qū)里(lǐ)堪(kān)称(chēng)亮(liàng)眼(yǎn)。

VLM-R1上(shàng)线(xiàn)GitHub一(yī)周(zhōu)的(de)Star(星(xīng)标(biāo))数(shù)据(jù)曲(qū)线(xiàn)

2月(yuè)21日(rì)上(shàng)了(le)GitHub热(rè)门(mén)趋(qū)势(shì)榜(bǎng)

这(zhè)支(zhī)研(yán)发(fā)团(tuán)队(duì)的(de)带(dài)头(tóu)人(rén),是(shì)名90后(hòu)——Om AI Lab的(de)创(chuàng)始(shǐ)人(rén)赵(zhào)天(tiān)成博士,他同时也是浙江大学(xué)滨(bīn)江(jiāng)研究院Om人工智能中心主任、博士生导师。

将教DeepSeek-R1推理的方法

带到机器视觉领域

DeepSeek-R1模型的独特之处,在于DeepSeek对通用的模型推理步骤进行了调整。此前,模型在提升推理能力时,通常依赖“监督微调”(即SFT,监督式微调)这个环节。简单来说,就是拿一个已经学(xué)了(le)不(bù)少(shǎo)东(dōng)西(xi)的(de)大(dà)模(mó)型(xíng),用(yòng)一(yī)些(xiē)特(tè)定(dìng)的(de)、标(biāo)记(jì)好(hǎo)的(de)数(shù)据(jù),来(lái)教(jiào)它(tā)如(rú)何(hé)更(gèng)好(hǎo)地(de)完(wán)成(chéng)某(mǒu)个(gè)任(rèn)务(wu)。这(zhè)就(jiù)好(hǎo)比(bǐ)你(nǐ)已(yǐ)会(huì)做(zuò)菜,但具体(tǐ)到(dào)川(chuān)菜(cài)或(huò)徽(huī)菜(cài),还(hái)需(xū)通(tōng)过(guò)专(zhuān)门(mén)的(de)练(liàn)习(xí)来(lái)掌(zhǎng)握(wò)烹(pēng)饪(rèn)技(jì)巧(qiǎo)。

而(ér)DeepSeek-R1在(zài)训(xun)练(liàn)过(guò)程(chéng)中(zhōng)直(zhí)接(jiē)跳(tiào)过(guò)了(le)这(zhè)个(gè)环(huán)节(jié),进(jìn)入(rù)“强(qiáng)化(huà)学(xué)习(xí)”阶(jiē)段(duàn),探(tàn)索(suǒ)大(dà)模(mó)型(xíng)在(zài)没(méi)有(yǒu)监(jiān)督(dū)数(shù)据(jù)的(de)情(qíng)况(kuàng)下(xià),通(tōng)过(guò)纯(chún)强(qiáng)化(huà)学(xué)习(xí)进(jìn)行(xíng)自(zì)我(wǒ)进(jìn)化(huà)。这(zhè)种(zhǒng)创(chuàng)新(xīn)性(xìng)的(de)强(qiáng)化(huà)学(xué)习(xí)方(fāng)法(fǎ),有(yǒu)个(gè)专(zhuān)业(yè)名词,叫群组相对策略优化(Group Relative Policy Optimization,GRPO)。

GRPO已经帮助DeepSeek-R1学习推理,那是否也能帮助AI模型在一般计算机视觉任务中表现得更强?

Om AI Lab研发团队反复实(shí)验(yàn)后(hòu)的(de)答案是:可以。

他们在一个(gè)视(shì)觉(jué)定(dìng)位(wèi)任(rèn)务(wu)中(zhōng),训(xun)练了通义开源视觉(jué)理(lǐ)解(jiě)模(mó)型(xíng)Qwen2.5-VL。在(zài)此(cǐ)基(jī)础(chǔ)上(shàng),同(tóng)时(shí)用(yòng)R1方(fāng)法(fǎ)和(hé)SFT方(fāng)法(fǎ)进(jìn)行(xíng)对(duì)比(bǐ)。目(mù)前(qián)得(de)出(chū)的(de)结(jié)论(lùn)是(shì):R1方(fāng)法(fǎ)在(zài)各(gè)种(zhǒng)复(fù)杂(zá)场(chǎng)景(jǐng)下(xià),都(dōu)能(néng)保(bǎo)持(chí)稳(wěn)定(dìng)的(de)高(gāo)性(xìng)能(néng)。这(zhè)在(zài)实(shí)际(jì)应(yīng)用(yòng)时(shí)至(zhì)关重(zhòng)要(yào)。

如(rú)下(xià)图(tú)的(de)街(jiē)景(jǐng)照(zhào)片(piàn),给(gěi)AI的(de)任(rèn)务(wu)是(shì):定(dìng)位(wèi)出(chū)图(tú)中(zhōng)可(kě)能(néng)对(duì)视(shì)障(zhàng)人(rén)士(shì)行(xíng)走(zǒu)造(zào)成(chéng)危(wēi)险(xiǎn)的(de)物(wù)体(tǐ)。

在路边人行道的场景里,人类能想到对视障人士造成行走障碍的,通常是石墩子、公交站牌、行人等,这些就是可以提前标记好的“数据”。但在这张图中,出现了一个比较特殊的情况——台阶。

从赵天成团队的实验看,经过R1方法训练的AI模型,能够成功推理出台阶在这个场景中会对视障人士造成危险。

“对人类(lèi)来(lái)说(shuō),这(zhè)属(shǔ)于(yú)常(cháng)识(shi)性(xìng)推(tuī)理(lǐ),再(zài)容(róng)易(yì)不(bù)过(guò)。但(dàn)对(duì)于(yú)此(cǐ)前(qián)传(chuán)统(tǒng)的(de)计(jì)算(suàn)机(jī)视(shì)觉(jué)模(mó)型(xíng)而(ér)言(yán),这(zhè)其(qí)实(shí)非(fēi)常(cháng)难(nán)。”赵(zhào)天(tiān)成(chéng)解(jiě)释(shì)。

又(yòu)如(rú)下(xià)面(miàn)这(zhè)张(zhāng)图(tú),桌(zhuō)子(zi)上(shàng)放(fàng)着(zhe)山药、鸡蛋饼、毛豆、青菜、咖啡和橙子,让AI定位图中含维生素C最多的食物。

使用R1方法训练的AI模型,很快锁定了橙子并附上思考过程。“以前它直给答案,不会告诉你解题思路,且错误率偏高,比如10道题最多答对四五题,而用R1方法训练的,能答对七八题。”

此外,机器学习领域有一种很常见的情况:用任务A去训练模型,随着训练步数(训练模型所执行的迭代次数)的增加,在跟A没有那么相似的任务B上,它的性能会变差(图中红色曲线)。“有点‘摁了葫芦起了瓢’的意思。所以以前做多任务时,还要精心控制任(rèn)务(wu)间(jiān)的(de)比(bǐ)例(lì)。”而(ér)使(shǐ)用(yòng)R1方(fāng)法(fǎ)训(xun)练(liàn)的(de)AI模型(图中绿色曲线)并不会出现这种趋势,这意味着R1方法能帮助模型真正“学会”理解视觉内容,而不是简单地记忆。

绿色曲线是使用R1方法训练,红色曲线是使用传统的SFT方法。

为视觉语言模型训练

打了新思路

“实验从春节长假期间开始启动。好在前期积累比较多,很多‘基础设施’是现成的,有了想法后,能快速进行实验、验证结果。”组成团队的10人,有研究院的研发人员,也有赵天成带的博士生。

2月15日,赵天成在海外社交平台上发布VLM-R1的实验结果,并将它开源、上传到GitHub,截至2月22日,已获得全球开发者们给出的2.7k Stars。

大大小小的交流切磋问题蜂拥而来:要训练多久,最低显存是多少,能否再多分享几个模型思考过程……

“虽然底层逻辑是相通的,但视觉和数学、代码是完全不同的模态。怎么在视觉领域进行设计,让它真正跑通,团队其实也经历了多次试(shì)错,才找到目前这样一个比较有效的组合。”赵天成坦言,现在这个版本只能算是0.1版,远未达到成熟,“有一些问题,需要继续用更多实验来解答。”

在他看来,这段时间的实验,最大意义之一是为多模态模型的训练和行业提供了一些新的思路。它证明了R1方法的通用性,“不仅在文本领域表现出色,还可能引领一种全新的视觉语言模型训练潮流。”

“做一个勇于尝试的引领者

比在风口追随着他人来得重要”

Om AI Lab背后的母公司联汇科技,位于杭州滨江互联网产业园,这里曾是阿里、网易崛起的摇篮,互联网和物联网技术从这里走入我们的日常生活。眼下,人工智能成了主角,这家公司正在致力于人工智能智能体平台的应用和落地。

2月21日,由赵天成带队的Om AI Lab,在上海(hǎi)举行(xíng)的(de)2025全球(qiú)开(kāi)发(fā)者(zhě)先(xiān)锋(fēng)大(dà)会(huì)(GDC)上(shàng),带(dài)去(qù)了(le)基(jī)于(yú)R1强(qiáng)化(huà)学(xué)习(xí)的(de)视(shì)觉(jué)理(lǐ)解(jiě)多(duō)模(mó)态(tài)模(mó)型(xíng)VLM-R1的(de)首(shǒu)秀(xiù),以(yǐ)及(jí)开(kāi)源(yuán)大(dà)语(yǔ)言(yán)模(mó)型(xíng)智(zhì)能(néng)体(tǐ)评(píng)测(cè)平(píng)台(tái)Open Agent Leaderboard。

赵(zhào)天(tiān)成(chéng) (陈(chén)中(zhōng)秋(qiū) 摄(shè))

去(qù)年(nián)8月(yuè),赵(zhào)天(tiān)成(chéng)在(zài)接(jiē)受(shòu)采访(fǎng)时(shí)说(shuō),他(tā)始(shǐ)终(zhōng)记(jì)得(de)当(dāng)年(nián)在(zài)美(měi)国(guó)卡(kǎ)耐(nài)基(jī)梅(méi)隆(lóng)大(dà)学(xué)(CMU)求(qiú)学(xué)时(shí)导(dǎo)师(shī)说(shuō)的(de)一(yī)句(jù)话(huà):To be a leader, not a follower,做(zuò)一(yī)个(gè)勇(yǒng)于(yú)尝(cháng)试(shì)的(de)引(yǐn)领(lǐng)者(zhě),远(yuǎn)比(bǐ)在(zài)风(fēng)口(kǒu)追(zhuī)随(suí)着(zhe)他(tā)人(rén)来(lái)得(de)重(zhòng)要(yào)。

(来(lái)源(yuán):潮(cháo)新(xīn)闻(wén))

400-85643322
广东省广州市番禺区长沙路103号
PR:com@czzscl.com; Sales:ccm@czzscl.com
粤ICP备19042278号 | © 2025 汽车芯片科技有限公司官方网站【登录入口】. All rights reserved. | 网站地图