新闻中心 >> 公司新闻 >>

DeepSeek如何赋能科普内容创作?一文解锁N种方法

2025-02-25 17:14:28

DeepSeek公司背景与发展

DeepSeek于2023年成立,其母公司幻方量化在量化投资领域成绩斐然,是国内顶尖的量化投资公司,管理规模曾一度突破千亿大关。2020年3月,幻方量化建立萤火一号算力集群,紧接着在2021年建立萤火二号,二者共同构成了当时亚洲规模最大的私有化AI算力池,拥有近万张A100 卡。当时,幻(huàn)方(fāng)量(liàng)化(huà)出(chū)于(yú)自(zì)身(shēn)量(liàng)化(huà)投(tóu)资(zī)对(duì)算(suàn)力(lì)的(de)需(xū)求(qiú)建(jiàn)立(lì)此(cǐ)算(suàn)力(lì)池(chí),同(tóng)时(shí)面(miàn)向(xiàng)公(gōng)众(zhòng)开(kāi)放(fàng)使(shǐ)用(yòng)。这(zhè)一(yī)举(jǔ)措(cuò)为(wèi)后(hòu)来(lái)大(dà)模(mó)型(xíng)的(de)发(fā)展(zhǎn)奠(diàn)定(dìng)了(le)坚(jiān)实(shí)基(jī)础(chǔ),也(yě)展(zhǎn)现(xiàn)了(le)幻(huàn)方(fāng)量(liàng)化(huà)在(zài)技(jì)术(shù)布(bù)局(jú)上(shàng)的(de)前(qián)瞻(zhān)性(xìng)。

DeepSeek模(mó)型(xíng)发(fā)展(zhǎn)历(lì)程(chéng)

DeepSeek在(zài)模(mó)型(xíng)研(yán)发(fā)上稳步推进,2024年初推出首个大模型版本,起初在行业内并未引起较大轰动。然而,2024年5月推出的V2版本开始崭露头角,性能对标GPT-4,而价格仅为GPT-4的百分之一。在国外学(xué)术(shù)圈(quān)和(hé)工(gōng)业圈,它早早受到关注,特别是在代码开发领域表现突出,成为国外众多AI Coding软件中唯一集成的国产大模型。去年年底推出的V3和R1版本更是引起了国内外的广泛关注,其模型性能对标国外最顶尖的OpenAI-o1模型,充分展示了DeepSeek在技术研发上的实力。

DeepSeek技术优势剖析

基于强化学习的训练方式

DeepSeek-R1的Zero版本基于大规模强化学习进行训练,抛弃了传统的基于人类标注反馈数据训练的奖励模型,选择了客观评价指标作为奖励模型。这种奖励模型主要基于两个核心要点:一是回答的答案是否准确,即是否可通过计算规则进行检验;二是答案格式是否符合要求,即是否包含了思考的过程。以回答数学问题为例,若模型简单回答正确记1分,若通过逻辑推理得出正确答案则记2分,答案错误记0分;在代码生成(chéng)任(rèn)务(wu)中(zhōng),通过编译器运行结果判断,符合预期记1分,编译失败或结果错误记0分,有思考过程会额外加分。与传统依赖人类标注的方式相比,DeepSeek的评价方式更加客观,有效避免了人(rén)类(lèi)标(biāo)注(zhù)存(cún)在(zài)的(de)效(xiào)率(lǜ)和(hé)准(zhǔn)确(què)率(lǜ)问(wèn)题(tí),同(tóng)时(shí)也(yě)规(guī)避(bì)了(le)人(rén)工反馈带来的主观和价值观因素影响。

创新的模型架构

在模型架构方面,DeepSeek有诸多创新。DeepSeek采取目前流行的混合专家(MoE)架构,MoE借鉴了人类大脑的工作原理。大脑的不同区域负责不同功能,如前额叶负责逻辑推理,颞叶中的梭状回面孔区负责人脸识别、而海马体负责记忆等。MoE架构下参数量虽大,但特定任务仅由特定的一小部分参数处理,这极大地降低了计算消耗,同时也便于对参数权重进行定向优化。此外,DeepSeek自主创新的MLA模型通过算法调整,减少了推理过程的KV Cache,降低了显存消耗,进而提高了推理效率。这两种架构的结合,为DeepSeek的高性能表现提供了有力支持。

软硬件协同优化策略

虽然DeepSeek很早就建设了万卡集群,但是与国外同行相比,规模依然不足。面对算力资源的限制,DeepSeek采用了精细的调度算法,压榨硬件的每一分算力。传统方式在训练时,参数权重更新需一层一层按顺序处理,存在排队等待的情况,导致算力利用率不高。而DeepSeek的DualPipe调度算法类似于流程优化,通过合理安排前向过程、后向过程以及层间通讯,使有前后依赖的任务紧密协作,从而在最短时间内完成一轮迭代训练。这种软硬件协同的方式,在国产GPU算力与英伟达GPU存在差距的情况下,通过软件优化弥补了硬件的不足(zú),为(wèi)AI产(chǎn)业(yè)的(de)发(fā)展(zhǎn)开(kāi)辟(pì)了(le)新(xīn)的(de)路径。

DeepSeek的(de)特点

DeepSeek的以下几个特点,使其成为独树一帜的标杆。

首先,其训练成本大幅下降,外媒报道仅需几百万美元,与之前动辄上亿的训(xun)练成本相比成本显著降低。同时,通过蒸馏DeepSeek生成高质量的推理数据,再利用这些数据微调像千问、Llama等开源小模型,用极低成本大幅提升了这些小模型的性能。

其次,DeepSeek将最大规模的671B模型参数完全公开,且开源协议非常宽松,允许自由修改、复制和商业化,这消除了企业在数据安全方面的顾虑,使企业能够放心地在自己的环境内部署私有化版本,将企业内部的文档、技术资料甚至财务数据用于大模型的问答和应用,扫除了大模型应用的最大障碍。

因此,DeepSeek彻底颠覆了AI产业原有的商业模式,原来通过商用模型部署的业务模式因DeepSeek的出现而发生巨大改变。

DeepSeek使用经验分享

访问与替代方案

目前,DeepSeek提供了官网和APP供用户使用,但是因用户量爆棚,在使用时可能会出现不稳定的情况。在这种情况下,有一些替(tì)代(dài)方(fāng)案(àn)可供选择,如腾讯元宝和 纳米搜索等。这些平台支持全尺寸模型的问答功能,还具备联网搜索和文件上传等功能,在DeepSeek官网不稳定时能为用户提供备用方案。

使用技巧与注意事项

使用DeepSeek时,打开“深度思考”开关至关重要,因为该开关关闭时使用的是V3非推理模型,而打开后则调用R1推理模型,能获得更强大的功能。在提问方式上,相比以往复杂的提示词工程,DeepSeek推荐使用更自然的表达方式。用户只需专注描述问题的背景信息、明确自己的目标以及添加风格提示等,例如要求“面向初中生以鲁迅风格写一篇食品类科普文章”。此外,强烈推荐用户阅读清华大学出版的关于DeepSeek使用介绍的 PPT,其中详细介绍了向DeepSeek提问的技巧,有助于用户更好地与模型进行交互。

如(rú)何(hé)将(jiāng)DeepSeek用(yòng)于(yú)科(kē)普(pǔ)创(chuàng)作(zuò)?

科(kē)普(pǔ)主题(tí)发(fā)掘(jué)

DeepSeek在科普主题发掘方面具有很大的潜力。它可以在特定领域,如前沿科技、城市生活常识、当下流行的伪科学等方向,为创作者提供科普主题。同时,还能根据不同的受众群体,生成相应的主题。例如,针对60~70岁的老人,DeepSeek会提供围绕健康管理方面的三高管理、科学饮食,以及退休后的心理健康指南等主题;而针对青少年破除伪科学的需求,DeepSeek会提供星座算命、手机致癌、外星人绑架等新奇有趣的主题。此外,结合近期热点新闻,DeepSeek能从热点话题中筛选出有价值的科普主题,如根据近期小行星撞地球的热点话题,为科普创作提供灵感。

科普内容生成

基于给定的科普主题,DeepSeek能够为不同受众生成针对性的科普内容。以人造太阳的科普为例,当要求为小学三年级学生创作科普文章时,它会避免使用专业术语,尽量用浅显易懂的语言描述人造太阳的价值和功能;而当为高中三年级学生创作时,则会包含科学专业术语和相关数(shù)据(jù),适(shì)合(hé)高(gāo)中(zhōng)学(xué)生(shēng)作(zuò)为(wèi)课(kè)外(wài)拓(tà)展(zhǎn)阅(yuè)读(dú)。DeepSeek还(hái)可(kě)以(yǐ)生(shēng)成(chéng)短(duǎn)视(shì)频(pín)脚(jiǎo)本(běn),为(wèi)科(kē)普(pǔ)短(duǎn)视(shì)频(pín)的(de)制(zhì)作(zuò)提(tí)供(gōng)便(biàn)利(lì)。同(tóng)时(shí),在(zài)科(kē)普分级读物方面,它具有生成不同难度文章的能力,通过难度设定可以精确匹配不同阅读水平的需求,这对于中文科普分级读物的发展具有重要意义。

此外,在科普访谈方面,DeepSeek可以根据访谈对象和主题,结合互联网上的相关材料,生成定制化的访谈提纲。访谈结束后,还能根据访谈文字稿辅助生成总结文章,提高工作效率。在处理国外前沿论文时,DeepSeek可以将论文内容转化为有趣的科普文章,在内容风格上并非机械解读,而是结合科普宣传的需求,吸引读者的注意力。

拓展应用场景

DeepSeek结合其他技术,能够拓展科普内容创作的边界。例如,结合简易AI自动化匹配视频素材并进行剪辑,再结合文本生成语音(TTS)技术,可以制作完整的科普短视频;结合豆包进行文本生成,实现图文混排,使科普内容更具吸引力;结合Kimi等相关工具可以制作科普PPT,用于展示(shì)科(kē)普(pǔ)知(zhī)识(shi);结(jié)合(hé)数(shù)字(zì)人(rén)技(jì)术(shù)生(shēng)成(chéng)科(kē)普(pǔ)数(shù)字(zì)人(rén),为(wèi)中(zhōng)小(xiǎo)学(xué)生(shēng)或(huò)特(tè)定(dìng)用(yòng)户(hù)群(qún)体(tǐ)介(jiè)绍(shào)科(kē)普(pǔ)内(nèi)容(róng),这(zhè)种(zhǒng)应(yīng)用在科普基地、博物馆等场所具有广阔的发展空间。

AI时代不缺好答案,而是缺好问题。提出好问题可能是人们未来需要学习、提高的重要素质。期待人工智能未来在科普内容创作领域发挥更大的价值,助力全民科学素质水平提升。

(作者:董霖,浙江省科普联合会副会长、每日互动创始团队成员、首席数据官)

本文根据浙江省科普联合会周四夜学内容(róng)整(zhěng)理(lǐ)

400-85643322
广东省广州市番禺区长沙路103号
PR:com@czzscl.com; Sales:ccm@czzscl.com
粤ICP备19042278号 | © 2025 汽车芯片科技有限公司官方网站【登录入口】. All rights reserved. | 网站地图