DeepSeek

  成长路上不孤单😊😊😊😊😊😊

【😊///计算机爱好者😊///持续分享所学😊///如有需要欢迎收藏转发///😊】

今日分享关于DeepSeek的相关内容!

关于【DeepSeek】

目录:

  • 一、什么是DeepSeek?
  • 二、DeepSeek发展历史
  • 三、DeepSeek主要产品
  • 四、DeepSeek产品事件
  • 五、DeepSeek优点
  • 六、DeepSeek的与众不同

一、什么是DeepSeek?

DeepSeek,全称杭州深度求索人工智能基础技术研究有限公司 。DeepSeek 是一家创新型科技公司,成立于2023年7月17日 ,使用数据蒸馏技术 ,得到更为精炼、有用的数据 。由知名私募巨头幻方量化孕育而生 ,专注于开发先进的大语言模型(LLM)和相关技术 。注册地址 :浙江省杭州市拱墅区环城北路169号汇金国际大厦西1幢1201室 。法定代表人为裴湉 ,经营范围包括技术服务、技术开发、软件开发等 。

2024年1月5日,发布DeepSeek LLM(深度求索的第一个大模型) 。1月25日,发布DeepSeek-Coder 。2月5日,发布DeepSeekMath。 3月11日,发布DeepSeek-VL 。5月7日,发布DeepSeek-V2 。6月17日,发布DeepSeek-Coder-V2 。9月5日,更新 API 支持文档,宣布合并 DeepSeek Coder V2 和 DeepSeek V2 Chat ,推出 DeepSeek V2.5 。12月13日,发布DeepSeek-VL2 。12月26日晚,正式上线DeepSeek-V3首个版本并同步开源 。2025年1月31日,英伟达宣布DeepSeek-R1模型登陆NVIDIANIM。同一时段内,亚马逊和微软也接入DeepSeek-R1模型。英伟达称,DeepSeek-R1是最先进的大语言模型。

二、DeepSeek发展历史

DeepSeek成立于2023年7月17日,由知名量化资管巨头幻方量化创立。 DeepSeek 是一家创新型科技公司,长久以来专注于开发先进的大语言模型(LLM)和相关技术,作为大厂外唯一一家储备万张 A100 芯片的公司,幻方量化为DeepSeek的技术研发提供了强大的硬件支持。 

2023年8月2日,注册资本变更为1000万元,章程备案,投资人变更为宁波程恩企业管理咨询合伙企业,市场主体类型变更为其他有限责任公司。 

2024年9月5日,DeepSeek 官方更新 API 支持文档,宣布合并 DeepSeek Coder V2 和 DeepSeek V2 Chat 两个模型,升级推出全新的 DeepSeek V2.5 新模型。官方表示为向前兼容,API 用户通过 deepseek-coder 或 deepseek-chat 均可以访问新的模型。 

2024年12 月,一份关于DeepSeek发布历程、优化方向的专家会议纪要文件在业内流传。对此,DeepSeek 回应称,公司未授权任何人员参与券商投资者交流会,所谓“DeepSeek 专家”非公司人员,所交流信息不实。DeepSeek 表示,公司内部制定有严格的规章制度,明令禁止员工接受外部访谈、参与投资者交流等市场上各类面向投资者的机构信息交流会。相关事项均以公开披露信息为准。 

2025年1月27日,DeepSeek应用登顶苹果美国地区应用商店免费APP下载排行榜,在美区下载榜上超越了ChatGPT。同日,苹果中国区应用商店免费榜显示,DeepSeek成为中国区第一 。根据公开报道,DeepSeek的员工规模不及OpenAI的1/5,百人出头的公司中,算子、推理框架、多模态等研发工程师以及深度学习方面的研究人员共有约70人,主要在北京分部,其余30多人在杭州总部,多为前端、产品以及商务人员 。

2025年1月28日消息,DeepSeek于服务状态页面公告称:近期DeepSeek线上服务受到大规模恶意攻击,为持续提供服务,暂时限制了+86手机号以外的注册方式,已注册用户可以正常登录。 

2025年1月,DeepSeek在GitHub平台发布了Janus-Pro多模态大模型,进军文生图领域。 

2025年1月31日,英伟达宣布DeepSeek-R1模型登陆NVIDIANIM。同一时段内,亚马逊和微软也接入DeepSeek-R1模型。英伟达称,DeepSeek-R1是最先进的大语言模型。 

三、DeepSeek主要产品

2024年1月5日,发布DeepSeek LLM,这是深度求索的第一个大模型。DeepSeek LLM包含670亿参数,从零开始在一个包含2万亿token的数据集上进行了训练,数据集涵盖中英文。全部开源DeepSeek LLM 7B/67B Base和DeepSeek LLM 7B/67B Chat,供研究社区使用。DeepSeek LLM 67B Base在推理、编码、数学和中文理解等方面超越了Llama2 70B Base。DeepSeek LLM 67B Chat在编码和数学方面表现出色。它还展现了显著的泛化能力,在匈牙利国家高中考试中取得了65分的成绩。当然,它还精通中文:DeepSeek LLM 67B Chat在中文表现上超越了GPT-3.5。 

2024年1月25日,发布DeepSeek-Coder,DeepSeek Coder由一系列代码语言模型组成,每个模型均从零开始在2万亿token上训练,数据集包含87%的代码和13%的中英文自然语言。代码模型尺寸从1B到33B版本不等。每个模型通过在项目级代码语料库上进行预训练,采用16K的窗口大小和额外的填空任务,以支持项目级代码补全和填充。DeepSeek Coder在多种编程语言和各种基准测试中达到了开源代码模型的最先进性能。 

2024年2月5日,发布DeepSeekMath,DeepSeekMath以DeepSeek-Coder-v1.5 7B为基础,继续在从Common Crawl中提取的数学相关token以及自然语言和代码数据上进行预训练,训练规模达5000亿token。DeepSeekMath 7B在竞赛级MATH基准测试中取得了51.7%的优异成绩,且未依赖外部工具包和投票技术,接近Gemini-Ultra和GPT-4的性能水平。 

2024年3月11日,发布DeepSeek-VL,DeepSeek-VL是一个开源的视觉-语言(VL)模型,采用了混合视觉编码器,能够在固定的token预算内高效处理高分辨率图像(1024 x 1024),同时保持相对较低的计算开销。这一设计确保了模型在各种视觉任务中捕捉关键语义和细节信息的能力。DeepSeek-VL系列(包括1.3B和7B模型)在相同模型尺寸下,在广泛的视觉-语言基准测试中达到了最先进或可竞争的性能。 

2024年5月7日,发布第二代开源Mixture-of-Experts(MoE)模型——DeepSeek-V2。DeepSeek-V2是一个强大的混合专家(MoE)语言模型,以经济高效的训练和推理为特点。它包含2360亿个总参数,其中每个token激活210亿个参数。与DeepSeek 67B相比,DeepSeek-V2不仅实现了更强的性能,同时还节省了42.5%的训练成本,将KV缓存减少了93.3%,并将最大生成吞吐量提升至5.76倍。在一个包含8.1万亿token的多样化且高质量的语料库上对DeepSeek-V2进行了预训练。在完成全面的预训练后,通过监督微调(SFT)和强化学习(RL)进一步释放了模型的潜力。评估结果验证了方法的有效性,DeepSeek-V2在标准基准测试和开放式生成评估中均取得了显著的表现。 [9]DeepSeek V2模型因在中文综合能力评测中的出色表现,且以极低的推理成本引发行业关注,被称为“AI界的拼多多”。 

2024年6月17日,发布DeepSeek-Coder-V2,DeepSeek-Coder-V2是一个开源的混合专家(MoE)代码语言模型,在代码特定任务中达到了与GPT4-Turbo相当的性能。DeepSeek-Coder-V2是从DeepSeek-V2的一个中间检查点开始,进一步预训练了额外的6万亿token,显著增强了DeepSeek-V2的编码和数学推理能力,同时在通用语言任务中保持了相当的性能。并在代码相关任务、推理能力和通用能力等多个方面都取得了显著进步。此外,DeepSeek-Coder-V2将支持的编程语言从86种扩展到338种,并将上下文长度从16K扩展到128K。在标准基准测试中,DeepSeek-Coder-V2在编码和数学基准测试中表现优异,超越了GPT4-Turbo、Claude 3 Opus和Gemini 1.5 Pro等闭源模型。 

2024年12月13日,发布用于高级多模态理解的专家混合视觉语言模型——DeepSeek-VL2,DeepSeek-VL2是一个先进的大型混合专家(MoE)视觉-语言模型系列,相较于其前身DeepSeek-VL有了显著改进。DeepSeek-VL2在多种任务中展现了卓越的能力,包括但不限于视觉问答、光学字符识别、文档/表格/图表理解以及视觉定位。模型系列由三个变体组成:DeepSeek-VL2-Tiny、DeepSeek-VL2-Small和DeepSeek-VL2,分别具有10亿、28亿和45亿激活参数。与现有的开源密集模型和基于MoE的模型相比,DeepSeek-VL2在相似或更少的激活参数下实现了具有竞争力或最先进的性能。 

2024年12月26日晚,AI公司深度求索(DeepSeek)正式上线全新系列模型DeepSeek-V3首个版本并同步开源。 DeepSeek-V3在知识类任务(MMLU, MMLU-Pro, GPQA, SimpleQA)上的水平相比前代 DeepSeek-V2.5显著提升,接近当前表现最好的模型Anthropic公司于10月发布的Claude-3.5-Sonnet-1022。在美国数学竞赛(AIME 2024, MATH)和全国高中数学联赛(CNMO 2024)上,DeepSeek-V3大幅超过了其他所有开源闭源模型。另外,在生成速度上,DeepSeek-V3的生成吐字速度从20TPS(Transactions Per Second每秒完成的事务数量)大幅提高至60TPS,相比V2.5模型实现了3倍的提升,能够带来更加流畅的使用体验。 

2025年1月20日,DeepSeek正式发布 DeepSeek-R1 模型,并同步开源模型权重。DeepSeek-R1在后训练阶段大规模使用了强化学习技术,在仅有极少标注数据的情况下,极大提升了模型推理能力。 DeepSeek-V3和DeepSeek-R1两款大模型,成本价格低廉,性能与OpenAI相当,让硅谷震惊,甚至引发了Meta内部的恐慌,工程师们开始连夜尝试复制DeepSeek的成果。 

四、DeepSeek产品事件

2024年12月,DeepSeek开源大模型DeepSeek-V2的关键开发者之一罗福莉将加入小米,或供职于小米AI实验室,领导小米大模型团队。 

2025年1月,DeepSeek的R1模型发布一周之后,DeepSeek刷屏美国各大主流媒体和社交网站。其中一部分原因为,TMT Breakout在与网友的讨论中,隐隐将英伟达周五下跌的原因指向DeepSeek的爆火。即R1的成功可能削弱了市场对英伟达AI芯片需求的预期,导致交易员做空英伟达股票,进而引发股价下跌。 1月22日,美国媒体Business Insider报道称,DeepSeek-R1模型秉承开放精神,完全开源,为美国AI玩家带来了麻烦。开源的先进AI可能挑战那些试图通过出售技术赚取巨额利润的公司。 

2025年1月26日,有网友反应,DeepSeek崩了,提示服务器繁忙。 新浪科技询问DeepSeek今天下午是否有闪崩时,DeepSeek回应称:1月26日下午DeepSeek确实出现了局部服务波动,但问题在数分钟内得到解决。此次事件可能与新模型发布后的访问量激增有关,而官方状态页未将其标记为事故。 

2025年1月27日,DeepSeek服务状态页面显示,DeepSeek网页/API不可用,目前正在调查该问题。 对于DeepSeek网页/API不可用的原因,DeepSeek回应称,可能和服务维护、请求限制等因素有关。 

2025年1月27日晚,DeepSeek服务再次“宕机”,DeepSeek服务状态页面显示,DeepSeek网页不可用,公司正在调查这一问题。 1月27日,DeepSeek服务状态页面显示,20点55分,DeepSeek对话服务已恢复,账号服务仍存在问题,用户或无法登录及注册。21点05分,DeepSeek更新称,将继续监测故障。 

当地时间1月27日,纳斯达克股指出现3%下跌,原因是中国人工智能公司DeepSeek模型引发美国投资者关注。央视记者在纳斯达克交易所现场对纳斯达克副主席麦柯奕进行了采访。麦柯奕表示,他认为,DeepSeek将是人工智能领域革命的重要组成部分。 

当地时间2025年1月27日晚,美国总统特朗普在佛罗里达州迈阿密发表讲话时,对中国人工智能初创公司DeepSeek搅动纳斯达克一事表示,DeepSeek的出现“给美国相关产业敲响了警钟”,美国“需要集中精力赢得竞争”。特朗普同时表示,他认为,DeepSeek的模型高效且经济,其出现是一种积极的发展。 1月27日,英国《金融时报》发表评论文章说,中国初创企业深度求索(DeepSeek)最近在人工智能领域获得重大突破,其发布的开源模型DeepSeek-R1对全球用户产生极大吸引力,有利于推动人工智能技术的开发和应用。 1月27日,中国深度求索(DeepSeek)公司发布的最新开源模型引起热议。美国媒体报道称,这是人工智能领域的一场“地震”,“从华盛顿到华尔街再到硅谷都感受到了震动”。美国经济学家布莱恩·雅各布森表示,这可能会改变人工智能的叙事,“我们确实需要担心这一趋势可能带来的影响。”布莱恩·雅各布森同时表示,这说明美国对华出口芯片限制显然没有那么有效,或许能看到美国政府的一些政策发生变化,从关税、禁运和限制方面转向更多地补贴和激励美国国内技术的发展。 

当地时间2025年1月28日,据央视新闻报道,美国新任白宫新闻秘书卡罗琳·莱维特(KarolineLeavitt)进行了她的首次简报会,其中提及了中国人工智能初创公司深度求索(DeepSeek)。关于DeepSeek,莱维特表示,特朗普认为该公司发布的人工智能模型是对美国人工智能行业的一个警钟。她同时称,白宫正在努力“确保美国人工智能的主导地位”,特朗普此前签署行政命令撤销了对人工智能行业的一些繁琐监管。 

2025年1月28日,深度求索(DeepSeek)官网显示,其线上服务受到大规模恶意攻击,谭主向奇安信安全专家咨询并独家了解到,DeepSeek这次受到的网络攻击,IP地址都在美国。 同日,美国多名官员回应DeepSeek对美国的影响,表示DeepSeek是“偷窃”,正对其影响开展国家安全调查。 1月29日,360集团创始人周鸿祎表示,如果DeepSeek有需要,360愿意提供网络安全方面的全力支持。中国红客联盟发布公告,DeepSeek遭受攻击关乎整个国家的网络安全以及技术创新环境。 

2025年1月29日消息, 美国全国广播公司商业频道援引其获得的美国海军的通知报道,美国海军要求其工作人员不得使用中国聊天机器人Deepseek。报道说:“海军表示,Deepseek的人工智能不能以‘以任何方式’被使用,因原因是“与该模型的来源和使用有关的潜在安全问题和道德考虑”。根据通知,所有美国海军工作人员不得下载、安装或以任何其他方式使用该聊天机器人。 同日消息,意大利数据保护机构周二表示,正在向中国人工智能 (AI) 模型DeepSeek寻求有关其使用个人数据的解释。 意大利监管机构Garante表示,希望了解收集了哪些个人数据、从哪些来源收集、用于什么目的、基于什么法律依据,以及是否存储在中国。 Garante 在一份声明中表示,DeepSeek 及其附属公司有 20 天的时间答复,这是针对这家中国初创公司的首批监管举措之一。 在美国,白宫新闻秘书表示官员们正在调查该应用程序对国家安全的影响。 

2025年1月28日,意大利数据保护机构表示,正在向中国人工智能 (AI) 模型DeepSeek寻求有关其使用个人数据的解释。意大利监管机构Garante表示,希望了解收集了哪些个人数据、从哪些来源收集、用于什么目的、基于什么法律依据,以及是否存储在中国。 1月29日,在意大利当局要求DeepSeek提供有关该公司如何处理用户数据的信息数小时后,DeepSeek已不再意大利地区苹果的App Store和谷歌的Play Store上提供。 

2025年1月30日消息,微软CEO纳德拉在电话会上强调,DeepSeek R1模型目前已可通过微软的AI平台Azure AI Foundry和GitHub获取,并且很快就能在Copilot+电脑上运行。纳德拉称DeepSeek“有一些真的创新”,AI成本下降是趋势:“缩放定律(Scaling Law)在预训练和推理时间计算中不断积累。多年来,我们已经看到了AI训练和推理方面的效率显著提高。在推理方面,我们通常看到每一代硬件的性价比提高2倍以上,每一代模型的性价比提高10倍以上。” 

2025年1月,美国商务部长提名人霍华德·卢特尼克认为,中国DeepSeek公司在创建人工智能聊天机器人时使用了窃取的美国技术。 

2025年1月,爱尔兰数据保护委员会副主席格雷厄姆·多勒(Graham Doyle)表示,该委员会要求中国公司DeepSeek提供有关其如何收集爱尔兰用户个人数据的信息。 

2025年1月30日凌晨,奇安信Xlab实验室监测发现,针对DeepSeek线上服务的攻击烈度突然升级,其攻击指令较1月28日暴增上百倍。Xlab实验室观察到至少有2个“僵尸网络”参与攻击,共发起了两波次攻击。 [43]针对DeepSeek的网络攻击一直在层层加码,攻击手段越来越多,防范难度越来越大,使得DeepSeek面临的安全考验愈发严峻。 

2025年1月,DeepSeek的出现,打破了“大模型”、美国股市的神话,还颠覆了传统“大模型需要大算力”无可匹敌的美国主流地位,进一步挑战了“巨型数据集”作为人工智能成功的唯一途径的普遍认知。 

2025年1月30日,美国国会众议院首席行政事务官向国会办公室发出通知,警告国会办公室不要使用中国的人工智能应用DeepSeek(深度求索)的服务。通知中称“DeepSeek正在接受首席行政事务官的审查,目前尚未授权众议院正式使用该模型。”同日,法国监管机构国家信息与自由委员会表示,将对杭州深度求索人工智能基础技术研究有限公司进行问询,以便了解这家中国初创企业的人工智能系统是如何运行的,以及可能存在的隐私风险。 

2025年1月31日消息,据《日本经济新闻》网站1月30日报道,关于中国杭州深度求索人工智能基础技术研究有限公司(DeepSeek)开发的生成式人工智能(AI)服务,日本内阁官房长官林芳正在30日的记者会上表示:“未听说个人信息保护委员会确定特别应对方针。”据报道,他还指出:“将密切关注AI相关国际开发动向等,采取妥善应对措施。”关于生成式AI服务,林芳正再次表示:“同时促进创新和应对风险非常重要。” [46]同日消息,美国政府在调查有关DeepSeek公司涉嫌通过新加坡的中间商购买先进的NVIDIA芯片以规避美国制裁。 

2025年2月1日,据台湾“中央社”报道,大陆初创公司杭州深度求索人工智能基础技术研究有限公司(DeepSeek)推出的人工智能(AI)模型引发“资安疑虑”。台湾地区数字发展主管部门部1月31日表示,基于安全考量,特别警示公务机关与关键基础设施应限制使用DeepSeek的AI产品,以避免用户相关数据或信息被有“资安疑虑”的产品传送。 

五、DeepSeek优点

DeepSeek的优点主要包括以下几个方面‌:‌

1‌、技术创新和高效性能‌:

动态神经元激活机制‌:DeepSeek采用动态神经元激活机制,推理阶段仅激活5%-15%的神经网络参数,相比传统稠密模型降低80%计算量,单位算力下实现3倍吞吐量提升。

混合精度量化技术‌:支持FP16/INT8/INT4自适应量化,模型体积压缩至原始大小的1/4,边缘设备部署成本降低60%。

跨模态学习框架‌:通过跨模态对比学习框架,实现文本、图像、视频数据的联合表征,在MS-COCO图像描述任务中BLEU-icon4得分达42.1,高于CLIP-ViT的38.5。

自研适配技术‌:基于自研的Meta-Adapter技术,无需领域微调即可在医疗、法律等专业场景达到85%以上的任务适配率。

2‌、推理能力和成本效益‌:

推理能力强‌:DeepSeek能与OpenAI等行业巨头的模型正面竞争,在AIME和MATH-icon500等基准测试中展现出卓越的推理能力和更快的复杂问题解决响应速度。

参数效率高‌:Deepseek-R1每个任务仅使用370亿参数,确保资源高效利用的同时,不牺牲准确性或可扩展性。

训练成本低‌:DeepSeek-V3的全部训练成本仅为557.6万美元,远低于Llama-3.1等模型,训练成本仅为OpenAI的十四分之一。

3‌、垂直领域深度优化‌:

中文场景精准度‌:针对中文语法、成语、网络用语及行业术语(如法律、医疗)进行专项训练,在中文语境下的语义理解准确率提升约18%。

企业级知识库适配‌:支持私有化部署的企业知识图谱融合,某制造业客户测试显示,内部流程问答响应速度提升40%。

轻量化与成本效率‌:参数量级较GPT-4减少30%,推理速度提升25%,适合边缘计算场景。

4‌、开源与商用授权‌:

开源免费‌:模型完全开源,代码、论文全部公开,前期用户能享受免费使用。

优化框架开源‌:如Hai-LLM并行处理算法框架等创新技术开源,推动了整个AI领域的发展和创新。

六、DeepSeek的与众不同

DeepSeek能震惊世界的主要原因包括其技术创新、成本效益和商业模式颠覆‌。

首先,‌技术创新是DeepSeek引起轰动的重要原因之一。DeepSeek通过多头潜在注意力机制(MLA)和混合专家模型(DeepSeekMoE)等创新架构,显著降低了显存占用和推理成本。例如,其V3模型仅用557.6万美元和2048块H800 GPU完成训练,相比GPT-4 Turbo的1/70和OpenAI同类模型的1/10,极大地降低了训练成本‌。此外,DeepSeek-R1模型在强化学习技术的应用下,仅需少量标注数据即可提升推理能力,减少了对海量数据的依赖,削弱了数据垄断企业的优势‌。

其次,‌成本效益‌是DeepSeek另一个重要优势。DeepSeek的API定价仅为OpenAI的3.65%,近乎“免费”的性价比直接威胁现有商业模型的盈利能力‌。这种低成本策略不仅吸引了全球开发者共建生态,还迫使闭源厂商面临竞争压力‌。市场对硬件赛道的过度乐观估值也因此修正,反映了资本对“算力即王道”逻辑的恐慌性抛售‌。

最后,‌商业模式颠覆‌也是DeepSeek引起轰动的原因之一。DeepSeek选择完全开源(MIT协议),公开技术细节并允许商业化使用,吸引了全球开发者共建生态‌。这种开源策略不仅促进了技术普惠,还迫使闭源厂商如OpenAI面临竞争压力‌。

Logo

有“AI”的1024 = 2048,欢迎大家加入2048 AI社区

更多推荐