DeepSeek
我们专注大模型与通用人工智能(AGI)研究,用原创算法与开源精神,把前沿的智能变成人人可用的日常。
关于 DeepSeek
DeepSeek(深度求索)成立于 2023 年,总部位于中国杭州。这是一支以好奇心驱动的极客团队,专注基础模型与 AGI 研究,并始终相信——真正的创新应当开源、共享、被世界看见。
使命
让 AI 成为人人可用的基础设施,而不只是少数人的工具。
团队
小而精的研究团队,追求原创思想与极致工程实现的完美结合。
理念
坚持长期主义,不追逐短期热点,只挑战真正困难的问题。
足迹
从 V2、V3 到 R1,连续迭代,不断刷新行业认知。
核心技术 · 原创路线
从底层架构到训练方法,DeepSeek 以一系列原创设计,把「高性能」与「低成本」同时变成现实。
-
01
DeepSeekMoE 混合专家架构
稀疏激活设计:千亿级模型每次只唤醒少数专家,让高性能与低成本兼得。
-
02
MLA 多头潜在注意力
对注意力 Key / Value 做潜在压缩,长上下文推理更快、显存占用更低。
-
03
FP8 混合精度训练
在数万亿 Token 级别稳定完成低精度训练,把集群算力成本压到极致。
-
04
强化学习驱动推理
用 RL 与自博弈代替海量人工标注,让模型在探索中学会「深度思考」。
模型代际:V2 · V3 · R1 · 持续迭代中
新一代 开源大模型
发布于 2024 年 12 月并同步开源:多项公开基准比肩全球头部闭源模型,训练与推理成本却低一个数量级。
为什么备受关注
以完全开源的方式,在数学、代码、多语言等多项基准上比肩 GPT-4o 与 Claude-3.5-Sonnet(发布时的公开评测)。
更重要的工程意义
用远低于同行的成本训练出世界级模型,为「高效智能」提供了全新的参考答案,也因此被称为大模型界的「价格屠夫」。
让模型学会 深度思考
R1 是第一代正式推理模型:通过大规模强化学习,模型在作答前会先展开漫长的思考链,推理能力显著跃升,并支持蒸馏给更小的开源模型。
-
01
纯强化学习路线
不依赖大量人工标注的推理样例,推理能力在训练中「自然涌现」。
-
02
长思维链 · 自我反思
像人类一样逐步推导、检查并修正自己的答案,可解释性更强。
-
03
推理能力蒸馏
把长思考能力蒸馏到 Qwen / Llama 等开源小模型,让轻量模型也能「会推理」。
推理表现对标 OpenAI o1
DeepSeek-R1 权重与论文全面开放,采用宽松开源许可,支持自由商用与二次开发,全球开发者可随时复现与部署。
开源与产品 · 触手可及
从模型权重到对话应用、从开放 API 到开发者社区,DeepSeek 正在打通「前沿智能」通往每个人的最后一公里。
官方 App / 网页端
免费对话、文件上传、联网搜索、长文解读,打开就能用。
开放 API
兼容 OpenAI 调用格式,chat 与 reasoner 双模型可选,价格友好。
开源权重
V3 / R1 及技术论文全公开,可本地部署与自由二次开发。
全球社区
文档、示例与模型卡齐全,全球开发者一起共建生态。
未来已来
与我们一起深度求索
我们相信,AGI 的价值不在实验室里,而在于被真实地使用——当智能足够便宜、足够开放,它终将成为像电力一样的基础设施。
DeepSeek · 深度求索 —— 谢谢观看
🌐 拥抱开源,共建生态
DeepSeek 的开源不只是姿态:模型、代码、工具与文档全部开放,让全球开发者真正参与进来。
-
01
模型权重与代码公开
模型权重与代码已在 Hugging Face 及 GitHub 公开,可直接下载与二次开发。
-
02
活跃的贡献者社区
社区贡献者超过 500 人,累计提交 PR 超千次,一起打磨每一行代码。
-
03
完整的开发者资源
提供完整技术文档、微调工具与部署示例,从入门到上线全程可循。
-
04
持续的线上活动
定期举办线上 Hackathon 与技术沙龙,和同路人一起碰撞灵感。
加入我们,一起探索 AGI 的未来