首页 > 教程攻略 > ai教程 >一场关于DeepSeek的高质量闭门会:比技术更重要的是愿景

一场关于DeepSeek的高质量闭门会:比技术更重要的是愿景

来源:互联网 时间:2026-08-03 07:12:47

听说梁文锋自己也会打标签。

DeepSeek-R1的爆发速度,让整个AI社区都始料未及。但热闹背后,真正高质量的信息其实并不多。

2025年1月26日,拾象创始人兼CEO李广密组织了一场关于DeepSeek的闭门讨论,参与者是数十位顶尖AI研究员、投资人和一线从业者。大家坐在一起,从技术细节、组织文化,到出圈后的短中长期影响,做了一次深度的梳理和探讨。

这场讨论试图在有限的信息下,揭开这股东方神秘力量的面纱一角。需要说明的是,这只是一次民间技术交流,不代表任何特定机构或个人的立场。

硅谷著名风投家Marc Andreessen评价DeepSeek-R1时说:“作为开源项目,这是对世界的一份深远馈赠。”本着同样的开源精神,参与讨论的各位决定将集体思考公开。以下就是这场讨论的要点总结。

01

神秘的DeepSeek

“DeepSeek最重要的事是push智能”

1. DeepSeek的灵魂人物,无疑是创始人兼CEO梁文锋。他和Sam Altman不是一类人,他是个真正懂技术的人。

2. DeepSeek之所以能赢得口碑,关键在于它第一个把复现MoE、o1这类成果公开出来,胜在“做得早”。但能不能做到最好,空间还很大。接下来的挑战在于资源有限,只能把好钢用在刀刃上。这个团队的research能力和文化确实不错,如果手里有10万、20万张卡,说不定能搞出更大的动静。

3. 从preview到正式发布,DeepSeek的长上下文能力提升非常快。它的Long context 10K,用的是非常常规的方法就做到了。

4. Scale.ai的CEO说DeepSeek有5万张卡,实际肯定没这么多。从公开信息看,DeepSeek大概有1万张老款的A100卡,可能还有3000张禁令前的H800。DeepSeek很注重合规,没有采购任何不合规的GPU,所以卡应该很少。相比之下,美国用GPU的方式,确实有点太粗放了。

5. DeepSeek把所有精力都聚焦在一个很窄的点上,把后续很多东西——比如多模态——都放弃了。它不是在单纯地服务人,而是在做智能本身。这或许正是它成功的关键。

6. 某种意义上,量化可以说是DeepSeek的商业模式。幻方(梁文锋创立的另一家量化投资公司)是上一轮机器学习的产物。而DeepSeek最重要的事,就是push智能。钱和商业化的优先级都不高。中国需要有几个领先的AI实验室,去探索能超越OpenAI的东西。智能这条路很长,今年已经开始分化,肯定会有新东西出来。

7. 单从技术角度,DeepSeek就像一所“黄埔军校”,对人才扩散起到了很大作用。

8. 美国的AI实验室商业模式也不好。AI今天确实没什么好的商业模式,后面可能需要跑通。梁文锋是有抱负的,DeepSeek不在乎形态,朝着AGI走下去就是了。

9. 读完DeepSeek的论文,一个直观感受是:里面很多都是节约硬件开销的技术。在几个比较大的scaling方向上,DeepSeek的技巧确实能把成本降下来。

10. 长期来看,这不会对算力需求有影响,但短期大家会思考:怎么把AI做得更有效率一些?需求还是很强的,各家算力都不够用。

11. 谈DeepSeek的组织:

1)做投资,都倾向于选择最高级的人才组合。但看DeepSeek的模式(团队多是国内高校毕业的聪明年轻人),大家磨合好了,能力也能慢慢变高级。挖走一个人能否打破这种优势组合是个问题,目前看对DeepSeek的影响可能不大。

2)市场上钱很多,但DeepSeek的核心是文化组织。它的research culture和字节跳动有点像,比较本质。文化好不好,衡量的标准在于是否有足够的钱和长期性。有足够重要的商业模式,才能支撑起长期性的文化,这两家公司的商业模式都很好。

12. DeepSeek为什么能追得这么快?

1)推理模型的需求,是更高质量的数据和训练。如果是长文本、多模态,从0开始追一个闭源模型会更困难。但纯推理模型本身的架构没有大动,推理是一个更好追的方向。

2)R1能追得快,可能的原因是任务本身没有特别难。强化学习只是让模型选得更准,R1没有突破Consensus 32的效率,同时花了32倍效率,相当于把原来并行做探索改成了串行,并没有提高智能的边界,只是让它变得更容易了。

02

探索者VS追赶者

“AI类似阶跃函数,追赶者算力需求少10倍”

13. AI就像阶跃函数,现在做追赶者,算力需求能少10倍。追赶者的算力成本一直不太高,但探索者还是要训很多模型,大家对新算法和架构的探索不会停止。阶跃函数背后,其实有很多人投入了大量资源,所以算力投入还是会一直往前,还会有很多人投在产品上。除了推理,还有很多方向也很费卡。探索者花费很多卡可能大家看不到,但没有这些投入,可能就不会有下一个阶跃。也有很多人不满足于现有架构和RL方法,会不断往前推进。

14. 在探索方向时,花1万张卡的效果不一定比1千张卡好,但可能会有一个门槛:如果只有100张卡,那大概率做不出来,因为迭代一次方案的时间太长了。

15. 推动物理学的进步,可以分为学校里的研究者和产业界的实验室。前者需要探索多个方向,不要求回报;后者更关注效率提升。

16. 从探索者和追赶者的角度,小公司卡很少,就需要考虑效率;而大公司考虑的是怎么更快地得到模型。很多在2千卡集群上能提高效率的方法,在万卡集群上是不work的,大家会更考虑稳定性。

17. CUDA生态的优势在于算子的多和全。而华&为等国内公司突破时,找的是常用的算子,有后发优势。假如拥有10万张卡,在决定资源投入时,做领先者的成本很高,做追赶者效率更高,该如何抉择?国内下一个追赶的方向是什么?比如多模态,因为海外的GPT-5一直迟迟没有出来。

03

技术细节1:SFT

“在推理层面不需要做SFT了”

18. DeepSeek带来的最大震撼,不是开源或低成本,而是“不需要做SFT了”。(注:SFT:Supervised Fine-Tuning,有监督微调,一种重要的模型优化技术,通过在预训练模型基础上使用标注数据进行进一步训练,提升模型在特定任务上的性能。)但这里指的是推理层面,推理以外的任务可能还是需要做SFT。围绕这个点,很值得讨论的是:这是否意味着提出了一个新的范式或架构,使得训练模型对数据的利用效率更高了?或者模型表现的迭代速度会更快?

19. DeepSeek-R1一定程度上说明,用SFT做蒸馏有很大好处。DeepSeek-R1并不是完全不做SFT,而是在第三步骤只做了SFT,最后一步对齐再用了RLHF(基于人类反馈的强化学习)。

20. R1本质上是SFT训练出来的,比较特殊的是,数据是用RLHF训练出来的模型生成的。这说明不需要用特别复杂的方法,只要有足够好的方法,只需要用SFT蒸馏就行。

21. GRPO的本质在于,基础模型得足够聪明。一个prompt生成用了16个generation,得尝试几次才能大概率有正确的答案。不错的base model加上可验证,就是R1提供的思路。math和coding很合适,是因为这两类任务比较容易验证,但理论上可以在其他场景任务上做类似的过程,最终实现一个通用的RL模型。

22. R1-Zero没有用SFT就出现了CoT的过程,并且CoT会越来越长。这个涌现过程很有意义。SFT更像是一个辅助手段,模型没有SFT也能产生CoT,有了SFT能更快生成。

23. 这件事说明,现在很多小模型厂商可以用SFT去蒸馏大模型,效果会很好。但SFT在R1的过程中并没有被完全抛弃。

24. 一个LLM集合无限长的CoT,理论上可以看成一台图灵机。通过无限长的CoT,可以解决极复杂的计算问题。但CoT本质上只是中间搜索结果,用一种优化的方式去不停sample potential output,可能会输出正确结果,然后让模型往更可信的方向去推。本质上,模型为了得到这样的结果,必须要做一些计算,CoT是计算过程中必须经过的中间输出。最终结果可以说是涌现,也可以说是它作为计算机的本质。

25. DeepSeek的论文里虽然没有提到长上下文,但体感上R1-preview和R1之间,模型的context window提升了很多。猜测是做了一些Long2Short CoT的提升,包括在第三阶段的SFT用的CoT,最终在generation的时候也被去掉。最后发布的版本,可能是用了更加clean的CoT数据做SFT。

26. SFT的数据种类有几种:一种是冷启动的数据,更像是给模型一个很好的策略,一个比较好的初始化,这样能做的探索更好,RL中有一个优化目标是和原策略更接近;另一种数据是做了RL之后,生成很多data,再加上别的数据,再在base model SFT。本质上,每个domain有自己的data processing pipeline,这个数据的能力是从base model来的,蒸馏是无损的。把多个domain放到一起,可能会有泛化。

27. 不确定R1这个过程的数据效率怎么样。猜测OpenAI针对数据效率也做了类似的事情,比如fine tuning。R1第三阶段没有用RL做出来的模型作为base去训练,而是去生成了数据,再去SFT得到R1,数据包含600K的reasoning data和200K non-reasoning data。第二阶段的模型可能在example的domain之外,但仍然需要某种reasoning的场景下,可能也能展示解题能力,从而得到reasoning data。而non reasoning data是V3 SFT data的一部分,是让V3脑补出了一个CoT。800K的数据还是很小、很有效率的。

04

技术细节2:数据

“DeepSeek在数据标注上非常重视”

28. Scale.AI不一定会失败。现在需要在各种domain上做RL,比较常用的是math和coding,还是需要expert来标注。数据标注可能会更复杂,但市场会存在。

29. 在训练上,多模态数据几乎看不出效果,或者说成本太高了。今天还没有任何证据说有用,未来机会可能比较大。

30. DeepSeek在数据标注上非常重视,市场上有传闻称,梁文锋自己也会打标签。在AI领域,除了算法和技巧,数据的精确度也很关键。特斯拉的标注成本几乎是国内自动驾驶的20倍。国内自动驾驶的数据经历了从大而全、精细化,到最终发现要找开车经验和能力特别丰富的人,而特斯拉从一开始就在做这件事。特斯拉的机器人动作,是找小脑非常健康的人做的标注,丝滑程度很好,而国内找的人的丝滑程度就差很多。所以,DeepSeek在数据标注上的投入,是模型效率好的关键之一。

05

技术细节3:蒸馏

“蒸馏坏处是模型diversity下降”

31. 如果不去了解模型训练中最大的技术痛点,而选择用蒸馏的技术去避免了解,那么在下一代技术提出的时候,就可能会掉进坑里。

32. 大模型和小模型的能力是不匹配的。从大模型往小模型进行蒸馏,是真正的teacher to student。如果从完全不会中文的模型蒸馏各种中文数据,性能可能会下跌。但实际上,蒸馏小模型确实有很明显的性能提升。R1蒸馏出来的模型再做RL,会增长很多,因为是用和模型不匹配的数据做出来的。

33. 蒸馏的坏处是模型多样性下降,影响模型上限,无法超越最强的模型。但短期看,蒸馏也是一条路线。

34. 用蒸馏会有一些hack。早期一般在instruction调过的模型做RL,这个阶段模型会呈现出这样的特征:先去生成没有用的想法,然后最后突然答对。原因在于很多RL hack做得非常隐晦,模型可能在预训练的时候背了很多问题,所以明面上是在思考,其实只是在靠近背的题。这就是蒸馏的隐患。如果不做标注就蒸馏,那现在做RLVR的时候,就会导致模型用更简单的方式解决,而不是去思考这个问题。OpenAI也没有解决,可能是这一代技术的缺陷。

35. 长期来说,通过走捷径的方式,没有自己通过愿景去想技术方案,而是直接复现,中间可能会有不知道的坑。比如在这一代技术long context没有质变的前提下,解决问题的上限可能会被限制。R1-zero可能是一个正确的方向,从头就做R1-zero,或者不通过类o1的数据启动,可能更好。照着别人的技术方案可能不太好,期待更多探索。

36. 其他模型用蒸馏也能得到较好的结果。未来在模型生态里,可能就会有老师、学生的角色区分。有能力当一名好学生,也是一种可以成立的商业模式。

37. 在蒸馏和技术路线上,R1带来的震撼不如AlphaGo,但在商业上,出圈能力比AlphaGo要好很多。

38. 蒸馏分两个阶段。如果只是蒸馏o1或者R1,而没有建立自己的体系和verifiable reward,会导致大家越来越依赖蒸馏。但通用领域是不可能蒸馏的,因为reward无法得到,而且在蒸馏过程中,特殊的CoT怎么得到?第一阶段的蒸馏都有痕迹,用OpenAI蒸馏的模型,可能遗留了OpenAI大量的退火痕迹。为什么zero能够在纯RL阶段上获得这样的能力,和基础模型在退完火之后具有反思能力,是有直接关系的。

39. 不太相信纯互联网的数据而不经过退火的模型,能做到这样的行为,因为互联网上几乎没有高质量数据。

40. 目前可能只有几个top lab在探索,到底需要多少退火阶段的数据和数据配比。蒸馏与否,都是RL算法的一种。SFT是行为模仿,是无限的强化学习,但只做SFT的上限很低,而且会损害多样性。

41. 一级市场上的创业公司看到DeepSeek还是很激动的。如果后续DeepSeek还能继续迭代,对于不是大的上市公司来说,使用AI上会有非常大的灵活性。DeepSeek还蒸馏了几个小版本,可以在手机上用起来。如果这个方向被证明,对于很多AI应用会提高天花板。

42. 蒸馏很重要的一点是确定目标是什么。OpenAI是没有数据蒸馏的,要超过OpenAI,肯定不能做蒸馏。

43. 未来,模型可能需要像人类一样学会跳步回答。在固定context长度下,能否提高模型能力表现上限?

06

技术细节4:Process Reward

“过程监督上限是人,结果监督才是模型上限”

44. Process Reward不一定不行,但Process Reward可能容易被reward hack,也就是模型没学到什么,但能把reward做得很高。如果解决数学问题,用模型生成1000个generation,可能没有一个能靠近正确答案,那用类似RLVR的方式是没办法训练到任何东西的。如果这时候有个还可以的process reward,可能能接近正确方向,过程分也是有帮助的。要看解决问题有多难、过程reward有多可靠等。

45. 过程分在PRM估算中,如果和真实有偏差,就很好hack。过程监督理论上是可能的,问题在于process的力度,以及基于process力度怎么给到reward。现在结果监督也是用抽取出来的答案去做匹配,各家也没有很成熟的让模型打分而不hack的方案,模型自己迭代是最容易hack的。标过程也不难,可以枚举的,只是大家没有做,可能是一个有前途的方向。

46. 过程监督的上限是人,人很多时候是想不到的。结果监督才是模型的上限。

47. AlphaZero比较有效,是因为棋局终局时可以判断输赢,而且整个reward可以根据胜率计算。但LLM不知道最后不停生成能不能给出答案,有点类似遗传算法,上限可能更高,但也有可能hack不到。

48. AlphaGo到AlphaZero的一个优势是,围棋的规则是固定的。现在模型从math和coding开始,就是因为比较容易验证。验证的方法是否足够好,会影响最后RL的质量。规则得足够完善,不然模型会去hack,模型能满足规则,但生成的结果不是想要的。

07

其他公司为何没用DeepSeek方法?

“大厂的模型得低调”

49. OpenAI和Anthropic之前没有做DeepSeek的方向,是公司聚焦方向的问题。它们可能觉得,把现有算力投入其他地方会更有价值。

50. 相比大厂,DeepSeek可能因为没有在多模态上做事,而是集中在语言,所以能做出成果。大厂的模型能力不弱,但得低调,不能发太多。现在多模态不是关键,智能来源主要是语言,对提升智能没有帮助。

08

2025技术的分化与押注

“除Transformer能不能找别的架构”

51. 模型在2025年会发生分化。最诱人的愿景是不断推进智能的边界,可能有很多突破的路径,方法可能会发生变化,比如合成数据、别的架构。

52. 2025年,首先关注新的架构:除了Transformer之外,能不能找到别的?现在已经有了一些探索,可以降低成本,在降低成本的同时也可以探索智能的边界。其次,RL的全部潜力还没有发挥出来。产品上,大家关心agent,但还没有被大规模应用。

53. 2025年,多模态可能会出现能挑战ChatGPT形态的产品。

54. R1和V3带来的低成本、高效果,说明这是一个方向。这和另一个扩硬件、涨参数的方向是不冲突的。国内是受到限制,只能走前者。

55. 第一,DeepSeek是从base model逼出来的,还是遵循Scaling Law。第二,从蒸馏角度,DeepSeek蒸馏还是先大后小,对于越做越大的闭源模型是好事。第三,对技术发展来说,还没有出现反规模指标。如果出现,那对Scaling Law可能是一个比较大的打击。而且,开源模型的所有东西都可以在闭源模型做一遍,同时还可以降低成本,对闭源模型也是利好。

56. 据了解,Meta目前还在复现DeepSeek的过程中,但还没有特别影响infra或长期路线图的地方出现。长期来说,除了探索边界,也要考虑成本。只有成本更低,才能有更多的玩法。

09

开发者是否从闭源模型迁移至 DeepSeek?

“目前还没有”

57. 开发者是否会从闭源模型迁移至DeepSeek?目前看还没出现大批迁移,因为领先模型的coding指令遵循能力是比较有利的,但不确定这一优势在未来是否会被攻克。

58. 从开发者角度来说,Claude-3.5-Sonnet是做了tool use专门训练,对做agent非常有利,但DeepSeek之类模型暂时没有提供。但DeepSeek带来的空间很大。

59. 对于大模型应用者,DeepSeek V2就已经满足了所有需求。R1速度提高了,但没有带来特别大的额外价值。开启深度思考的时候,以前能答对的题目现在反而错了。

60. 应用者选择模型时,会用工程方法把问题简化。2025年可能是一个应用年,各行各业会使用现有的能力做。可能慢慢会到一个瓶颈了,因为日常可能用不到那么聪明的模型。

61. 现在RL是解决了有标准答案的问题,并没有比AlphaZero做更多突破,甚至更简单。蒸馏解决了标准答案的问题,有标准答案后用RL的方法去训练时,可以得到很好的效果。这就是为什么现在蒸馏或RL能很快突破的原因。

62. 人类对智能的需求是远远被低估的,比如癌症问题、SpaceX上的隔热材料,都还没有被解决。现有的任务是自动化的问题,还有很多问题。对未来增量的爆发非常乐观,智能是不能停下来的。

10

OpenAI Stargate 500B叙事

与算力需求变化

63. DeepSeek的出现,让大家开始质疑英伟达和OpenAI最新的500B叙事。训练资源问题目前还没有清晰判断,OpenAI的500B叙事,更像是给自己加的一根救命稻草。

64. 对OpenAI 500B基础设施投入的事情是存疑的,因为OpenAI是商业公司,如果涉及举债,那可能是有风险的。

65. 500B是一个很夸张的数字,可能会分4、5年去执行。因为leading的角色是软银和OpenAI,前者是资金,后者是技术。软银现在账上的资金没办法支持500B,而是用手上的资产去做抵押。而OpenAI本身资金也不是很充沛,其他更多是技术参与方,而不是资金提供方。因此,要完整实现500B是有挑战的。

66. OpenAI 500B的算力是有道理的。在探索阶段,试错成本很高,人力和投资成本都很高。但因为路线不明确,从o1到R1可能也不容易,但至少知道最后是怎么样的一个结果,中间的特征词也可以观察到,可以一开始就对着别人的最终形态去做,比较有方向感。而如果是在前线探索下一代,是最费资源的。追赶者不需要承担探索,但永远只是追赶。如果Google、Anthropic在探索的领域做成功了,可能就会成为最前沿的那家公司。

67. Anthropic未来有可能把所有的inference都换成TPU或者AWS Chip。

68. 国内公司原来受困于算力,现在证明了潜在的技术空间是非常大的。对于更加efficient的模型,可能不需要特别大的卡,可以提供相对定制化的芯片,可以在AMD、ASIC芯片上提供适配。从投资角度,英伟达壁垒非常高,但ASIC也会有更大的机会。

69. DeepSeek的事情和算力没有太大关系,更多是让美国觉得中国比较厉害,比较有效率。英伟达的软肋不在DeepSeek,只要AI还在发展,英伟达就能发展。英伟达的优势在生态,这是靠时间积累的。技术在快速发展的时候,生态就很重要。真正的危机在于技术成熟后,类似电力,变成标准品,大家会关注做产品,就会有很多ASIC芯片出来做特定场景的优化。

11

对二级市场的影响

“短期情绪有压力,长期叙事继续”

70. DeepSeek短期对美国AI圈冲击很大。短期对股价有影响:pretrain需求增速放缓,post-train和inference scaling还没有足够快地scale up,在相关公司的叙事上会有一个gap,对短期交易确实会有影响。

71. DeepSeek更多是FP8,美国是FP16。DeepSeek所有都是基于有限算力工程能力的提升,对算力高效的使用是最大亮点。上周五,DeepSeek在北美有巨大的发酵,扎克伯格对Meta资本支出给了更高的预期,但英伟达和台积电都是跌,只有博通是涨的。

72. DeepSeek在短期情绪上对股价、估值有压力,对二级的算力相关公司,甚至能源公司有压力,但长期叙事会继续。

73. 二级从业者会担心英伟达从H卡到B卡的转换上,会有一些air pocket,再加上DeepSeek的压力,短期会有股价承压,但可能是长期看更好的机会。

74. 短期受影响,是DeepSeek在训练上的低成本投入的情绪体现,比如英伟达的股价就很直接。但AI是一个增量市场,潜力很大。长期来看,AI才刚开始,如果CUDA还是大家喜欢的选择,那硬件增长空间还是很大的。

12

开源 VS 闭源

“如果能力差不多,对闭源是挑战”

75. DeepSeek之所以受关注,更多是开源和闭源路线之争。

76. 这有可能会导致OpenAI等把好的模型藏在后面,目前看领先的模型都没发布。但DeepSeek拿出来之后,其他AI公司好的模型可能也藏不住了。

77. DeepSeek成本上做了很多优化,Amazon等还没有看到因此做出的改变,还是按照既定的计划做,目前是一个共存的状态。开源和闭源模型并不矛盾,高校和小lab应该会优先选择DeepSeek,不会对云厂商有竞争,因为云厂商对开源、闭源都是支持的,生态不会改变,目前也是共存状态。DeepSeek在tool use等方面还没有像Anthropic这么成熟,后者已经花了很多时间在AI安全上。DeepSeek如果长期希望得到欧美市场的认可,是需要考虑的。

78. 开源对整个市场的margin是有控制的。如果开源能做到闭源的95%,那如果闭源太贵,完全就可以用开源来做。如果开源和闭源能力差不多,那对闭源是一个很大的挑战。

13

DeepSeek出圈的影响

“比技术更重要的是愿景”

79. DeepSeek的出圈,让外界意识到了中国AI的实力。以前外界认为中国AI进展落后美国两年,但DeepSeek表明,其实差距在3-9个月,甚至某些方面更强。

80. 历史上,中国被美国封锁的东西,如果能被突破的话,最终都会很卷。AI可能也是,DeepSeek能跑出来就是一个证明。

81. DeepSeek不是突然爆发的,这次R1结果很漂亮,触及到了美国从上到下的核心圈。

82. DeepSeek是站在巨人的肩膀上,但探索前沿需要的时间和人力成本还是要高很多。R1并不代表以后的训练成本会同时降低。

83. AI探索者一定是需要更多算力的。中国作为追赶者,可以发挥在工程能力上的优势。中国的大模型团队怎么用较少的算力做出成果,从而有一定的抵御能力、甚至做得更好,可能是未来中美AI格局的推演。

84. 中国今天还是在复现技术方案。reasoning是OpenAI在o1提出的,所以接下来各个AI labs之间的差距,在于谁能提出下一个reasoning。无限长度的reasoning可能是一个愿景。

85. 不同AI labs的模型之间的核心差别,在于AI labs本身的下一个愿景是什么,而不是技术。

86. 毕竟,比技术更重要的是愿景。