DeepSeek-V3.1」共找到 3685 篇相关文章

新闻资讯8

剑指“美国版 DeepSeek!”Ai2 科学家 Nathan Lambert 最新访谈:剖析 RLVR、激辩智能体与后训练

艾伦人工智能研究所科学家 Nathan Lambert 在访谈中剖析 RLVR、激辩智能体与后训练。他所在团队用 Olmo 和 Tulu 模型揭开后训练魔法,带火 RLVR 概念。他还谈到开源 AI 未来,想打造“美国版 DeepSeek”。

AI科技大本营
新闻资讯7

全网骂他AI作弊狗,硅谷风投反手砸1.2亿!这届VC就爱疯批创业者

哥大退学的Roy Lee靠「AI作弊神器」Cluely杀出重围,a16z领头砸1500万美元,公司估值达1.2亿美元。风投认为其开创新品类,是创新型实时生产力工具,虽有争议但值得投资。

新智元
新闻资讯8

半年3轮10亿,他们都投了这家已经把机器人卖到500个家庭的公司

未来不远机器人半年获3轮10亿融资,字节跳动等入局。其全产业链闭环强大,展会表现优,已进入500多家庭。靠全栈自研、贴合需求等策略,在赛道脱颖而出,认为家用机器人应重真实落地。

量子位
产品应用8

3个工程师、0融资、不开会,估值3.5亿美元的Obsidian才是真正的「小而美」

Obsidian 作为全球最具影响力的本地化 Markdown 笔记应用之一,估值 3.5 亿美元,但仅 7 人全职团队。它拒绝资本,靠用户付费运营,有「无会议文化」,底层插件系统强大,和 Notion 信息管理哲学不同。

机器之心
新闻资讯7

DeepSeek刚提到FP8,英伟达就把FP4精度推向预训练,更快、更便宜

DeepSeek提及针对国产芯片的FP8量化设计,引发对大模型量化策略关注。不久后英伟达发力低精度量化,将NVFP4策略拓展到预训练阶段,其方案能解决核心挑战,实验证明NVFP4在大规模训练中可行。

机器之心
算法论文8

DeepSeek点燃大模型效率之争,阶跃火速接棒:JetSpec让大模型解码速度最高提升近10倍

近期,DeepSeek发布DSpark,阶跃星辰发表JetSpec论文,二者聚焦大模型推理效率。DSpark关注验证效率,JetSpec从Draft生成本身入手。结果显示,二者都有加速效果,共同表明推理效率正成Agent落地关键变量。

量子位
算法论文8

两张图就能重构3D空间?清华&NTU利用生成模型解锁空间智能新范式

ICCV 2025中稿的LangScene-X以全新生成式框架,仅用稀疏视图就能构建可泛化的3D语言嵌入场景。它攻克传统方法痛点,将多模态信息统一在单一模型,为空间智能领域打开新大门。

量子位
算法论文8

“神经-符号”融合规划器性能显著超越o1:借鉴人类运动学习机制|中国科学院磐石研发团队

中国科学院磐石研发团队提出新型“神经 - 符号”融合规划器,融合神经与符号规划系统优势,借鉴人类运动学习机制构建双向规划机制,在规划覆盖率和效率上显著超越OpenAI o1,已加入“磐石·科学基础大模型”。

量子位
开源动态8

2G 内存跑 Gemma 3n 完整版!全球首个 10B 内模型杀疯 LMArena:1300 分碾压记录

当地时间6月26日,谷歌正式发布Gemma 3n完整版,可在本地硬件运行。它是开源大模型,具多模态能力,最低2GB内存设备就能跑,E4B模型LMArena测评表现佳,还有MatFormer架构等多项创新。

AI前线
产品应用8

腾讯混元AI Infra如何优化Hy3 Preview:一次大模型推理性能提升的技术拆解

文章聚焦腾讯混元AI Infra对Hy3 preview模型的推理性能优化。从算子优化与融合、并行策略等五大维度,剖析技术思路、算法及收益,如Attention算子单batch长文本最高加速2.95x,还提及后续显存优化等工作。

腾讯技术工程