「深度思考大模型」共找到 8286 篇相关文章
第一视角效率超过真机,深度机智发布全球首个以人类学习范式构建的具身基座模型
2026年具身智能行业火热,但技术路线不明。深度机智创始人陈凯在中关村论坛发布具身智能基座模型PhysBrain 1.0,用千余小时人类第一视角数据超越真机数万小时数据成果,开启具身领域‘物理常识’革命。
蚂蚁开源万亿参数思考模型 Ring-1T,综合能力逼近 GPT-5、数学能力对标 IMO 银牌
10月14日凌晨,蚂蚁集团推出万亿参数思考模型Ring-1T并全面开源。它在多任务榜单表现均衡,数学能力达IMO银牌水平,通用能力逼近GPT - 5,还采用自研算法应对行业难题,目前可下载体验。
Claude Code越更越废?!大厂AI主管公开怒喷思考深度暴跌,官方回应更被怼爆 :菜成AI“玩具”
Claude Code在2月更新后无法用于复杂工程任务,AMD AI团队主管Stella Laurenzo分析发现其思考深度下降67%、算力消耗增加。开发者不满,Claude Code负责人回应未获认同,部分开发者考虑转用Codex。
Claude Code越更越废?!大厂AI主管公开怒喷思考深度暴跌,官方回应更被怼爆 :菜成AI“玩具”
开发者 Stella Laurenzo 分析称,Claude Code 在 2 月更新后,思考深度下降 67%、算力消耗大增,无法用于复杂工程任务。她提出改进建议,开发者对此认同,负责人回应遭反驳,部分人考虑转用 Codex。
ICLR 2026 Oral|大模型总爱「想太多」? DECS从源头消除冗余思考,实现推理token减半且性能不降反升
以DeepSeek - R1等为代表的大型推理模型存在过度思考问题,造成大量冗余计算。复旦大学等团队在ICLR 2026 Oral论文中揭示‘长度惩罚’局限性,提出DECS框架,在多基准测试中实现推理长度减半且性能提升。
两个月连获两轮数亿元融资,深度机智以全栈自主路线加速国产物理AI基座模型落地|甲子光年
物理AI是全球科技竞争焦点,深度机智率先定义‘人类学习’技术路线,成立一年全链路落地。近日完成数亿元融资,下轮融资收尾。其数据、模型、硬件成果显著,产品全落地,订单数千万元,团队强大,将推动国产物理AI普及。
Adaptive Reasoning Model:Qwen3混合思考->字节AdaCoT->清华AdaThinking
文章介绍三种处理混合思考模式的方法,阿里 Qwen3 通过 SFT 让模型具备思考能力,但需人为控制;字节 AdaCoT 和清华 AdaThinking 让模型自主决定是否思考,分别用多目标优化和受限优化目标训练。
扩散语言模型深度思考
作者探讨扩散语言模型(dllm),认为其建模方式或冲击AR。团队在AAAI报告介绍多项工作,还整理当前diffusion问题及观点,如推理架构、词表、优化范式等,并附项目网站和agent demo。
拒绝不必要Think:微软&北大提出第一种自适应大型混合推理模型
大型推理模型冗长思考开销大,微软研究院和北大提出大型混合推理模型(LHRMs),它能依查询上下文决定是否思考。介绍了两阶段训练流程、评估指标,实验显示其超越现有模型且效率高。
Depth Anything再出新作!浙大&港大出品:零样本,优化任意深度图
浙江大学与港大团队推出「Prior Depth Anything」,融合深度传感器数据与AI深度图,一键补洞、降噪、提分辨率。无需额外训练,可提升3D模型深度质量,零样本刷新多项深度处理纪录。