「长思维链」共找到 1109 篇相关文章
Megatron 1F1B流水线并行中的负载不均衡问题研究
文章分析Megatron 1F1B流水线并行中负载不均衡问题。通过实验发现通信时间‘一短一长’,原因是最后一个Stage计算慢致不同步,额外计算引发通信延迟,还梳理了流水线各阶段执行过程。
小小具身智能成果,高中生在腾讯拿下!
腾讯2025星火挑战周上,八十余位高中生聚焦前沿课题取得诸多成果,如具身智能成果获张正友点赞。课题涉及具身智能与机器人、长文本理解等方向,不少项目有实用价值,68名同学获清北offer。
龙虾安全被3层硬核架构焊死了!一份面向开发者的硬核生存指南
随着OpenClaw等高权限智能体应用爆发,AI自主性与失控的赛博博弈开启。文章从源头对齐、边界重构、结果保障三个维度,拆解适应智能体自主行动时代的新型安全框架,为开发者提供生存指南。
Anthropic 发布 AI Agent 上下文工程指南
今年6月Andrej Karpathy提出用「上下文工程」取代「提示词工程」。Anthropic发布工程博客呼应此观点,指出构建AI应用重心转向策划上下文。文章详述上下文工程重要性、有效上下文剖析、检索及长时任务应对技术等。
OpenAI重新开源!深夜连发两个推理模型,o4-mini水平,笔记本、手机可跑
OpenAI 自 GPT - 2 后重新开源,此次连发两个推理模型 gpt - oss - 120b 和 gpt - oss - 20b。它们性能达 o4 - mini 水平,可在笔记本、手机运行,有宽松许可等亮点,在多测试中表现出色。
华为多路径推理破解大模型数学瓶颈,准确率超97%|ICML 2025
大模型处理复杂问题常“翻车”,华为诺亚方舟实验室提出思维森林(FoT)框架,借鉴人类认知方式,打破线性推理范式。FoT在多个数学推理任务表现出色,准确率超先进模型,将在ICML 2025开源。
一场对话,我们细扒了下文心大模型背后的技术
信通院大模型推理能力评估中,文心X1 Turbo获最高级“4+级”。百度AI Day上,副总裁吴甜解析文心4.5 Turbo和文心X1 Turbo,从多模态、深度思考等方面介绍技术,还展示其在多场景应用成果。
刚刚,DeepSeek多模态技术范式公布,以视觉原语思考
DeepSeek发布多模态模型并公布技术报告,提出‘以视觉原语思考’。该模型解决多模态大模型‘指代鸿沟’问题,有把坐标变思维单元、7056倍视觉压缩、精心设计冷启动数据等创新,实验在多任务上超主流模型。
Yann LeCun非生成世界模型前瞻:开年三篇论文展示JEPA工程化拐点
2026年Yann LeCun团队3篇论文展示基于JEPA框架的非生成世界模型工程化拐点。Rectified LpJEPA让表示更省力,GRASP将长时域规划并行求解,EB - JEPA把方法写成代码,为非生成式世界模型提供技术路线。
33岁稚晖君,上市公司董事长!
11月25日,上纬新材公告选举彭志辉(稚晖君)为董事长。智元机器人于2025年7 - 11月完成对上纬新材收购,成本约21亿。上纬提示股价风险,业务仍在开发未量产盈利,主营未变。