「思考模型」共找到 7938 篇相关文章
我MiniMax,用实习生处理数据,照样屠榜开源大模型
MiniMax M2屠榜开源大模型,引发社区热议。它在注意力机制、数据处理、思考模式上另辟蹊径,公开技术细节。M2团队选Full Attention,雇实习生处理数据,提出交错式思维链策略,强调实用性和泛化能力。
Meta发布40页报告,具身智能的下一步是「心智世界模型」:能听,能看,能理解,会共情
Meta发布40页报告,首次将对人心智状态的推断概念化为心智世界模型,与物理世界模型实现“双轨建模”。还指出要结合系统A和B让AI自主学习,心智世界模型在多智能体协作潜力大。
2025 年的 Vibe Coding 思考|Reflections on Vibe Coding in 2025
作者基于自身经历和观察分享 2025 年 Vibe Coding 思考。指出创作应从喜好和用户需求出发,与用户紧密相连,还对 2026 年模型发展、产品方向等做了预判,探讨了实现人人 Vibe 还缺的条件。
本地LLM万字救场指南来了!全网超全AI实测:4卡狂飙70B大模型
文章围绕本地大语言模型(LLM)展开,针对实用性和经济性问题,用Dell Precision 7960塔式工作站对主流模型测试。涉及不同尺寸模型、推理框架等,给出不同配置下性能指标及使用建议,还模拟真实场景测试。
Token售卖已无溢价、大模型公司转型“系统商”?记忆张量 CTO 李志宇:智能体能力会拉开差距,长期记忆与状态管理成竞争核心
InfoQ 采访记忆张量 CTO 李志宇,他指出 Scaling up 经济效益下降,大模型公司正变系统公司,核心是长期记忆与状态管理能力。2026 年若模型无代际差,价格战或加剧。智能体是主赛道,但现有模型推理能力不足。
数千大模型全跑「中国芯」!最后一公里已「焊」通
国产芯片运行大模型需额外适配,魔乐社区以开源模型推理适配协作模式破局。它推出‘模型推理适配协作计划’,联合多方力量,打通国产算力与大模型应用‘最后一公里’,还举办赛事激发创新活力。
老外傻眼!明用英文提问,DeepSeek依然坚持中文思考
DeepSeek-V3.2和DeepSeek-V3.2-Speciale推理能力显著提升,海外研究者用英文提问,它却用中文思考。评论有两种观点,相关论文显示中文省token但非最有效,大模型选思考语言并非只看效率。
中科院类脑大模型SpikingBrain,2%数据,百倍速度
中国科学院自动化研究所李国齐、徐波团队发布全球首款大规模类脑脉冲大模型SpikingBrain 1.0。它处理长文本比主流Transformer模型快超百倍,训练数据仅为2%。该模型采用新架构,降低计算复杂度,还可转换现有模型,且在国产GPU完成训练。
图灵奖得主LeCun最后警告Meta!我搞了40年AI,大模型是死路
图灵奖得主Yann LeCun预计将很快离开Meta。因Meta风向转变,LeCun失势。他投身AI研究40年,认为大语言模型是死路,世界模型才是未来,或为此离开Meta并计划创业。
ICLR 2026|UIUC:一行代码彻底解决LLM推理的过度思考!
2025年DeepSeek发布推理大模型,引发RLVR研究热潮,但该方法有“过度思考”问题。伊利诺伊大学香槟分校等研究者提出Self - Aligned Reward(SAR),能提升推理准确度和效率,有望推动大模型推理系统发展。