「推理加速技术」共找到 4926 篇相关文章
The Information:揭秘 OpenAI GPT-5 崎岖的研发之路
The Information揭秘OpenAI GPT - 5研发困境,今年OpenAI遇技术难题,o3等模型研发受阻,内部有分歧。不过GPT - 5在编程等方面有提升,虽难与早期飞跃相比,但改进仍有价值,公司还在开发‘通用验证器’。
“稚晖君”智元机器人豪掷 21 亿,抢跑宇树、砸出“人形机器人第一股”?!
北京时间7月8日晚,智元机器人相关主体拟21亿收购上纬新材63.62%股份,交易完成将成绝对控股股东,有望成A股“人形机器人第一股”。智元2023年成立,有技术和产品,已9轮融资,估值150亿。
新范式来了!新能量模型打破Transformer++扩展上限,训练扩展率快35%
研究训练新能量模型 EBT,为输入和预测分配能量值,模拟思考过程。它有跨模态、跨任务通用性,训练扩展率比 Transformer++ 高 35%,推理性能提升 29%,还在多任务中表现出色,是扩展模型能力新范式。
决战8月!Anthropic甩出Fable 5.1,奥特曼携GPT-6连夜汇报
GPT - 6和Fable 5.1很可能8月上线。奥特曼赴华盛顿汇报GPT - 6,它有原创科研等能力。Anthropic准备以Fable 5.1狙击,定价不变。GPT - 6有技术突破,但也有安全风险,8月对决将影响AI产业走向。
GPT-5正以o3的三倍速度打宝可梦,现已抵达冠军之路,直播进行中
GPT - 5直播独立运行宝可梦红版,速度比o3快近三倍,6105步抵达冠军之路,而o3需16882步。原因是其幻觉少、空间推理和规划能力强。直播已进行9小时,超2000人关注,OpenAI总裁点赞。
不是视频模型“学习”慢,而是LLM走捷径|18万引大牛Sergey Levine
UC伯克利大学副教授Sergey Levine提出,为何语言模型从预测下一词中学到很多,视频模型从预测下一帧却学得少。他指出LLM可“抄近路”模仿人类推理,像在“柏拉图洞穴”中,还探讨了AI走出困境的方法。
太逼真!豆包·播客模型来了:一句话生成「苏超联赛」播客,很懂13太保的梗
火山引擎发布豆包·播客模型,生成的AI对话语气、停顿等像真人。操作简单,生成快且有字幕。能处理多种类型内容,如热搜话题、苏超联赛、超长文本等。其基于端到端实时语音模型,有技术突破。
阿里+清华发现80/20法则:LLM只靠20%的token就能学会Reasoning
阿里与清华研究发现,训练大语言模型(LLM)推理时,真正关键的是20%的高熵token,其余80%低熵token几乎无用。仅用20%高熵token做强化学习,效果超全量训练,还提出RLVR训练策略提升效率。
AI遭遇灵魂拷问!这道题所有模型集体翻车,网友:我也不会啊
图像推理现新难题,在Reddit引发热议,目前无AI能真正解决。国内外支持图像输入的大模型答案不同,原因是对大立方体规格理解不同。结合提示多次尝试,部分大模型能找准方向,人类面对该问题也会困惑。
AI Coding 之后,如何让 Agent 进入企业研发全链路?得物推荐的 Harness 实践
得物资深技术专家白忠魏在AICon大会分享实践。团队目标是将AI Coding扩展为全链路方法,介绍了PDCA循环、全链路前提、七阶段护栏等探索,还提及用知识体系和混合Agent架构解决问题,已有阶段性成果。