探索机制」共找到 1533 篇相关文章

推荐文章8

她如何把“系统2”带给了大模型 |对话微软亚洲研究院张丽

本文是量子位对微软亚洲研究院首席研究员张丽的访谈。张丽团队在2023年开始探索大模型深度推理能力,2025年1月发布rStar - Math,用蒙特卡洛搜索算法让7B模型实现o1级数学推理能力,引发广泛讨论。

量子位
推荐文章8

推荐系统进入“大模型时刻”:昇腾NPU如何支撑千亿级生成式推荐落地

文章基于华为郭威在2025 AICon大会演讲,复盘华为推荐技术探索。介绍FuXi-α、β模型设计,解决训练和推理难题;分享“多阶段统一建模”进展,提出Performance Law;还介绍了训推系统优化及未来聚焦“强算力”“强模型”融合。

InfoQ
开源动态8

AI能帮忙厨房看火了!面壁智能开源全模态模型MiniCPM-o4.5,边看边听还能主动抢答

面壁智能开源全模态模型MiniCPM-o4.5,能边看边听还主动抢答。它引入全双工多模态实时流机制,在多方向达全模态模型领先水平。该模型是端侧原生,将与开发板配套,助力端侧智能硬件开发。

量子位
算法论文8

不再止步于自然语言!PhiZero让世界模型学会「物理语言」

PhiZero由中科院自动化所团队研发,探索让AI读懂真实世界运动、交互与变化的“物理语言”。它构建Reason - then - Render框架,经大量数据训练,在多基准测试中表现领先,为AI理解物理世界开辟新通道。

机器之心
推荐文章8

刚刚,Cursor又分享了数百Agent并发协作的最佳实践

Cursor分享数百Agent并发协作最佳实践,讲述单个Agent局限,介绍从多方面探索协同方法,如规划者与执行者分工,还展示多个实验成果,总结模型选择等经验,指出多智能体协同仍待优化。

PaperAgent
推荐文章8

揭秘腾讯内部科研组织ARC Lab:找最好的人才,做最难的事情

文章揭秘腾讯ARC Lab,它在行业低谷时创立,坚持找最好人才、做最难之事。介绍运营机制,如小团队、技术影响力漏斗、绩效体系等,还阐述其在学术、行业、业务、社会和人才方面的影响力。

腾讯技术工程
算法论文8

能效翻5倍!他们复刻人脑双记忆通路,造出能长效记住上下文的类脑AI芯片

帝国理工学院博士后孙鹏飞和苏黎世联邦理工博士后苏哲及合作者,受大脑皮层机制启发,打造“双重记忆路径”类脑网络及配套芯片,处理语音识别任务时能效比此前优方案高5倍。相关论文发表在《自然·机器智能》且代码、设计全开源。

DeepTech深科技
新闻资讯7

骂战半年、站队失效,具身智能公司集体换了“新剧本”,VLA“自救”成功了吗?

2026年具身智能赛道经历‘技术路线大分流’,VLA遭质疑,‘世界模型’和VA路线兴起。具身智能进入‘落地祛魅’阶段,厂商开始‘路线混搭’,VLA和世界模型都在进化,行业探索新架构,具身智能无完整技术路线图。

InfoQ
算法论文8

斯坦福英伟达推出测试时强化学习:微调开源模型胜过顶级闭源模型,仅需几百美元

斯坦福、英伟达等提出TTT - Discover方法,基于开源模型gpt - oss - 120b,在测试阶段引入强化学习更新模型权重。它采用熵目标函数和PUCT启发机制,解决分布外问题,成本低且表现优,但目前适用于连续奖励场景。

量子位
算法论文8

AlphaGo之父找到创造强化学习算法新方法:让AI自己设计

谷歌DeepMind团队在Nature发表论文,探索AI自主发现强化学习算法的可能。团队负责人是“AlphaGo之父”David Silver 。方法是基于智能体经验元学习,实验显示自动发现的规则表现优异,未来强化学习算法或无需人工设计。

机器之心