多步推理」共找到 5627 篇相关文章

新闻资讯8

专访中科第五纪黄岩:在具身智能的狂热中,做一位技术实干家

机器之心专访中科第五纪黄岩,他在具身智能狂热中是技术实干家。其有学术和工业界双重身份,技术覆盖领域。团队解决行业数据利用瓶颈,推出超少样本大模型等成果,在商业落地表现出色。

机器之心
新闻资讯8

定义RAG新基准?谷歌发布 Gemini Embedding 2:首个原生模态嵌入模型,延迟骤降70%

谷歌昨夜推出首个基于 Gemini 架构的原生模态嵌入模型 Gemini Embedding 2,通过 Gemini API 和 Vertex AI 向开发者公开预览。它可将类型数据映射到统一嵌入空间,项基测排名第一,还获早期合作伙伴高度评价。

InfoQ
推荐文章8

吴恩达年终总结:2025是AI工业时代的黎明

吴恩达发表2025人工智能年度总结与公开信。总结指出,今年推理模型性能提升但有成本,AI人才争夺激烈、薪酬高,数据中心建设投入大,智能体让编程更高效。信中建议通过学课程、动手实践和读论文构建AI系统。

机器之心
新闻资讯8

从“能用”到“敢用”:企业级 AI 落地的终极答案 | AICon 2025 收官

12月19 - 20日AICon 2025大会落幕,众企业专家参与,探讨企业级AI落地。InfoQ王一鹏谈AI落地趋势与流畅度构建;大会发布「2025中国技术力量年度榜单」,位嘉宾演讲分享AI见解,还有17个分论坛和合作展区。

InfoQ
开源动态8

开源模型首次物理奥赛IPhO夺金!上海AI Lab 235B模型击败GPT-5和Grok-4

上海AI Lab的P1 - 235B - A22B在国际物理奥林匹克竞赛夺金,在HiPhO基准测试获12金1银,超越GPT - 5等闭源模型。团队构建HiPhO基准测试,用阶段强化学习训练模型,开发PhysicsMinions系统提升推理能力。

量子位
产品应用7

只提升2个点?我实测Claude 4.1后,发现官方在骗人

官方更新Claude 4.1,作者实测其与Claude4、DeepSeek R1在生成UI设计图、卡片、网页游戏开发等方面的能力。结果显示Claude 4.1进大,尤其在理解提示词和视觉设计能力上,还能精细修改文件。

AI产品黄叔
算法论文7

「Next-Token」范式改变!刚刚,强化学习预训练来了

微软新研究提出「强化预训练(RPT)」新范式,将下一个 token 预测任务重新定义为推理任务,可利用海量文本数据进行通用强化学习。该方法有可扩展性、低风险等优点,实验显示其提升了语言建模能力。

机器之心
算法论文8

传统RAG只会翻书不会用?RAG+让Reasoning能力上一个新高度!

现有检索增强生成(RAG)技术在需复杂推理领域表现不佳,像只给菜谱不给实操演示。RAG+开创性新增“应用案例库”,与知识库构成双料库,在数学、法律、医疗场景测试中全面碾压传统方案,团队还透露了未来方向。

深度学习自然语言处理
产品应用8

Tabbit浏览器实测:AI终于学会帮我上网干活了

本文实测Tabbit浏览器,它刚正式发布且免费。与Arc、Atlas不同,Tabbit切换成本几乎为零,有智能标签整理、妙招功能、Agent智能代理等,还内置个国内外大模型,但脚本妙招和智能标签整理有改进空间。

花叔
产品应用8

顶尖开发者都在用 skills.sh热门技能

发现全能Skills网站https://skills.sh/,它是Open Agent Skills Ecosystem载体,解决AI Agent能力碎片化等问题。提供一键安装的技能模块库,支持主流AI Agent适配,有技能排行榜,还能解决AI Agent的能力痛点。

CourseAI