人在循环中」共找到 8864 篇相关文章

算法论文8

告别数据「噪音」,UCSD大模型推理新方法DreamPRM充当「信号放大器」,登顶MathVista测评榜

DreamPRM由加州大学圣地亚哥分校团队开发,MathVista测评榜夺冠。它通过双层优化框架解决多模态过程奖励模型训练难题,能与多模态大模型集成,提升推理能力,实验效果显著。

机器之心
开源动态7

Alibaba开源WebDancer解决DeepResearch复杂信息检索难题

Alibaba开源WebDancer,从数据和训练阶段出发提出端到端自主信息检索代理构建范式。实验中,它GAIA和WebWalkerQA基准测试表现出色,处理复杂信息检索优势显著。

CourseAI
产品应用7

再也不用盯着几十个终端窗口!Claude Code推出Agent视图,一屏管所有

Claude Code推出Agent视图功能,能让用户一个界面统一管理所有Claude Code会话,改善了会话可视化和交互方式。用户可总览会话、不离开视图查看回复、随时切到后台,开发者也有多种典型用法。

AI寒武纪
算法论文8

北大伯克利联手“拷问”大模型:最强Agent也才40分!新基准专治“不听话”的AI分析师

北大与伯克利团队推出IDA - Bench新基准,模拟真实数据分析场景,解决现有基准无法评估大模型动态交互中可靠性的问题。测试显示,顶尖大模型成功率最高仅40%,不同模型还暴露多种问题。

量子位
新闻资讯7

5Y News | 欧拉万象完成数亿元融资,要做「养成系」家庭具身智能机器

家庭具身智能企业欧拉万象近日完成数亿元融资,由招商局创投领投。创始周顺波、联合创始张靖履历亮眼。其走‘渐进式进化’路线,将推可养成机器,获资本市场认可。

五源资本 5Y Capital
算法论文8

DMLR 2026 | RPI Shaowu Pan(潘韶武)团队 Nithin Somasekharan等:CFDLLMBench——首个面向计算流体力学的大语言模型综合基准评测

文章介绍针对CFD领域的综合LLM评测基准CFDLLMBench,构建三层递进挑战体系。实验揭示主流LLM‘知道’与‘做到’间有差距,多智能体框架可提升成功率,代码与数据集已开源。

力学与人工智能
7

GPT-6抢先发布?Mythos被曝难产,算力惊烧垮Anthropic

新智元报道,OpenAI狂烧6000亿且高管内讧,Anthropic收入暴涨但服务器扛不住。GPT - 6消息传得沸沸扬扬,Mythos却因算力难产。双方算力、上市等方面竞争激烈,都面临困境。

新智元
算法论文8

结构化扩展拿下Agent工具检索新SOTA,精准找到API|ICLR'26

宁波东方理工大学沈晓宇团队ICLR 2026发表论文,指出当前工具检索瓶颈于工具文档。提出对文档结构化扩展,再训练模型的方案,构建TOOL - REX等组件,实验显示显著提升检索性能。

量子位
开源动态8

南京大学开源SteadyDancer模型实现完美动作迁移,首帧保留彻底解决身份漂移难题

南京大学、腾讯PCG与上海工智能实验室联合推出SteadyDancer,这是首个基于Image-to-Video范式并严格实现首帧保留的开源像动画框架,解决了传统方法身份漂移难题,多方面表现优异。

AIGC开放社区
新闻资讯7

The Batch: 867 | 印度推动本土工智能建设

印度资金有限、语言与方言众多情况下,正加倍努力建设本土大模型。政府资助初创企业、调配算力,多家公司研发多语言模型,虽面临挑战,但旨开发符合自身需求的工智能。

DeeplearningAI