企业级数据 Agent」共找到 5670 篇相关文章

算法论文8

告别数据「噪音」,UCSD大模型推理新方法DreamPRM充当「信号放大器」,登顶MathVista测评榜

DreamPRM由加州大学圣地亚哥分校团队开发,在MathVista测评榜夺冠。它通过双层优化框架解决多模态过程奖励模型训练难题,能与多模态大模型集成,提升推理能力,实验效果显著。

机器之心
产品应用8

Listen Labs:把用户研究“黑灯流水线”化,AI Agent 系统实现小时级洞察

Listen Labs由两位哈佛校友在2024年底创立,2025年4月获2700万美元融资。今年2 - 5月发布三项核心能力,可实现全流程自动化深访。文章详解其如何实现小时级交付,分析竞争态势与优势,也指出未来待改进处。

海外独角兽
产品应用7

华为昇腾推理对决:开源vLLM vs 官方MindIE,数据说话「Qwen与DeepSeek推理实测」

文章围绕华为昇腾推理,对比开源vLLM与官方MindIE。借助GPUStack平台测试Qwen与DeepSeek模型,分析不同场景性能。指出vLLM和MindIE各有优势,还强调构建国产AI推理生态需多要素,鼓励开源协作。

AI寒武纪
算法论文8

无需人工标注!AI自生成训练数据,靠「演绎-归纳-溯因」解锁推理能力

新加坡国立大学等机构研究者提出元能力对齐训练框架,模仿人类推理心理学原理,将演绎、归纳与溯因能力融入模型训练。实验显示,该方法提升模型在多任务上的性能,且有跨领域可扩展性。

新智元
算法论文8

33%!Claude、GPT、Gemini 在真实网站上集体翻车,ClawBench 把 AI agent 打回原形

ClawBench让AI在144个真实网站执行153个日常任务,结果惨烈,如Claude Sonnet 4.6每三任务翻车两个,GPT - 5.4仅完成10个。它还揭示AI在真实环境的问题,为评估模型提供标尺。

机器之心
新闻资讯7

说一个反常识的真相,Agent如今在真实工作场景的成功率依然很低。

作者有感于AI在真实工作场景评测的稀缺性,以阿里国际站RealReplicaBench评测集为例,介绍电商场景任务,发现多数模型成功率低,其他领域类似,呼吁厂商努力,作者也计划自跑评测更新排名。

数字生命卡兹克
算法论文8

大模型"温故而知新"实现了!无需历史数据,Octopus 效果超越全数据训练|CVPR‘26 Octopus

上海交通大学与vivo团队提出全新持续学习框架Octopus,首创无需历史数据的梯度正交化技术。实验显示,它在UCIT基准上表现超SOTA方法,还实现正向后向迁移,适合端侧部署。

量子位
算法论文8

国产多模态Agent拿下医学分割SOTA!不用改模型、不加token | 浙大&上海AI Lab

现有医学多模态大模型在分割生物医学图像时存在瓶颈,浙大蔡钰祥教授、上海AI Lab江彦开等人提出IBISAgent框架,将分割定义为多步视觉决策过程,实验显示其在多数据集上大幅领先对比方法。

量子位
新闻资讯8

AI Agent搞定世纪首次菲尔兹奖成果形式化!一周时间独立完成,20万行代码已公开

Math公司的AI Gauss用5天完成原本需6个月的菲尔兹奖级数学成果形式化证明,一周搞定24维情形,还修正原论文错误。其创始人是xAI联合创始人Christian Szegedy,代码已公开。

量子位
产品应用8

字节豆包2.0重磅发布!成本暴降一个数量级,Seed团队揭秘视频Agent竞争关键

今日字节发布豆包大模型2.0系列,围绕大规模生产环境需求优化,有Pro、Lite、Mini和Code四款模型。其Token单价低一个数量级,多模态理解能力升级,未来将围绕长链路智能系统构建发展。

InfoQ