多工具调用」共找到 5597 篇相关文章

算法论文8

超越Claude Mythos和GPT-5.5!斯坦福Agent验证框架拿下SOTA,Transformer作者转发

斯坦福、伯克利与英伟达联手打造LLM-as-a-Verifier验证框架,该方法是通用验证机制,可与任意Agent Harness和模型结合。研究表明扩展验证阶段计算量,能提升Agent整体性能,在基准测试中超越Claude Mythos和GPT - 5.5。

量子位
开源动态8

清华开源教育龙虾,沉浸式互动课堂,运行成本仅为传统的千分之一

清华大学团队将校内验证两年的AI课堂系统OpenMAIC开源。它能把主题或文档转化为互动课堂,运行成本仅为传统MOOC的千分之一。有种组件,智能体协作,还支持种大模型,已获学生积极反馈。

AIGC开放社区
开源动态8

音频全能王炸!小米MiMo-Audio开源,力压Gemini/GPT-4o!

小米团队开源通用音频大模型MiMo-Audio,集种功能于一身,支持7国语言零样本克隆和中英混合合成。首包延迟低,效果自然稳定。在个基准测试中表现优于Gemini-2.5-Flash和GPT-4o-Audio。

开源星探
产品应用8

3.4K星Apple出品FastVLM:视觉TTFT效率提升85倍,凭啥这么牛!

文章指出VLM在实际生产应用中因高分辨率图像存在效率问题,介绍Apple出品的FastVLM解决方案,阐述其架构、训练过程,展示在个基准测试的性能,凸显在高分辨率输入下提升效率的优势及实际应用价值。

CourseAI
产品应用7

智能体请求暴增 9.4 倍,token 账单却没涨:Uber 公开 AI 软件工厂省钱方法

AI 工具已嵌入 Uber 软件开发各阶段,智能体请求量增长 9.4 倍,但 AI 总支出自 4 月相对稳定。文章介绍其软件工厂思考,包括智能体会话层级、成本公式、指标测算及优化手段,还提及未来举措。

InfoQ
算法论文8

Auto-Research「终极大考」:新基准撕下大模型科研伪装

来自所高校的研究者提出MLS - Bench,用于解决现有Auto - Research评测的归因问题。它含140个真实研究任务,校准受控修改范围,主实验显示当前模型在方法发现上有明显缺口,Auto - Research需更严格评测标准。

机器之心
产品应用8

全域感知,一键部署:“星元智能体”开启国产AI落地新范式

4月29日,数字感知芯片技术全国重点实验室联合中星微团队发布‘星元智能体’。它基于XPU芯片,完成从芯片到智能体跨越,架构创新破算力瓶颈,还破解数据困局,已在地试点,未来将推动AI产业发展。

芯师爷
开源动态8

腾讯混元开源世界模型!2.0版本一键生成3D空间,游戏关卡随心造

4月16日,腾讯正式发布并开源混元3D世界模型2.0(HY - World 2.0)。它是模态模型,能理解种输入,自动生成、重建和模拟3D世界,支持格式3D资产导出,可与游戏工作流对接。

量子位
开源动态8

目标更重要?国内公司超越Generalist,进化到动作中心世界模型

具身智能圈被Generalist CEO长文刷屏,其称目标比工具标签重要。但国内极佳世界未停于概念争辩,开源“以动作为中心的世界模型”GigaWorld - Policy,重构具身智能底层逻辑,在方面表现出色。

机器之心
产品应用8

实测腾讯云 AndonQ:号称比肩原厂技术专家的 “领域虾”,到底有能打?

文章实测腾讯云 AndonQ,它号称全球首款 ITSM“领域虾”,可适配主流“虾”类工具,集成至 IM Bot。测评显示其成本低、上手轻量,在架构选型、故障排查等场景表现出色,将 ITSM 体系浓缩到对话框。

AI前线