多模态智能体」共找到 4177 篇相关文章

产品应用8

字节扣子空间上新一键转播客功能,现在我们真成同事了|甲子光年

5月27日,字节跳动旗下AI协同办公平台扣子空间新增播客功能。其播客音频生成功能让AI从‘说什么’跨越到‘怎么说’,适用于多场景。扣子空间还具备跨模态协作等能力,引入MCP协议,免费开放核心功能。

甲子光年
新闻资讯7

全日程公布|谷歌Veo 3惊艳发布后,这场CVPR分享会值得每个AI人「听个声」

谷歌在 I/O 2025 大会发布 AI 视频生成模型 Veo 3,实现音画同步。为让从业者了解 AI 新成果与趋势,机器之心 6 月 8 日将举办「CVPR 2025 论文分享会」,公布全日程、嘉宾及主题,还会直播。

机器之心
新闻资讯8

一场“直面行业真问题”机器人比赛的万字观赛报告|甲子光年

甲子光年发布ICRA上WBCD赛事观赛报告。该赛聚焦双臂机器人,设生命科学、物流打包、餐桌服务挑战。从实际需求出发,吸引全球团队。各赛展现不同技术亮点,如洛桑联邦理工线控、卡内基梅隆神经 - 符号架构等。

甲子光年
开源动态7

如何重现 DeepSeek 推理性能突破

DeepSeek-V3 是热门开源大模型,采用大规模 MoE 架构,优化推理性能是工程难点。阿里团队在 RTP - LLM 完成优化,对齐其推理系统性能,分享关键技术、不足与思考,还提及对 Qwen3 模型的优化策略。

InfoQ
推荐文章8

翁荔最新万字长文:Why We Think

北大校友、前OpenAI华人VP翁荔发布万字长文《Why We Think》,围绕“测试时计算”和“思维链”,探讨提升模型性能的方法,涉及心理学类比、基于Token的思考、分支与编辑等多方面内容。

量子位
算法论文8

ICML 2025 Spotlight|南洋理工陶大程教授团队等提出基于RAG的高分辨率图像感知框架,准确率提高20%

南洋理工陶大程教授团队等合作,为解决多模态大语言模型处理高分辨率图像问题,探索 RAG 应用可行性,提出 Retrieval-Augmented Perception (RAP) 框架,在多任务上提升性能,已被 ICML 2025 接收。

机器之心
产品应用7

“光靠人盯不住了”!拆解上万张晶圆,这家公司靠 AI 将芯片良率提升数个百分点

喆塔科技创始人赵文政看好半导软件领域引入AI技术。喆塔将DeepSeek接入自研模型,应用机器学习算法提升半导企业良率,构建智能生态系统,产品获客户认可,未来将加大研发投入。

InfoQ
开源动态8

开源模型两个月内杀死比赛

过去60天,Vercel AI Gateway调用数据显示,开源模型Token调用份额从28%涨至62%,反超闭源模型。英伟达60亿美元入局扶持,闭源虽推新降价仍失领先,开源走向大规模应用。

AI前线
算法论文8

VLM会描述视频,却未必用对参考图:RefCaptioner让参考图与视频语义精准对应

多模态大模型处理多参考图与视频对应关系能力不足。为此提出 RefCaptioner,强化模型对参考图识别感应能力、优化输出格式与奖励函数;还构建 MRVBench 评测基准,实验显示其表现优异。

机器之心
产品应用7

OpenCode AI编程实践:利用推理路由低成本开发游戏

文章介绍用 OpenCode 结合 DigitalOcean 推理路由器开发点球大战游戏 PK Shootout。其按任务选模型,多数任务路由到 MiMo V2.5 和 GLM - 5.2,成本约 8.25 美元,远低于只用前沿模型。文中还分析开发各环节及适用场景。

AI工程化