「多模态玩法」共找到 1448 篇相关文章
首次结合RL与SFT各自优势,动态引导模型实现推理⾼效训练
新一代大型推理模型在复杂推理有进展,核心是ZERO - RL训练法。华为香港研究所小艺团队等合作推出GHPO算法框架,融合在线强化学习与模仿学习,解决了RLVR方法局限,提升模型训练效果,代码数据开源。
DeepRare 重磅发布:全球首个可循证智能体诊断系统,直击医学Last Exam难题
上海交通大学人工智能学院等联合发布全球首个罕见病推理型智能体诊断系统DeepRare。它结合大模型和多智能体架构,模拟医生诊断思维,支持多模态输入,在多数据集评估中表现出色,已上线在线平台。
真香!我用AI做PPT的血泪史:从“能用”到“真香”,V3版到底解决了什么?
作者因公开分享需做PPT,尝试多种AI PPT工具后,自己围绕Agent攒了一个。从V1到V3版不断改进,V3用多Agent提示词用法,风格多样且规则减少,还给出3步制作PPT的方法及后续功能拓展想法。
马斯克Grok这个二次元「小姐姐」,攻陷了整个互联网
今天凌晨马斯克通知更新Grok APP,推出基于Grok 4大模型的「智能伴侣」功能,付费用户可优先用新「数字伴侣」头像。此外Grok还在游戏领域出击,开发者用提示词就能生成可玩游戏,效率大增。
百度在 AI IDE 上的决心
百度发布国内首个多模态、多智能体协同的AI IDE:Comate AI IDE。其功能完备,百度在AI IDE赛道决心大。随着模型和Agent能力提升,百度认为未来IDE竞争本质是Agent竞争,其早有相关布局。
“甲方快乐模型”诞生,拿下平面设计新SOTA!多条件一键生成,还能独立调整元素 | 复旦&字节
复旦大学和字节跳动团队联合提出CreatiDesign新模型,可实现高精度、多模态、可编辑的AI图形设计生成。它解决了以往方法在处理图形设计时的难题,在多维度评估基准上表现出色,还支持多轮编辑。
MMAR与AudioTrust技术解读,音频大模型评测前沿进展分享 | AI Bench Talk直播预告
司南评测集社区 CompassHub 收录多维度评测集。此次 AI Bench Talk 直播聚焦音频大模型,将分享评估其深度推理能力的 MMAR 及全方位可信评估框架 AudioTrust,还设圆桌讨论多模态/音频大模型相关议题。
谷歌悄咪咪上线了 10 款 AI 应用,下一个 NotebookLM 可能在里面
谷歌在Google Labs上线10款AI应用,如Whisk生图、Mixtape将名画变音乐、Food Mood定制食谱等。不少项目虽处实验阶段,但完成度和可玩性高,还展现了谷歌在AI领域的探索与创新。
不愁了!开源智能体Paper2Poster「一键生成」学术海报
2025年5月,滑铁卢大学等团队发布Paper2Poster系统,用大模型将论文自动生海报。它提出PosterAgent多智能体方法,分解析、规划、绘制优化三阶段,生成效果好且开源,不过也存在效率和创意不足问题。
阿里通义的视觉RAG革命!VRAG-RL:基于强化学习的视觉感知RAG框架,性能飙升30%
阿里巴巴通义实验室推出VRAG - RL,融合视觉感知、多模态推理与强化学习,已在GitHub开源。它破解传统RAG处理视觉数据难题,通过创新机制提升性能,在多数据集表现出色,还将向更拟人化和低幻觉方向发展。