多LLM系统」共找到 5926 篇相关文章

算法论文8

ICML 2025 | 西湖大学吴泰霖研究员团队:组合生成式物理场元件PDE仿真

西湖大学吴泰霖课题组联合方提出“组合生成式物理场元件PDE仿真(M2PDE)”,将仿真问题视为生成式概率建模任务。该成果在任务测试中表现卓越,被ICML 2025接收。

力学与人工智能
开源动态8

终于!世界模型进入“有声时代”:24FPS画面+48kHz立体声实时生成

过去两年视频生成模型不断提升画面参数,但传统模型生成的视频固定,用户无法干预。而世界模型可跟随操作实时渲染、动态生成世界。目前Noiz AI联合机构发布实时可交互音视频世界模型HelixWorld 1.0,后续还将开源。

量子位
开源动态8

开源真强大,不敢相信,太真实,揭秘8.3k star 开源神器 VoiceCraft 如何封神!!!

VoiceCraft 是团队合作推出的零样本语音编辑与 TTS 开源项目。它能几秒克隆语音,实现编辑功能,支持零样本文本转语音,在真实场景音频中性能超 XTTS - v2、VALL‑E 等模型,解决了内容创作和编辑痛点。

小华同学ai
算法论文8

WWW'26 | 跨任务自适应的Multi-Agent协作新范式

大型语言模型驱动的智能体系统成解决复杂任务重要范式,但智能体协作存在关键问题。Griffith和西北农林科技大学团队提出OFA - MAS,将智能体拓扑设计从one - for - one推向one - for - all,实验效果佳。

PaperAgent
开源动态8

湾大北交大开源 CutClaw,自动踩点音乐的 AI 智能视频剪辑师!

大湾区大学GVC实验室和北京交通大学团队开源CutClaw,它是模拟专业后期流程的智能体系统,能实现音乐驱动剪辑,按文字指令自动剪辑,适配平台,还可解构素材。操作简单,支持模型。

开源星探
算法论文8

PixelRefer :让AI从“看大图”走向“看懂每个对象”

模态大模型停留在整体场景级理解,现实任务需细粒度、对象级理解。浙江大学等联合提出PixelRefer框架,可实现精细视觉指代与推理,在项任务表现领先,轻量版性能优,还开源两类数据集。

机器之心
开源动态8

字节开源图像生成“六边形战士”,一个模型搞定人物/主体/风格保持

字节UXO团队设计并开源统一框架USO,解决图像生成指标一致性问题。它能统一看似孤立任务,实现单任务和组合任务的SOTA,弥补了主体保持和风格迁移短板,性能领先,还采用新范式及算法。

量子位
开源动态8

真狠!4 万 Star CodeWhale,AI 写代码最怕的是什么????

文章介绍开源的CodeWhale,它是terminal coding agent harness,GitHub超4万Star。它给代码Agent定规则,涵盖身份、证据等原则。支持模型,有任务流程和Agent协作功能,还分析适用人群并给出启动方法。

小华同学ai
算法论文7

港中文 MMlab×美团新研究:仅用一个模型,应对种视觉推理任务

港中文 MMLab 与美团联合提出 OneThinker 模态统一推理模型,将种视觉任务抽象为‘先推理、后作答’形式,通过任务强化学习优化。实验显示其在任务表现佳,为通用视觉推理模型提供参考。

AI科技评论
产品应用7

基于Spring AI Alibaba 的 DeepResearch 架构与实践

本文基于 SpringAI Alibaba Graph 构建 Java 版 DeepResearch 系统,实现信息搜集到报告生成的全自动流程。介绍系统能力、架构、核心功能节点及技术点,还阐述 RAG、搜索、MCP、报告生成等功能,给出使用、部署和社区参与方式。

阿里云开发者