声画同出」共找到 1124 篇相关文章

开源动态8

一句话生图要过时了?开源图像生成Agent进化「工具编排」

来自多机构的研究团队提GenEvolve,将开放图像生成建模为「工具编排轨迹」。它配置三类工具,经多轮决策完成生成。通过构建数据集训练,实验显示在多基准上表现色,已开源模型、代码等。

机器之心
产品应用7

龙虾更新了大bug,12小时内紧急发新版

龙虾火速更新到OpenClaw 2026.3.23版本,距3.22版本仅12小时。此次更新光速修复UI崩溃,接入DeepSeek和Qwen家族,完善插件API兼容性,还在UI、模型、安全等方面有改进。

量子位
开源动态8

开源音视频步SOTA基座:极简的单流架构,2秒

AI视频生成迈入音视频步新纪元,闭源巨头已展实力,而上海创智学院与Sand.ai联合发布的开源音视频生成基础模型daVinci - MagiHuman,以极简单流架构,2秒就能在1张H100显卡上生成精准音视频步画面。

AIGC开放社区
新闻资讯8

LeCun 对线 DeepMind:LLM 永远造不机器人水管工

图灵奖得主 Yann LeCun 和 Google DeepMind 的 Adam Brown 就 LLM 是否真正理解世界展开争论。LeCun 认为 LLM 虽在符号操作领域色,但难理解物理世界;Adam Brown 则觉得 LLM 正涌现对宇宙的真正理解。

AGI Hunt
算法论文8

给定"标价"的 LLM 智能体,能规划"最优"路径吗?

在LLM智能体多轮工具使用中,评估成本是难题。来自多所高校的团队推CostBench基准,围绕旅行规划构建评估环境。评估顶尖模型发现其规划与适应能力有短板,并分析失效根源,还指下一代智能体演进方向。

深度学习自然语言处理
开源动态8

LeCun预言成真!790年长视频,炼最强开源「世界模型」

2025年‘世界模型’成AI巨头战场,谷歌、李飞飞团队等纷纷布局。上周北京智源研究院发布Emu3.5,340亿参数,基于790年长视频数据训练,其架构优越,推理快,能力强,还公开技术报告邀全球探索。

新智元
算法论文8

DeepMind再登Nature:AI Agent造了最强RL算法!

Google DeepMind团队提DiscoRL,让智能体在多环境交互中自主发现强化学习规则,无需人类设计。它在Atari基准中击败MuZero,在未见过的游戏中也稳定高效,相关研究登《Nature》。

新智元
新闻资讯8

Gemini 3.0 Pro内测流,编程实力惊人!下周上线

十月AI战场热闹非凡,Sora 2刚亮相,谷歌下一代Gemini旗舰模型Gemini 3.0蓄势待发,最晚下周上线。内部代码流其有Pro和Flash两版本,实测在编程等方面表现惊艳,虽未发布却暗示编码时代将变。

新智元
新闻资讯7

杭州闯40亿AI医疗IPO!阿里CEO多轮投资

杭州AI陪诊公司微脉准备赴港IPO,其创始人裘加林经验丰富。微脉依托自研CareAI平台,以与公立医院合作为核心开展全病程管理服务,业务增长可观,虽仍亏损但在收窄,此次募资用于AI能力提升和业务扩张。

量子位
新闻资讯7

中国半导体显示产业之父,将带一个超级IPO

投资界消息,奕斯伟计算向港交所递交招股书,有望成“RISC-V第一股”。其掌门人为王东升,曾带领京东方走向全球霸主地位。奕斯伟计算聚焦RISC - V架构,获多轮融资,王东升还投资半导体产业链多企业。

芯师爷