生成模型进化」共找到 8927 篇相关文章

开源动态8

还在为拍视频头疼?AI 一键生成短视频,这工具也太香了吧!

文章介绍开源工具 Pixelle-Video,它能让视频创作变得简单。输入主题,它可自动撰写文案、生成配图、合成语音、添加音乐并合成视频,还支持多种功能和大模型,有多种使用和付费方案。

小华同学ai
产品应用8

真碾压Sora了!谷歌Veo 3首次实现音画同步,视频模型直接「开口说话」

谷歌正式发布Veo 3,它能生成高质量视频,还能理解原始像素,自动生成与画面同步的对话、多种音效。得益于DeepMind的V2A底层技术,其音画合成功能领先。虽有时长和使用门槛限制,但已足够震撼。

机器之心
算法论文8

DeepMind新论文炸锅:AI全自动进化算法,写出专家都想不到的解,网友:这可能就是“王牌”

谷歌DeepMind让LLM驱动的智能体AlphaEvolve改写、进化算法代码。选定CFR、PSRO框架,只开放关键决策逻辑给LLM,通过生成、运行、评估、筛选循环,进化出VAD - CFR和SHOR - PSRO算法,表现超人类手工版本。

InfoQ
新闻资讯7

IMO题库“过时”了!OpenAI内部模型挑战最新First Proof,做了7天错了一半

谷歌发布Gemini 3 Deep Think爆火后,OpenAI用未发布内部模型,一周内尝试解答10道来自数学家科研现场的真实问题,5道基本正确。这些题取自真实研究,切断模型“背答案”可能,意味着自主推理能力进化

量子位
产品应用7

机器人是具身大模型的「用户」:超维动力如何打通从人类经验到机器人行动?

今年WAIC,超维动力展台的乒乓球桌和双臂机器人开易拉罐演示吸引关注。其机器人90%经验来自人类第一视角数据,超维动力全栈布局,试图打通人类经验到机器人行动链路,目标是建立机器人持续进化方式。

机器之心
开源动态8

CVPR 2026 | 1B模型也能当多镜头导演?大连理工&快手可灵开源力作MultiShotMaster

大连理工与快手可灵团队推出MultiShotMaster框架,能在1B左右小参数量级模型实现导演级镜头调度和连贯叙事,支持多图参考、主体运动控制。论文录用至CVPR 2026,代码已开源,还获AAAI CVM Workshop竞赛冠军。

机器之心
算法论文8

ICML 2026 | 将多教师冲突转化为动态约束,破解多模态大模型推理对齐难题

在多模态大模型发展中,多教师知识蒸馏成提升性能关键,但教师模型存在“概念漂移”问题。悉尼科技大学团队提出 APO 框架,将模型间“漂移”转化为动态负约束,解决多模态大模型多师蒸馏概念对齐难题,工作被 ICML 2026 接收。

机器之心
算法论文8

世界模型炒作了半年,反应速度还不如 VLA?穆尧团队和百度智能云给出最新解法

生成式世界模型用于机器人控制备受争议,因其推理延迟高。上海交通大学 ScaleLab 团队等联合发布 AHA - WAM,解决推理延迟和时空分辨率错配问题,在任务成功率和推理速度上领先,还需系统协同推进落地。

InfoQ
产品应用8

硬刚Sora2,万相2.6轻松定制角色、控制分镜,普通人也能当导演

2025 年视频生成领域发展迅猛,OpenAI 的 Sora 2 带来新玩法,商业落地加速,但普通用户体验门槛高。12 月 16 日阿里发布万相 2.6 系列模型,功能全面升级,实测效果惊人,标志 AI 视频生成迈向精准可控新阶段。

机器之心
产品应用8

Speech-02语音模型登顶国际榜单:完美复刻声音,同事听后难辨真伪

MiniMax的Speech-02语音模型登顶国际榜单,超越OpenAI等海外模型。它引入可学习说话人编码器,有高扩展性,还能结合文本描述生成音色。测试显示其音色丰富、读音准、支持多语种,声音复刻逼真。

歸藏的AI工具箱