多模态程序合成」共找到 1314 篇相关文章

算法论文7

ICCV2025 | 多视图生成新范式-利用自回归模型探索多视图生成

本文介绍自回归生成多视图图像方法 MVAR,能从先前视图提取引导信息增强一致性,拉近与基于扩散方法的图像质量差距。解决了多模态条件控制和数据有限问题,展示出强指令遵从与多视角一致性。

机器之心
算法论文8

生成式视角重塑监督学习!标签不只是答案,更是学习指南 | ICML 2025

上海交大等机构团队在ICML 2025提出预测一致性学习(PCL),通过扩散过程消减标签信息,引入噪声标签,将标签学习分解为渐进式任务,实现标签信息复用。在多模态任务实验中,PCL表现优于传统监督学习。

量子位
算法论文8

打破具身世界模型可执行性鸿沟 !港中深-跨维智能团队提出EVA框架,用强化学习让视频世界模型真正“动”起来

近期,利用视频生成模型为机器人构建“世界模型”成热门路线,但存在“可执行性鸿沟”。港中深 - 跨维智能团队提出 EVA 框架,用强化学习优化视频生成,实验显示其能提升视觉规划、仿真任务成功率及真实部署稳定性,还有数据合成潜力。

机器之心
开源动态8

DeepSeek-V3.2正式版发布,将开源模型的能力推向极致

DeepSeek-V3.2正式版开源,包含标准版和Special版。它采用稀疏注意力机制,降低计算复杂度。后训练阶段有多项算法改进,支撑高难度推理。还融合思考与工具使用,合成训练数据,在智能体评测表现优异。

AIGC开放社区
新闻资讯8

深度讨论 Gemini 3 :Google 王者回归,LLM 新一轮排位赛猜想|Best Ideas

近期,OpenAI、Google、Anthropic 先后发布新模型,引发大模型竞赛。本文聚焦 Google 发布的 Gemini 3,从算力、数据、架构等维度剖析其强大原因,探讨大模型竞争新格局,还涉及多模态、硬件、商业化及产品形态等方面。

海外独角兽
产品应用8

Claude统治一切!吞下这颗红药丸,焊工也是顶尖程序

一种被称为「Claude - pilled」的现象在硅谷蔓延,焊工、律师等非程序员用Claude Code写APP,程序员护城河渐崩。但工程师用它后学习速度下降,社区探索让AI成导师的办法,且软件开发范式正转变。

新智元
算法论文8

坏了,我成AI的乙方了!Anthropic论文爆火,谁还敢无脑Copy?

Anthropic开年论文实锤AI让程序员变傻,用AI辅助的人比纯手写只快2分钟,且测验平均分低17%。研究将工程师使用AI的交互行为归纳为五种模式,指出主动拷问AI才能进化,高分者会主动制造障碍。

新智元
新闻资讯7

第一批买机器人做家务的人崩溃了

第一批买机器人做家务的人崩溃了,自主机器人常闯祸,体验感差。传奇程序员卡马克建议卖远程家政服务,如1X Technologies的NEO机器人就是远程操控。但也有人认为机器人应具自主性,部分企业还搞预售圈钱。

量子位
开源动态8

社区供稿 | 阿里国际Ovis2.5重磅发布:以小博大,刷新开源模型性能新高度

阿里国际发布多模态大模型Ovis2.5,在OpenCompass综合得分提升,保持SOTA水平。它在原生分辨率视觉感知等三方面突破,有9B和2B两版本,代码、模型等资源已开源,技术原理涉及架构、训练与数据。

Hugging Face
算法论文7

一张俯视图,竟然能生成完整3D小镇?

获取高质量3D场景成本高、耗时长,现有3D生成模型扩展到完整场景生成时问题多。加州大学提出无需训练的3DTown框架,能从单张俯视图合成真实连贯3D场景,虽有挑战但表现优于基线方法。

带你学AI