图像到视频」共找到 3228 篇相关文章

产品应用8

谷歌Gemini 2.5全线爆发!勇战「濒死恐慌」,却被丝血宝可梦吓当场宕机

谷歌旗舰Gemini 2.5全家桶三款模型昨夜上线,包括正式版2.5 Pro、2.5 Flash及预览版2.5 Flash - Lite。技术报告显示其性能提升显著,还在玩宝可梦时惊现类人恐慌,推理性能下降。

新智元
算法论文8

一个省略号提示+强化学习搞定大模型“过度思考”,中科院自动化所新方法:从强制推理自主选择

中国科学院自动化研究所联合鹏城实验室提出AutoThink方法,用省略号提示和多阶段强化学习,让推理大模型依题目难度自主切换思考模式,解决过度思考问题,在多数据集验证有效。

量子位
推荐文章8

陶大程技术博客首发:从像素复刻行动控制,具身世界模型的底层逻辑探索|甲子光年

今年世界模型成AI热点,通用世界模型追求像素逼真,具身世界模型不同,其使命是支撑行动。文章拆解具身世界模型底层逻辑,分享开悟世界模型的技术设计与实践思考。

甲子光年
算法论文8

从「说错话」「干错事」:复旦、CityUHK、SMU、UIUC等13家机构联合发布「具身智能安全」综述

具身智能正从实验室走向现实世界,却带来‘干错事’的现实风险。13家机构38位学者联合发布70+页综述,提出‘能力—风险’二象性,梳理各能力层攻击面与风险,还指出研究空白,维护开放资源生态。

机器之心
算法论文8

让大模型基于「图像事实」说话:用事实文本+自适应编辑,让语言偏见无处遁形丨ICLR'26

多模态大模型看图常“脑补”,存在对象幻觉问题。北航团队提出AFTER框架,含FAS和QAO模块,能在主流LVLM和基准上显著降低幻觉,且推理开销低,为多模态助手落地提供实用路径。

量子位
算法论文8

从视觉出发统一多模态!颜水成团队最新研究:不再把图像编解码器塞进LLM|ICLR'2026

NVIDIA研究员Jim Fan称AI正经历第二次预训练范式转移。颜水成团队Muddit模型从视觉先验出发,用离散扩散框架统一文生图、图生文和VQA,挑战多模态“语言中心论”,在多任务表现出色。

量子位
开源动态8

1.8K Star!又挖一款超酷的 Claude Cowork 开源平替,而且比 Cowork 更快更省!

Anthropic 发布 Claude 的 Cowork 能力后成热门,但高额费用和封闭策略让普通人却步。现推荐开源替代方案 OpenWork,它免费开源,速度快、省 Token,还引入安全隔离机制,功能丰富。

开源星探
新闻资讯8

CES 2026超前瞻:空间智能来势汹汹!从实验室奢侈品消费级刚需,如何重塑 AI 具身时代?

2026年CES展上,空间智能从学术概念迈向产业实践。当前具身智能存在‘语言强、手脚笨’困境,空间智能是破解关键。全球分世界生成与空间决策两条技术路径,且行业正迎来成本降低的拐点。

机器之心
算法论文8

PPO-Clip的「盲点」被补齐了?快手提出熵比裁剪方法,从局部约束全局稳定的关键一跃

快手科技语言大模型团队提出熵比裁剪(ERC)方法,应对强化学习中信任域偏离问题。该方法从全局视角稳定策略分布,在多个数学推理基准实验中提升了模型性能,还与多种方法对比验证了泛化能力。

机器之心
新闻资讯8

Linux之父又开喷:AI泡沫“病态扭曲、迟早暴跌”、马斯克式KPI“愚蠢不该待在科技圈”

Linus Torvalds 在节目中谈诸多话题。他认为 AI 是泡沫且市场叙事病态,迟早暴跌,但也会改变社会和工作方式;不认同用代码行数衡量绩效,称此举愚蠢。还谈了对 Linux、Git、微软等看法,以及装机细节。

InfoQ