「图像思考」共找到 1067 篇相关文章
硬刚Sora2,万相2.6轻松定制角色、控制分镜,普通人也能当导演
2025 年视频生成领域发展迅猛,OpenAI 的 Sora 2 带来新玩法,商业落地加速,但普通用户体验门槛高。12 月 16 日阿里发布万相 2.6 系列模型,功能全面升级,实测效果惊人,标志 AI 视频生成迈向精准可控新阶段。
阿里电影级视频模型万相2.6系列上线,功能比Sora2还全,人人都能当导演
12月16日,阿里发布通义万相2.6系列模型,5款新模型同时上线,覆盖图像到视频多环节。它是国内首个支持角色扮演的视频模型,功能比Sora2全,已上线阿里云百炼和万相官网。
预测下一个像素还需要几年?谷歌:五年够了
谷歌DeepMind研究者分析下一像素预测在图像识别与生成任务中的扩展特性。实验显示其扩展趋势与文本类似但效率低,最优策略因任务和分辨率而异,预计未来五年逐像素建模可行。
工作场景AI化,一个月花100美元订阅AI工具值吗?
AICon 全球人工智能开发与应用大会 2025 北京站即将召开,InfoQ 直播栏目邀请来也科技胡一川、阿里汤威、美团邹明远、快手王东旭探讨 AI 时代「10x 个体」与「10x 组织」,分享落地路径、效率提升及工具使用经验。
黄仁勋、李飞飞、Yann LeCun等六位AI顶级大佬最新对话:AI到底有没有泡沫?
六位 AI 顶级大佬黄仁勋、约书亚·本吉奥等齐聚参加峰会对话,回顾 AI 发展历程,分享职业生涯“顿悟时刻”,探讨 AI 是否有泡沫、何时达人类智能水平等问题,各抒己见展现对 AI 未来的不同思考。
国产模型新盛况!王座易主:Kimi K2 Thinking开源超闭源
月之暗面开源 Kimi K2 Thinking 模型,多方面性能超 GPT - 5 等闭源模型。它擅长多轮调用工具和持续思考,在多项基准测试达 SOTA 水平,成本低且授权宽松,引发全网讨论。
当 AI 下场炒 A 股,「推理」成了新的直觉
海外“AI Trading Battle”实验中,不同大模型交易表现差异大。港科大等团队提出RETuning方法,基于A股数据集验证,显著提升大模型金融预测准确率、推理可解释性,是综合改进方案,但有算力等局限。
Windows 10 停服引发全球热议,国产OS迎来窗口期?专家:技术迭代是残酷的,也是必然过程
微软宣布 2025 年 10 月 14 日停掉 Windows 10 免费更新与技术支持。这引发全球热议,也让国产 OS 迎来发展思考。专家认为这会加速生态多样、重塑产业价值链,同时分析了国产系统机遇、挑战和发展路径。
剑桥揭开大模型翻车黑箱!别再怪它不懂推理,是行动出错了
剑桥大学等机构研究指出,大模型执行长时任务易翻车,问题不在推理而在执行能力。研究人员评估多个指标,发现单步准确率提升可让任务长度指数增长,还研究了自条件化等影响及模型规模的作用。
登上NeurIPS,Genesis开创无需OCC引导的多模态生成新范式,在视频与激光雷达指标上达到SOTA水平
华中科技大学与小米汽车提出多模态图像 - 点云联合生成框架Genesis,采用两阶段架构和DataCrafter模块。在nuScenes数据集实验显示,其在视频与激光雷达指标达SOTA水平,还提升了下游感知任务效果。