「字幕生成」共找到 2222 篇相关文章
CoT 之后,CoF 如何让帧间逻辑从「隐式对齐」变成「显式思考」?
CoT 虽提升语言模型推理能力,但在 C 端场景有局限,且被质疑并非真实推理。视觉领域提出 CoF 概念,Google DeepMind 团队引入理论,让视频模型通过帧链推理提升帧间一致性,还具强大泛化能力。
Sora2“复活”已故名人,家属强烈反对
Sora 2走红后肖像权问题成焦点,有人用其“复活”迈克尔·杰克逊、罗宾·威廉姆斯等已故名人。罗宾女儿等家属强烈不满,OpenAI称公众人物及其家属应控制形象使用,美影协要求其解决侵权问题。
知名机器人专家喊话:投人形机器人初创公司的数十亿美元,正在打水漂
知名机器人专家罗德尼・布鲁克斯质疑特斯拉、Figure等公司技术路线,称让机器人看人类视频学操作是‘空想’。他指出触觉数据无技术积累、安全有隐患,预测成功‘人形’机器人未来将大不同,投资难量产。
亚马逊“盲眼”机器人30秒跑酷首秀惊艳!华人学者领衔
亚马逊机器人团队FAR发布人形机器人研究成果OmniRetarget,它能让强化学习策略在复杂环境学技能并零样本迁移。该成果通过交互网格建模关系,经实验验证优势明显,背后团队由华人学者领衔。
胖东来式“爆改”后,一位制造业老板选择上AI | 甲子光年
捷配CEO周邦兵参加胖东来总裁班后,用其理念“爆改”企业,同时推进AI转型。他决心招募AI人才,重构PCB生产链路。9月23日,捷配发布“JetPave AI”,可降低硬件创新门槛,让创意更快落地。
腾讯开源混元Image 2.1:2K高清+完美文字嵌入,图文天花板来了
今天凌晨,腾讯开源最新图像模型混元Image 2.1,支持原生2K分辨率与长提示词,文字嵌入能力强,适用于专业场景。还开源加速版模型权重和提示词改写模型,评估显示其性能达开源最优,接近闭源商业模型。
挑战Claude4的8B Agent!NUS提出AgenTracer:面向多智能体系统的失败归因
随着大语言模型发展,多智能体系统潜力大但有系统脆弱性问题。NUS研究者在论文中提出AgenTracer框架,构建标注管线,设计AgenTracer - 8B模型,在失败归因任务上超大型闭源模型,还能助力系统自我提升。
刚刚!谷歌推出Nano Banana官方终极指南:六条保姆级权威提示教程,拿走不谢
谷歌推出Nano Banana(即Gemini 2.5 Flash Image图像模型)官方使用指南,含六条提示词模板及示例,介绍文生图等核心功能,还教你编写有效提示词发挥其潜力。
AI不会重写所有传统软件,但在重构产品逻辑!2025全球产品经理大会圆满收官
2025全球产品经理大会8月15 - 16日举办,超40位专家与近千名产品经理探讨AI产品构建。一线企业代表分享全链路经验,涉及十余个核心议题。还成立奇点智能研究院,各分论坛展示AI产品创新多维度亮点。
腾讯张正友:具身智能必须回答的三个「真问题」
7月27日,腾讯发布具身智能开放平台Tairos。发布会后,腾讯张正友剖析战略选择背后的三个核心问题:架构上主张分层架构;认为具身智能第一性原理是身脑融合;强调要为长远目标放弃短期商业利益。