多主体视频生成」共找到 2698 篇相关文章

7

担心被曝“于谦门”,57岁的于谦到底用龙虾做了什么?

于谦视频播客《多新鲜呐》最新一期,本质是“AI产品用户体验公开测试”。于谦作为测试员,关注点在结果、省事、风险等,节目把技术叙事换成生活叙事,帮AI面向大众转译。

量子位
新闻资讯8

谷歌AGI底座降临!首个原生全模态嵌入模型上线,已实现全模态SOTA

谷歌发布首个原生全模态 Embedding 模型 Gemini Embedding 2,将文本、图、音视频及 PDF 融于统一向量空间,实现跨模态检索,降低架构成本,赋予 AI 连贯「记忆」,是重塑 AI 基建的里程碑。

新智元
新闻资讯7

刚刚,GPT-5.4核心内幕炸裂剧透!或拥有永久记忆,极限推理狂飙

多方消息显示GPT - 5.4已开启测试,多次意外曝光。它或有极限推理模式、翻倍上下文、长任务表现佳,甚至可能拥有永久记忆。OpenAI因对手紧逼,模型更新接近月更。

新智元
新闻资讯8

OpenAI史上最快模型降临,每秒1000Token!代码从此「炸出来」

OpenAI发布GPT-5.3-Codex-Spark,它是专为实时编程设计的超高速模型,生成速度超每秒1000个token,联手Cerebras硬件,重写底座提升性能,在多项测试表现强,ChatGPT Pro用户可尝鲜。

新智元
开源动态7

Hugging Face 发布 FineTranslations:一个万亿级的多语言平行文本数据集

Hugging Face 发布 FineTranslations,这是含超 1 万亿 Token 的多语言数据集,用于提升机器翻译质量。它源于 FineWeb2,用 Gemma3 27B 翻译创建,数据生成流程可复现公开,还能用在其他任务。

InfoQ
新闻资讯7

谷歌、Anthropic双重围剿下的OpenAI,正面临「生死抉择」

进入2026年,OpenAI将部分重心转向企业级市场,CEO奥特曼召集企业高管聚会,传达服务企业用户意向,还将推新方案助企业AI转型。其发力企业市场,是因流量被谷歌等竞品追赶,似走到转型十字路口。

机器之心
开源动态7

15.1k,谷歌Notebook LM本地开源替代!

Open Notebook是开源、本地化且重隐私的Google Notebook LM替代方案。它支持超16家供应商,能整理多模态内容、生成专业播客,在多方面比Google Notebook LM更具优势。

PaperAgent
算法论文8

让扩散模型「可解释」不再降质,开启图片编辑新思路

过去三年扩散模型席卷图像生成领域,但可解释性研究是‘黑箱’,且现有尝试常致性能下降。香港中文大学与上海人工智能实验室团队提出TIDE框架,可解释且不降质,还带来新图像编辑方式。

机器之心
新闻资讯8

Anthropic重磅新研究:当AI采访了1250人,它看见了人类的「职业软肋」

Anthropic推出Interviewer工具,与1250名职场人、创作者、科学家深度对话,记录细节并量化。该工具能自动完成访谈、分析等流程,受访者满意度超97%。研究揭示不同职业对AI态度受职业结构等因素影响。

新智元
产品应用8

完爆ChatGPT!谷歌这招太狠:连你的「阴阳怪气」都能神还原

谷歌发布Gemini 2.5 Flash原生音频模型,可保留语调进行实时语音翻译,实现拟人化交互。还具持续监听、风格迁移等功能,提升开发者所需的函数调用、指令遵循等能力,另有实验产品Disco。

新智元