长内容合成」共找到 1619 篇相关文章

算法论文8

打破资源瓶颈!华南理工&北航等推出SEA框架:低资源下实现超强多模态安全对齐

本文介绍北航彭浩团队的 SEA 框架,针对多模态大模型低资源安全对齐难题,用合成嵌入替代真实数据,突破资源瓶颈。还构建 VA - SafetyBench 评估安全风险,实验验证了 SEA 低资源、高泛化优势。

AI前线
新闻资讯8

今天起,GPT Image 2要把全体设计师送走了

GPT Image 2横空出世,暴打Nano Banana 2,其超强文字渲染和设计能力颠覆众多行业。它生成的图片真假难辨,解决文字渲染难题,降低数字内容生成成本,让设计师面临失业危机,也使互联网信任体系洗牌。

新智元
算法论文8

ICLR 2026 | OpenAI打广告后,如何成为爆款?CMU提出AutoGEO解密流量密码

AI搜索引擎渐成主流,OpenAI引入商业推荐后,内容在AI搜索成爆款取决于AI引用偏好。CMU团队在ICLR 2026论文中提出AutoGEO,抽取引擎偏好规则改写网页,实验证明其有效且兼顾引擎效用。

机器之心
产品应用8

阿里又上好货了!Qwen3-TTS能力大幅提升

阿里刚发布Qwen3-TTS(2025-11-27版),解决语音合成核心问题。它音色大幅扩展,有49种高品质音色;语言和方言能力提升,支持10种主流语言与多种方言;韵律和语速优化,拟人化近真人;API调用简单。

AI工程化
开源动态8

白嫖微软开源Web Agent,独立开发者的第二双手:自动刷网页、跑脚本、盯进度,全交给 Magentic-UI

Magentic-UI是微软开源的Web Agent界面,能控制浏览器、执行代码等,解决流程、重复且让人不放心全交给AI的任务。它可视化操作,有可复用计划图库等亮点,使用体验好,适合特定开发者。

小华同学ai
开源动态8

告别「面瘫」配音,InfiniteTalk开启从口型同步到全身表达新范式

传统video dubbing技术有局限,新兴模型也有问题。美团视觉智能部研发的InfiniteTalk引入‘稀疏帧video dubbing’,实现口型、表情、肢体与音频自然对齐,解决视频生成难题,技术已开源。

机器之心
推荐文章7

Self-Evolving Agents,AI的“自我革命”

LLMs静态性成应用瓶颈,自演化智能体成破局关键。本次分享的综述围绕演化什么、何时演化、如何演化三个核心问题展开,介绍了模型、记忆等方面的演化内容、时机和方式。

CourseAI
开源动态8

通义实验室大火的 WebAgent 续作:全开源模型方案超过GPT4.1 , 收获开源SOTA

WebAgent续作《WebShaper: Agentically Data Synthesizing via Information-Seeking Formalization》提出对information-seeking任务形式化建模,设计训练数据合成方法,全开源模型方案在GAIA评测获SOTA表现,还补足了训练数据不足问题。

机器之心
算法论文8

Transformer祖传设计遭暴击,COLM顶会三篇论文发难

COLM 2026上,三篇论文对Transformer关键技术发难。《Cracks in the Foundation》指出上下文架构选择影响大;《Lost in Backpropagation》揭示输出投影层信息损耗严重;《When Fewer Layers Break More Chains》表明层剪枝影响链推理。

量子位
产品应用8

设计行业天塌了!Anthropic再推王炸产品Claude Design:设计稿、原型、PPT一句话搞定

Anthropic推出平台级产品Claude Design,用Claude Opus 4.7模型助力设计。它能让各类用户完成视觉内容创作,有多种使用场景和便捷工作流程,还给出内部设计师使用建议。

AI寒武纪