音视频生成模型」共找到 8958 篇相关文章

算法论文8

RAG外部检索是多余的,英伟达最新成果颠覆认知

英伟达INTRA论文指出RAG架构中检索器和生成器在不同表示空间工作,存在retriever - generator mismatch问题。INTRA让模型用注意力查询检索自身编码表示,训练量小,在多跳QA上超越多种检索基线。

PaperAgent
开源动态8

开源 VibeSDK:把一句话变成线上应用,用它一键搭好自己的 AI平台

Cloudflare VibeSDK 是开源 AI vibe coding 平台,跑在 Cloudflare 开发者生态上,支持自然语言生成全栈 Web 应用,有分阶段代码生成、交互式聊天等功能,适用于多类人群和场景,还对比了同类项目。

小华同学ai
开源动态8

谷歌AI Agent刚开源!多任务智能体+MCP+谷歌搜索,狂揽9000颗星

今天凌晨,谷歌在官网开源AI Agent框架Gemini CLI,将Gemini大模型融入终端。它能调用视频和图像模型,集成MCP、谷歌搜索等功能,还集成超强编码助手,刚开源就在Github超9000颗星。

AIGC开放社区
算法论文8

ICML 2026获奖论文揭晓:黄高团队获杰出论文,A3C算法获时间检验奖

ICML 2026公布最佳论文奖项,共10篇获奖,涵盖杰出论文奖、杰出立场论文奖等。此次评选严格,经多轮筛选。获奖论文涉及扩散式大语言模型、扩散模型采样算法等多个领域。

机器之心
产品应用8

通用级PixVerse P1的技术突破,揣着进入平行世界的密码

PixVerse R1 突然上线,带来「即时响应、即看即创」新体验。它是全球首个支持最高 1080P 分辨率通用实时世界模型,实现从「静态输出」到「实时交互」跨越,本文将解析其技术突破。

机器之心
算法论文7

一段 signature,不仅撬开了 Opus 的隐藏推理,还让 Kimi、GLM 露出了"熟悉感"

研究者发现,将 Opus 等强模型返回的加密推理块交给同家族弱模型,弱模型可能转写出隐藏内容。如用 Haiku 读取 Opus 的加密信息。此外,公开的 Agent 轨迹存在隐私泄露风险,部分开源模型易受 Opus 风格影响。

深度学习自然语言处理
新闻资讯7

xAI落后太多,马斯克“开大”重金求购Cursor,100亿美金“分手费”都敢签!

SpaceX宣布协议,或600亿美元收购代码生成初创公司Cursor,也可能支付100亿美元合作费。xAI代码生成能力落后,此次交易为其带来更强市场立足点,也助Cursor解决算力瓶颈。

AI前线
新闻资讯8

OpenAI总裁透露GPT-5改了推理范式,AGI实现要靠现实反馈

OpenAI总裁Greg Brockman在访谈中透露AGI之路,包括技术上转向强化学习推理范式,资源上持续投入计算资源,落地时封装成Agent。还提到GPT - 5改变推理范式,强调计算对AGI的重要性及模型落地等内容。

量子位
新闻资讯8

画质重生,第一!腾讯TEG香农实验室斩获CVPR 2025 UGC Video Enhancement 冠军

CVPR NTIRE是计算机图像恢复与增强领域有影响力的赛事。在NTIRE 2025 UGC Video Enhancement中,腾讯TEG香农实验室团队自研算法夺冠,成果落地提升视频清晰度。团队还参加实时赛道获佳绩,且做了硬件推理优化。

腾讯技术工程
开源动态9

Qwen-Image-2.1开源:轻量高能,创作编辑一体化

通义千问团队正式开源Qwen-Image-2.1图像模型,该模型为7B轻量参数,整合文生图与图像编辑能力,原生支持透明图像生成编辑,做了多方面能力升级,开放多平台供开发者体验。

千问大模型