实时长视频」共找到 1778 篇相关文章

算法论文8

ICML 2025 | 清华、上海AI Lab等提出傅里叶位置编码,多项任务远超RoPE

文本能力对语言模型重要,但现有模型训练窗有限,流行的RoPE也有局限。清华、上海AI Lab团队用傅里叶分析解读其不足,提出傅里叶位置编码FoPE,提升文本泛化能力,实验表现超RoPE。

机器之心
新闻资讯8

Runway深夜炸场:一口气发布5大更新,首个通用世界模型来了

主攻AI视频与多媒体生成技术的独角兽Runway发布5大更新,包括旗舰视频生成模型Gen - 4.5、首个通用世界模型GWM - 1等,展示了其在通用世界模型上的野心,刷新了视频生成指标。

机器之心
开源动态7

Wan2.2-Animate又火了,5分钟让抠脚大汉秒变高冷女神。

阿里开源模型Wan2.2 Animate又火了,用照片和视频就能生成换脸视频,表情动作复刻佳。它上限高,还能变声,可用于舞蹈视频、影视二创等,但手指易崩坏。模型开源,有积极意义也有风险。

数字生命卡兹克
产品应用8

谷歌Veo 3.1更新:更一致性、更具创造力和控制力

谷歌Veo 3.1发布更新,实现角色、背景与物体在动态场景中的高度一致性,支持基于参考图片创建视频、原生竖屏模式及1080p和4K分辨率升频,精准控制素材,提升创作体验。

AIGC开放社区
算法论文8

一篇双引擎进化的程Agents系统性综述

人大、北大、清华等联合发表149页时程Agent综述,给出首个统一形式化定义,梳理出‘外化Harness工程×内化模型优化’双螺旋共演化主线,用六个视角串起技术版图。

PaperAgent
新闻资讯7

OpenAI主攻速度的第一个模型来了:GPT‑5.3‑Codex‑Spark

OpenAI发布GPT-5.3-Codex-Spark,是GPT-5.3-Codex轻量级版本,也是首个为实时编程设计的模型。亮点是速度快,推理超每秒1000 token,已向ChatGPT Pro用户开放,后续规划融合两种工作模式。

AI寒武纪
开源动态8

终于找到一个开源神器!用画布喂给 Claude Code,上下文再也不用打字说了!

开发者用文字向 AI 说明需求繁琐,思路易跑偏。BonsAI 是 macOS 原生应用,提供无限画布,可让 Agent 实时读取改写。它亮点多,还有连接器功能,能成编程工具‘前置处理器’。

开源星探
新闻资讯8

英伟达让机器人「做梦学习」,靠梦境实现真·从0泛化

英伟达推出DreamGen项目,让机器人‘做梦学习’。它利用视频世界模型生成神经轨迹,仅少量现实视频就能让机器人学会新任务,实现从0泛化,还将助力GR00T - Dreams发展。

量子位
新闻资讯7

扒一扒Meta全新大模型Muse Spark里藏着的PDR技术

Meta发布闭源大模型Muse Spark及‘沉思模式’,背后藏PDR推理技术。该技术通过‘并行起草+精炼’突破性能瓶颈,对比传统CoT范式优势明显,在AIME竞赛题目测试中准确率显著提升。

PaperAgent
产品应用7

震撼好莱坞,一天AI生成10部短片,Google神器比肩一个影视工作室

Google的AI视频神器Veo 3刷屏,使用门槛低,生成效率高,效果震撼。它能生成二次元、科幻、仙侠等多种类型短片,虽有不足,但极大促进AI视频发展,适合多行业基层人员。

鲸选AI