可交互音视频」共找到 5029 篇相关文章

开源动态8

Anthropic祭出大模型“读脑”杀手锏:LLM决策过程全给你扒开看

Anthropic宣布开源电路追踪工具,追踪LLM神经元,通过生成“归因图谱”揭示模型输出原因。开源了生成图谱的库和交互式前端,并提供demo notebook。追踪电路、视化图谱、检验假设。

AI寒武纪
开源动态8

终于找到一个开源神器!用画布喂给 Claude Code,上下文再也不用打字说了!

开发者用文字向 AI 说明需求繁琐,思路易跑偏。BonsAI 是 macOS 原生应用,提供无限画布,让 Agent 实时读取改写。它亮点多,还有连接器功能,能成编程工具‘前置处理器’。

开源星探
算法论文8

GAIR Paper 107|高校联合腾讯发布 GameCraft-Bench:AI已能端到端开发游戏,Claude Opus 四成达到玩水平

香港中文大学(深圳)等高校联合腾讯发布 GameCraft-Bench,旨在构建基于真实游戏引擎、产物完整运行且能验证的 AI 游戏生成评测基准,解决现有基准难衡量端到端玩性的问题,测试显示前沿模型在游戏生成上仍薄弱。

AI科技评论
开源动态8

重磅!Meta开源通用神经输入系统!人人用的非侵入式手环登场

Meta开源通用神经输入系统,用基于手腕的输入技术结合上下文感知AI带来新交互体验。关键技术EMG读取大脑电信号,将其转成数字命令,系统表现优秀,为“隐形”人机交互奠基。

带你学AI
产品应用8

NVIDIA 推出Rubin CPX,专为AI推理设计的GPU

NVIDIA发布专为大规模上下文AI推理设计的Rubin CPX GPU,性能提升显著,集成视频编解码器和长文本推理处理。新平台算力强,适用于代码生成与视频处理,多家公司将采用,2026年底上市。

AI工程化
算法论文8

真实场景也能批量造「险」!VLM+扩散模型打造真实域自动驾驶极限测试

浙江大学与哈工大(深圳)联合推出SafeMVDrive,将VLM关键车辆选择器与两阶段轨迹生成结合,在真实域批量制造高保真安全关键视频,用于端到端自动驾驶系统安全性测试。

新智元
产品应用8

Sora 2瑟瑟发抖!通义万相2.5放大招:一句话出1080P电影,音画精准同步

云栖大会上通义万相2.5系列模型亮相,包含四大模型,视频生成模型实现音画同步突破,降低电影级视频创作门槛。它创作能力全方位升级,支持多种模态输入,采用原生多模态架构。

新智元
新闻资讯7

GPT-6 Astra:欢迎来到 AGI 时代。

OpenAI 发布 GPT - 6 Astra,总裁称开启 AGI 时代。演示视频展示其强大并行处理能力,跑分有争议,成绩不一。它有诸多成果和安全表现,也有监控性降低问题,发布过程却状况百出。

AGI Hunt
新闻资讯8

刚刚,OpenAI Sora 2重磅登场!首个APP上线,或将成为AI时代新TikTok

凌晨1点,OpenAI推出Sora 2,AI视频迎来「GPT - 3.5时刻」。它物理智能提升、实现音画同步,人物一致性等刷新SOTA。Sora App上线或重塑短视频交互与社区互动,还在安全治理上布下多层防线。

新智元
开源动态8

NeurIPS 2025 | 面向具身场景的生成式渲染器TC-Light来了,代码已开源

TC-Light 是中科院自动化所张兆翔教授团队研发的生成式渲染器,能对长视频序列重渲染,减少 Sim2Real Gap 及实现数据增强。它克服了时序一致性和计算开销挑战,性能优于现有技术,论文与代码已开源。

机器之心