「长视频编辑」共找到 1693 篇相关文章
红杉对话 LangChain 创始人:2026 年 AI 告别对话框,步入 Long-Horizon Agents 元年
红杉访谈 LangChain 创始人 Harrison Chase,探讨 Long-Horizon Agents。其认为 2026 年是 Doers 元年,这类 Agent 能处理长时程任务。还提及 Harness 架构、Coding Agent 等,指出 Memory 是壁垒,交互需同步与异步结合。
LightX2V fp4 quant kernel代码笔记
这是关于 LightX2V 里 `lightx2v_kernel` 做 FP4 量化 GEMM 的读码笔记,解释接口和约束、kernel 关键路径等问题,还介绍 NVFP4 和 MX-Formats 量化原理、代码实现,以及 LightX2V 项目中的实际使用。
当AI穿上白大褂:医疗智能体正在重构临床工作流
新加坡等多所高校联合发表医疗智能体综述研究。医疗智能体有感知 - 认知 - 行动闭环,能深入临床长链条工作流。综述剖析其架构、协同机制、应用场景与安全挑战,还探讨评估及发展方向。
MIT这篇RLM论文,给出了Scaling的另一种可能~
当大家普遍认为解决长上下文问题要靠扩大模型上下文窗口时,MIT 最新的 RLM 论文提出新路径。其 code 已开源,能实现无界上下文处理,可让任意大语言模型处理 10 万 +token。
Meta发布Omnilingual ASR:支持1600+语言的开源语音识别系统
Meta发布全新自动语音识别系统Omnilingual ASR,支持超1600种语言,核心创新是零样本和少样本学习能力,降低小语种语音识别门槛。项目提供不同规模模型,安装调用简单,目前仅支持40秒内音频,数据集和项目均开源。
用完这张无限可能的AI画布,第一次感觉人类导演要失业了!
2024年7月上线后迅速风靡海外的SkyReels发布最新版本,它重构AI创作生态,打通「图片—音频—视频」全栈,集成多种功能于一张画布,还推出专家智能体,让普通人轻松创作高质量内容。
国产开源LLM大爆发,Qwen、Minimax、美团、腾讯~
近期国产开源LLM大爆发,Qwen3-VL家族新增模型,有技术亮点且可免费商用;MiniMax-M2为编码和代理任务打造;美团LongCat-Video、LongCat-Audio-Codec各有专长;腾讯混元世界 - 镜像用于3D几何预测。
教多模态大模型学会“反思”和“复盘”,上交&上海AI Lab重磅发布MM-HELIX&AHPO,破解多模态复杂推理难题
上海交通大学和上海人工智能实验室研究团队带来MM - HELIX,这是完整生态体系,赋予AI长链反思性推理能力。其含基准测试、数据集、优化算法,搭载相关技术的模型表现优异,部分成果已开源。
深夜炸场!Claude Sonnet 4.5上线,自主编程30小时,网友实测:一次调用重构代码库,新增3000行代码却运行失败
Anthropic推出Claude Sonnet 4.5,号称‘世界上最好的编码模型’,持续运行时长、推理等能力提升,‘幻觉’等问题改进,Claude Code也有更新,开发者实测有惊喜也有问题,新一轮AI‘内卷’开启。
「从追赶者到引领者,路有多远?」 我们和CANN一线开发者聊了聊
AI浪潮下,硬件竞争转向软件等生态之战,华为昇腾及其CANN站在变革前沿。本文与开发者对话,探讨CANN开源意义、早期挑战、演进及未来战略,开源将带来技术透明、生态赋能等红利。