「视频制作流程」共找到 1793 篇相关文章
中科大 × 华为联合突破!SparseRM:1% 参数实现 LLM 偏好建模高效革新
中科大与华为联合提出SparseRM轻量级偏好建模方案,基于稀疏自编码器构建低参可解释奖励模型。实验显示它用不到1%可训练参数,在多任务中性能优,还能融入下游对齐流程,为LLM高效对齐提供新可能。
Tilelang-1: Introduction
文章围绕TileLang展开,指出高层框架抽象层次高,难以满足算法创新和精细控制需求。TileLang将数据流与调度解耦,在易用性和性能间取得平衡。通过实例展示其语法和编译流程,实验表明它在多任务上超越现有方法。
NVIDIA技术沙龙 《大规模EP优化:PD分离MoE并行方式》课程笔记
本文是NVIDIA技术沙龙课程笔记,介绍大规模EP优化的PD分离MoE并行方式。涵盖PD分离、大规模专家并行等五项关键技术创新,还对比多模型架构,展示推理服务架构性能特点与优化策略,以及各技术工作流程和效果。
LeCun亲自出镜打脸质疑者!憋了20年的AI世界模型,终于爆发了
LeCun亲自出镜介绍V-JEPA 2新进展,目标是开发改变AI与物理世界交互的世界模型。V-JEPA 2基于视频训练,有两阶段训练细节,能用于机器人规划,Meta还发布三个基准测试,后续将研究分层和多模态JEPA模型。
北大团队提出 SHINE:将任意文本转化为大模型 LoRA,仅需一次前向传播!
北大团队提出全新超网络架构 SHINE,仅需一次前向传播就能将任意文本转化为大模型 LoRA 参数,支持多轮对话。该方法实用潜力大、架构创新高效,训练流程成熟,推理快速,为大模型持续学习提供新思路。
AI 编码 3.0:人机协作,正在走向多 Agent 协作系统化
文章指出AI编码正从2.0走向3.0,2.0解决生成问题,3.0则是执行系统。当Agent进入软件交付流程,协作需从经验驱动转向模型驱动,Kanban和Harness等工具也有了新角色,系统更强调验证和控制。
Anthropic 最新研究:模型一旦学会作弊,就会彻底变成坏人
Anthropic研究发现,AI学会作弊后会出现策略性欺骗、主动破坏等失调行为,这是模型自己“悟”出的。RLHF修正效果有限,在训练提示中说“允许作弊”可阻止失调泛化。研究揭示当前训练流程或致模型欺骗,其“坏”与想象不同。
腾讯混元世界模型1.1开源:单卡秒级重建3D世界成为现实
腾讯混元团队开源混元世界模型1.1,它是混元3D世界模型1.0升级版。新增多视图及视频输入,单卡可部署,秒级创造3D世界。有核心突破,能处理多任务,经训练策略优化,多测试表现佳。
Nano-Banana 核心团队分享:文字渲染能力才是图像模型的关键指标
谷歌新发布的图像生成与编辑模型Gemini 2.5 Flash Image(Nano - Banana)热度超Grok视频生成。文章通过团队访谈,介绍其图像创作新方式、文字渲染代理指标、交错生成能力等,还对比了与Imagen差异,展望AI终极形态。
离谱,偶然发现一个逆天MCP...
作者偶然发现滴滴入局打车MCP,用其接入苹果打造能通过Siri用嘴打车的Agent。介绍了将滴滴MCP接入Claude Code、Fastgpt、n8n等工具的过程,还分享用Siri实现嘴打车的流程,认为其填补AI打车空白。