「长视频编辑」共找到 1693 篇相关文章
LLM近期重大架构进化一览:从Gemma 4到DeepSeek V4
近期大模型长上下文需求增长,成本问题凸显。Google Gemma 4、Poolside Laguna XS.2、Zyphra ZAYA1 - 8B、DeepSeek V4 等模型各有架构优化,如 Gemma 4 跨层 KV 共享和 PLE,以降低长上下文推理成本。
离谱!一句话+百元预算,这只龙虾就给我搓出了一支百万级广告片?
广告片创作成本高、耗时长,生数科技的Vidu Claw能一句话完成创意到成片全流程,同步发布的Video Plan将成本可控化。实测它能胜任多种广告场景,还把工期从N天压缩到1天。
The Batch: 951 |让助手始终保持“帮助状态”
通常大语言模型被训练成有帮助、无害、诚实的助手,但长时或激烈对话中会有不理想特征。研究人员提出稳定 LLM 助手人格的方法,定义 assistant axis 纠正偏离,测试显示该方法有效且不降低模型表现。
Claude Opus 4.7连夜突袭:或将抢走全球7亿打工人饭碗!
Anthropic正式发布Claude Opus 4.7,定义为当前可广泛使用的最强Claude模型。其核心升级在复杂任务执行、高清视觉理解和长链路工作流,视觉能力大幅提升,在多方面超越对手,普通用户使用有三大变化。
目标更重要?国内公司超越Generalist,进化到动作中心世界模型
具身智能圈被Generalist CEO长文刷屏,其称目标比工具标签重要。但国内极佳世界未停于概念争辩,开源“以动作为中心的世界模型”GigaWorld - Policy,重构具身智能底层逻辑,在多方面表现出色。
全球首个龙虾模型 GLM-5-Turbo 发布:已经在用它帮我省几千块钱了
作者作为公众号编辑,排版耗时久费钱。他测试多款模型驱动龙虾排版均失败,换上智谱 GLM - 5 - Turbo 后成功,还能让其操作飞书润稿。该模型工具调用稳定,虽 API 涨价但性价比高,未来潜力大。
复旦等推出「第一人称视听基准」,补齐多模态模型「听觉拼图」
多模态大模型在真实世界会“失聪”,现有第一人称视频问答/理解基准长期偏“视觉中心”。复旦等团队推出首个系统评测第一人称声音理解能力的基准EgoSound,能让模型听懂世界,评测显示当前模型与人类差距大。
豆包大模型 Seed 2.0,有点不一样
大模型升级频繁令人审美疲劳,但豆包大模型Seed 2.0不同,其核心是Skills调用能力。作者测试了它做的小红书长图文排版生成器和古文翻译器,还体验了APP“专家模式”,展现多模态理解优势。
清华新框架让大模型学会「精读略读」!实现12倍端到端加速,基准评分翻倍
清华等团队提出全新框架RAM,受人类阅读认知启发,将“精读+略读”混合策略引入上下文压缩,突破现有方法效率瓶颈,在多任务上表现出色,实现12倍端到端加速,为长上下文LLM部署提供新范式。
Qwen-Image-2.0: 字字清晰,张张细腻
阿里云推出Qwen-Image-2.0图像生成基础模型,具专业文字渲染、细腻真实质感等特色。在AI Arena盲测中表现优越,能精准生成复杂内容,文字渲染有准、多、美、真、齐特点,图像编辑能力也得到增强。