文档到演示视频生成」共找到 1371 篇相关文章

产品应用8

Claude 4.x 的提示工程实战指南

Anthropic在官方文档上线Claude 4.x提示工程指南,针对4.5系列模型优化。介绍基本原则、长期推理和状态跟踪方法、沟通风格,还给出特定场景指导及迁移考虑,助你发挥Claude 4.x实力。

AI工程化
产品应用8

万相2.6 X千问APP,功能价值和情绪价值兼具|甲子光年

12月16日阿里发布视频生成模型“万相2.6”,实现“角色扮演”功能突破。千问APP接入后上线“AI小剧场”,打破次元壁。千问兼具功能与情绪价值,阿里全栈布局助力其成“超级入口”。

甲子光年
产品应用8

Macaron 新版本拆解:三个信号,看懂 Personal AI 的进化路径

Macaron新版本技术视频技术浓度超预期,结尾藏产品更新彩蛋。此次更新社交功能、Daily Spark、记忆打通等背后,藏着Personal AI关键变化,其团队Mind Lab有技术突破,开源方案获高认可。

特工宇宙
算法论文8

天下苦VAE久矣:阿里高德提出像素空间生成模型训练范式, 彻底告别VAE依赖

当前主流图像生成技术训练范式依赖VAE,带来训练复杂、微调成本高的问题。阿里高德提出EPG,结合自监督预训练与端到端微调,去除对VAE依赖,在训练效率和生成效果上有突破。

量子位
开源动态8

最强开源0.9B级OCR模型!本地Agent、知识库都有救了!

百度飞桨PaddleOCR团队开源多模态文档解析模型PaddleOCR-VL,参数量仅0.9B,对算力要求低。它在OmniDocBench V1.5榜单屠榜,经测试,能精准识别发票、图表等,适合本地环境与资源受限设备。

开源星探
开源动态8

百度0.9B参数模型登顶全球第一,聊聊PaddleOCR-VL背后的技术细节

百度PaddleOCR-VL模型仅0.9B参数,在OmniDocBench V1.5榜单获92.6分全球第一,在多能力维度达业界最佳,能处理109种语言。其采用两阶段架构,结合优质训练数据,实现高性能与低内存、快速度的平衡。

AIGC开放社区
算法论文8

Meta「分割一切」3.0曝光!技能语义分割加入概念提示,好好玩,要爆了

Meta第三代“分割一切”模型SAM 3悄然投稿ICLR 2026。它支持基于概念提示的多实例分割,能听懂人话,处理图片快,还设计新架构、构建数据引擎、提出SA - Co基准,实验表现佳但也有局限。

量子位
开源动态8

Meta最新REFRAG框架引爆RAG圈!KV缓存暴降90%,速度狂飙30×

Meta推出REFRAG框架解决RAG难题。它能在不修改解码器参数下压缩上下文、复用文档向量等。实验显示,它降低KV缓存、加速TTFT,在多任务表现佳,为大模型与知识库结合提供新范式。

CourseAI
推荐文章7

对谈 Memories AI 创始人 Shawn: 给 AI 做一套“视觉海马体”|Best Minds

本文是对 Memories AI 创始人 Shawn 的访谈。他指出当下 AI 记忆多为“上下文工程”,其团队致力于打造视觉记忆层 LVMM。还探讨了视觉与文本记忆区别、LVMM 架构及应用场景等,认为视觉记忆将成下一代 AI 核心。

海外独角兽
开源动态8

16K星 Zep凭一张“动态记忆图”吊打一众Graph RAG

现有的RAG框架多依赖静态文档检索,无法满足企业对动态知识整合的需求。本次分享的Zep提供新型智能体记忆层服务,通过核心组件Graphiti动态整合数据,在LongMemEval基准测试中表现出色。

CourseAI