实时生成技术」共找到 4824 篇相关文章

开源动态8

500万视频数据集+全新评测框架!北大开源主体一致性视频生成领域新基建OpenS2V-Nexus,生成视频 「像」 又 「自然」

北大团队推出开源套件OpenS2V - Nexus,含全球首个S2V细粒度评测基准OpenS2V - Eval和500万条高质量人物文本视频三元组数据集OpenS2V - 5M,还评测18个S2V模型,揭示主流模型能力差距。

机器之心
算法论文8

演讲生成黑科技,PresentAgent从文本到演讲视频

联合团队提出 PresentAgent,能将长篇文档转化为带解说演示视频。采用模块化流程,还引入 PresentEval 评估框架。实验显示其接近人类表现,优于现有方案,展现了多模态智能体潜力。

机器之心
推荐文章8

一篇200+文献的视觉强化学习技术最新综述

NUS、浙江大学和香港中文大学对强化学习与视觉智能交叉领域进行系统梳理,归纳200余篇工作为四大主题支柱,剖析算法等进展,提炼关键趋势,还介绍LLM的RL方法、视觉RL阵地等。

PaperAgent
新闻资讯7

震撼!人类第一张在太空生成的图片曝光

人类首张太空生成图片曝光,共绩科技与星测未来两家清华系企业携手开启「天地同算」时代。前者解决算力调度难题,后者让太空有算力可用,未来太空或成分布式超级计算机。

新智元
算法论文8

大模型幻觉检测新方法:实时高亮不确定内容

来自苏黎世联邦理工学院等机构团队,开发流式幻觉检测器,能在生成过程中即时标记幻觉实体。核心是识别具体“实体”是否虚构,实验表现出色,团队已将数据集和代码开源,有局限但应用前景好。

AI工程化
产品应用8

LLM 技术在有道词典笔上的应用实践

本文围绕LLM技术在有道词典笔的应用展开。先分析端侧大模型落地挑战,如算力、功耗等。介绍有道词典笔等硬件及应用,对比端侧与云侧AI优劣。还阐述模型落地模式、算法优化及“子曰3数学模型”开源情况。

InfoQ
推荐文章8

一文读懂 Deep Research:竞争核心、技术难题与演进方向

文章梳理了深度研究系统,包括其发展历程、现有系统差异、技术实现挑战、评估体系及推理架构演进方向。指出竞争焦点转向综合比拼,评估走向专业化,未来系统将在多方面突破。

Founder Park
算法论文8

为什么 LLM 搞不定复杂任务?ReAct 与 Reflexion 技术综述

文章指出大语言模型处理复杂任务存在事实幻觉、缺乏实时信息等问题。介绍ReAct将推理和行动结合,及Reflexion在其基础上添加评估反思机制,探讨两者结合优势,还提及未来发展方向。

阿里云开发者
推荐文章7

微前端:迈向现代化前端架构的社会技术之旅

文章指出微前端不仅是技术模式,更是组织工作新范式。介绍其适用场景、演进现有系统方法,处理路由等跨领域问题策略,还强调它能让前端独立于后端现代化,实现渐进式变革。

InfoQ
推荐文章8

技术教科书:顶级开发团队设计的Harness工程项目源码什么样

本文深入剖析某顶级AI Agent研究团队的工业级Harness项目源码,涵盖项目全景、启动流程、工具系统等多方面,提炼构建顶级Harness工程方法论,还介绍隐藏彩蛋,展示团队技术实力与独特魅力。

腾讯技术工程