长内容合成」共找到 1616 篇相关文章

推荐文章7

AI 创业者的反思:那些被忽略的「快」与「

周喆吾分享在 3D AR 社交平台 Presence 的创业反思,强调 AI 创业中‘快’和‘ context’的重要性,还举例说明 AI 对白领工作的影响、Workflow Capture 做法等,指出产品经理和投资人应提升对模型的认知。

Founder Park
产品应用7

精准复刻!字节推出X-UniMotion实现高精度动作模仿合成

字节推出的X-UniMotion代表角色动画技术突破,提供统一运动控制系统,融合先进算法与操作界面,构建强大技术架构,能生成自然流畅角色动作,还介绍了其技术原理、演示对比等内容

带你学AI
新闻资讯7

MiniMax 技术闭门会分享:上下文是 Agent 的 Game Changer

MiniMax 7月10日举办M1技术研讨会,探讨模型架构创新等领域。会议围绕RL能否赋予模型新能力、预训练价值等展开,指出上下文是Agent的Game changer,混合架构将成主流,还分享了混合架构推理实践及M1相关问答。

Founder Park
推荐文章8

LlamaIndex 深度实战:用《安的荔枝》学会构建智能问答系统

文章兼顾 RAG 科普与 LlamaIndex 实战。介绍 RAG 原理,用《安的荔枝》讲解关键步骤和参数。实战部分展示用 LlamaIndex 搭建问答系统,代码量少。优化篇通过实验给出参数调优建议,架构篇剖析内部机制,最后提及 Agent 化拓展功能。

阿里云开发者
算法论文7

基于Memory Bank的Cursor会话记忆内存库理论研究与实践

文章围绕Memory Bank展开,介绍其为解决大模型会话记忆瓶颈而设计的机制,包括存储、检索、更新模块。阐述其在编程和知识库建设的应用,还评测了Codelf等工具,指出Memory Bank是AI迈向智能的重要一步。

阿里云开发者
产品应用8

B站发布最强零样本TTS,IndexTTS2情感可控、时精准

在大规模TTS系统中,自回归模型难精准控制语音时。Bilibili推出IndexTTS2,支持两种生成模式,实现情感表达与音色解耦,引入GPT潜在表示,设计‘软指令’机制,降低情绪控制门槛。

带你学AI
算法论文7

DeepSeek-OCR是「文本理解」未来方向?中科院新基准VTCBench给出答案

DeepSeek - OCR的VTC技术可实现高压缩率,降低文本处理成本。但视觉语言模型能否理解压缩信息存疑,中科院等推出VTCBench评估,测试模型认知极限,还推出VTCBench - Wild检测鲁棒性。

机器之心
产品应用8

Claude Opus 4.7发布:更严谨的任务处理与自我验证能力

Anthropic发布Claude Opus 4.7模型,相比4.6版处理任务更严谨,能自我验证输出。它在视觉、指令遵循、记忆等能力上提升,企业级应用表现出色,还有新功能与安全特性,不过使用成本更高。

AI工程化
算法论文8

内存直降50%,token需求少56%!用视觉方式处理文本

在NeurIPS 2025论文中,南京理工大学等校研究团队提出VIST框架,为大语言模型文本高效推理提供视觉解决方案。它模仿人类阅读机制,让模型具备选择性阅读能力,减少Token需求和内存使用。

新智元
算法论文8

多模态后训练反常识:思维链SFT和RL的协同困境

华为与香港科大研究发现,多模态视觉语言模型中,思维链SFT与RL组合难协同增益。研究引入难度分类方法构建数据集,分析各方法表现及组合策略困境,还给出实验发现与未来研究方向。

机器之心