长内容合成」共找到 1616 篇相关文章

开源动态7

从文本到3D动画:AnimaX重新定义3D动作合成方式

北航与清华推出3D动画框架AnimaX,结合视频扩散模型运动先验与骨骼动画可控性,让任意骨架3D角色自然动起来。其核心方法灵活控制动作,虽有局限,但为3D动画创作打开新局面。

带你学AI
开源动态8

面向时语音与声音克隆的全模态开源万能聊天机器人MGM-Omni

文章介绍了全模态开源聊天机器人MGM - Omni,它基于MiniGemini,支持多模态输入输出,具备语音理解、生成、流式生成、零样本语音克隆等特性,还给出安装、使用方法,展示评估结果。

GitHubStore
算法论文8

与DeepSeek-OCR不谋而合,NeurIPS论文提出让LLM像人一样读文本

NeurIPS 2025 论文提出 VIST 框架,为大语言模型文本推理提供视觉方案,与 DeepSeek - OCR 理念不谋而合。它模仿人类阅读,有快 - 慢路径协作,在多任务表现优,还让模型‘用眼看文字’,优势明显。

机器之心
算法论文8

小红书RecSys 2025最佳论文提名背后:破解视频时预测难题

小红书推荐算法团队论文《Multi-Granularity Distribution Modeling for Video Watch Time Prediction via Exponential-Gaussian Mixture Network》在 RecSys 2025 获最佳论文提名。该文剖析视频时预测难题,提出 EGMN 模型,线下线上验证效果佳。

机器之心
算法论文8

ICCV 2025 | ECD:高质量合成图表数据集,提升开源MLLM图表理解能力

科研等领域图表是信息核心载体,先进开源MLLMs在高难度图表理解测试准确率低。本文提出ECD数据集,规模大、质量高、风格多样,还设计合成流水线与评测基准ECDBench,为开源MLLM提供支持。

机器之心
算法论文8

MIT发布自适应语言模型!新任务,自生成远超「GPT-4.1合成训练数据」

麻省理工学院提出自适应语言模型框架SEAL,让大模型生成微调数据和更新指令适应新任务。实验显示,其生成的合成数据微调效果超GPT - 4.1,在少样本学习和知识整合任务表现优异。

新智元
开源动态8

攻克结构化文档检索难题!新框架让模型告别“结构性失明”

SEAL团队推出全新对比学习框架SEAL,通过带结构感知和元素对齐,将文档宏观层级结构和微观元素语义融入Embedding空间,提升模型对结构化数据的理解。在BGE - M3模型上提升了MRR@10指标,还开源了万级字数文档数据集。

量子位
算法论文8

EMNLP 2026高分论文MathDebugger:当合成数据涌入训练集,如何为数学题做体检?

随着合成数据增多,模型需判断数学数据题目能否被信任。北大DCAI团队提出MathDebugger质检BenchMark,覆盖问答两端,评测主流LLM和PRM。还探究能否判断正误、分类错误、修复数据,证明错误标签可作监督信号。

InfoQ
算法论文8

大模型越反思越错,原来是链推理通过自我说服加重幻觉 | 北邮

北邮研究团队通过思维链审计实验,揭示大模型链推理‘越想越错’现象背后的元认知偏差。研究基于RFC协议文档构建受控知识域,分析推理过程,发现反思会加重幻觉,且现有检测方法难以应对。

量子位
算法论文8

思维链里的推理步骤,哪些最关键?三招锁定LLM的「命门句子」

杜克大学和 Alphabet 研究者提出在句子层面分析推理痕迹,找出思维链中关键步骤,提高 LLM 可解释性等。提出三种互补方法,还提供开源工具,研究为调试推理失败等提供可能。

机器之心