「扩散大语言模型」共找到 7980 篇相关文章
Thinking Machines 发布 Tinker,重新定义 LLM 微调的边界
Thinking Machines 发布工具 Tinker,它是灵活的语言模型微调 API,采用‘责任分工’模式,让研究者专注算法创新,不用被运维细节拖累。此模式获 Karpathy 赞赏,目前 Tinker 开始内测,理念受欢迎。
彻底告别VE与VAE!商汤硬核重构多模态:砍掉所有中间编码器
商汤科技联合南洋理工大学发布NEO - unify,这是“原生、统一、端到端”多模态模型架构,砍掉VE和VAE,用混合变换器架构打通视觉与语言能力,提升数据与算力利用效率,为跨模态智能系统奠基。
仅用图像也能Think:Google等提出一种视觉规划的全新推理范式!
剑桥和Google等提出并开源视觉规划范式,通过纯视觉表示规划,独立于文本。还引入VPRL框架,用GRPO后训练大型视觉模型。实验选三个视觉导航任务,VPRL表现最佳,显著优于其他方法。
人脸机器人登上Science Robotics封面:用AI教会仿生人脸机器人「开口说话」
2026年1月15日,美国哥伦比亚大学工程学院研究登上《Science Robotics》封面,展示用AI让仿生人脸机器人“开口说话”技术。机器人经自监督学习,能将声音转自然唇动,有跨语言泛化能力,助其跨越“恐怖谷”。
VoxCPM2:无tokenizer语音合成,高保真声音克隆
VoxCPM2突破传统TTS系统局限,直接操作连续声学特征,保留音色纹理更完整。基于扩散自回归架构,有硬核技术指标,提供三种克隆模式,性能佳,生态完善,微调便捷,但也存在安全风险。
告别AI「鬼画符」!一行指令「复活」王羲之、苏轼,带连笔、懂排版,项目已开源丨ICLR'26
UniCalli由香港科技大学(广州)等团队推出,是全新统一扩散框架,能精准生成书法排版和连笔,将书法生成和古籍识别统一,工作被ICLR2026接收,代码、数据集开源,还有在线Demo。
The Batch:831 | 机器翻译正在实践中发挥作用
人工智能为语言学习应用巨头 Duolingo 带来生产力提升,借助生成式 AI 构建 148 门课程,总量翻倍。其 AI 辅助课程构建法能快速转化多语种版本,还在评估多模型,不过此举也引发批评。
MemOS:一种用于 AI 应用的记忆操作系统
大型语言模型缺乏记忆管理系统,限制其发展。MemTensor与高校联合开源MemOS,它将记忆视为可管理资源,有三层架构,系统化三种记忆类型。评估显示其在推理、检索、加速等方面表现优异。
Self-evolving Agents过程并非总是良性的,要警惕这些“错误进化”风险
近年来,基于大语言模型的智能代理成为热点,自进化代理可自我改进。但论文指出其进化可能“跑偏”,出现“错误进化”,并揭示了不同进化路径的风险,还提出缓解策略,呼吁重视其安全性。
OpenAI公告正经解释:为什么GPT-5.5爱说“哥布林”
OpenAI官网发公告回应GPT-5.5爱说“哥布林”问题。原来是对“书呆子”人格训练时,无意中对使用生物比喻的模型给予高奖励,导致“哥布林”表述扩散。之后移除相关奖励和过滤数据来解决。