「多语言语义内核」共找到 1342 篇相关文章
RL训练总崩溃?R1-Reward稳定解锁奖励模型Long-Cot推理能力
多模态奖励模型对提升多模态大语言模型表现至关重要,但强化学习在奖励建模应用有挑战。快手等团队提出R1 - Reward,解决训练不稳定等问题,在基准上超SOTA模型,还在快手业务场景成功应用。
无需训练!让VLM同时具备「视觉」与「推理」能力,数学题得分暴涨30%
当前视觉语言模型(VLM)像‘视力好但数学差的学生’,论文指出问题根源是数据不足和能力分布不均。提出‘模型合并’方案,实验显示在数学基准测试中表现亮眼,还通过实验揭示层间能力分布。
连续自回归的dots.tts:小红书开源语音合成模型「基座」
语音合成赛道发展如早期大语言模型,路线未收敛。小红书与上海交通大学合作开源的 dots.tts,是 20 亿参数、全连续、端到端自回归 TTS 基础模型,有准确度高、可扩展等特点,还开源了代码。
AI可以用任何手段、写任何东西,但你得是个“中年老登”
PingCAP 黄东旭称做 db9 项目未看到 AI 边界,语言、框架、数据库选型不再长期锁定,AI 能写任何软件。徐昊认为软件知识比代码重要,‘重写’概念或过渡。滕昱指出 AI 需‘老登’掌舵,企业软件维护仍存难题。
王梦迪、丛乐团队Science Earth:当组织本身开始涌现,全球科学能力第一次在同一张网上互相发现
王梦迪、丛乐团队在arXiv发布预印本论文,推出面向AI原生科学发现的行星级操作系统Science Earth,它能连接全球科学能力。文中通过两个案例展示其作用,并介绍协调内核EACN,还公开了论文、代码与网络。
Insanely Fast Whisper:开源社区让音频转录速度提升19倍
Insanely Fast Whisper工具将OpenAI Whisper转录速度提升19倍,采用Flash Attention 2技术,零质量损失。它集成多语言支持、说话人分离等实用功能,还支持跨平台,免费运行。最初是基准测试demo,值得音频处理用户关注。
ICLR 2026 | 机器人不够聪明?VLMgineer让大模型自己「发明工具」,从设计到使用全自动
宾夕法尼亚大学研究者提出 VLMgineer,一个全自动工具设计与使用框架,利用视觉语言模型和进化搜索,让机器人自主设计并使用工具。该工作已被 ICLR 2026 接收。实验显示,它在工具设计上优于人类提示和现有 Benchmark 工具。
工业级 LLM 数据工程:北京大学 DCAI 团队 DataFlow 框架的架构设计与实践
2026 年大模型研发从‘模型中心’向‘数据中心’演进,数据语义密度与工程精度成突破关键。北京大学 DCAI 团队推出 DataFlow 框架,解决数据准备难题,其技术报告登顶 Hugging Face。该框架有多种特性,实验验证其能提升模型性能。
北大大牛团队最新顶会,首次让AI能够生成真实火焰
北京大学陈宝权教授团队提出 FieryGS 框架,被 AI 顶会 ICLR 2026 接收。它将多模态大模型、燃烧物理仿真与 3D 高斯溅射融合,首次在 3D 重建中实现物理可信、语义感知且可控的火焰合成,推动数字孪生发展。
腾讯混元 x MBZUAI 港中文新研究:将纠错纳入策略空间,Search-R2 重构搜索增强推理学习方式
过去大语言模型能力提升靠参数和数据扩张,但在真实任务中此路径有局限。腾讯混元、MBZUAI、港中文联合团队提出Search - R2,将纠错纳入策略空间,抑制错误传播,在多跳推理任务中优势显著。