清华腾讯」共找到 780 篇相关文章

算法论文8

破解「长程智能体」RL训练难题,腾讯提出RLVMR框架,让7B模型「思考」比肩GPT-4o

腾讯混元AI数字人团队提出RLVMR框架,将‘元认知’理论引入RL,通过奖励‘好的思考过程’解决长程任务中智能体的低效探索与泛化难题,经其训练的7B模型表现出色。

机器之心
算法论文8

ACL 2025 | 清华&港中文提出 MorphMark:全新理论视角破解大模型水印效力与文本质量的两难困境

随着大模型广泛应用,AI 生成内容追溯和版权保护成问题,现有水印技术面临效力与文本质量的矛盾。清华和港中文团队提出 MorphMark 自适应水印框架,动态调强度,在多模型实验中表现优。

深度学习自然语言处理
算法论文8

Loss收敛不代表学会:腾讯混元ACL 2026拆解SFT训练中15.3%的“假学会”样本

大模型微调(SFT)是主流LLM落地方案,但大家默认训练完就是学完了。腾讯混元团队发现SFT存在不完全学习现象(ILP),论文完成了定义ILP、找根因、提诊断框架和验证干预等工作。

量子位
算法论文8

40年后,Dijkstra算法极限再被突破,清华段然团队更快最短路径算法摘STOC最佳论文

清华交叉信息研究院段然团队研究出全新算法,改进图灵奖得主等人1984年提出的算法,跳过不必要排序,专注重要点间最短距离,缩短计算时间。该研究在STOC 2025获最佳论文奖。

机器之心
产品应用7

腾讯、育碧的做过游戏后,他转身做 AI 原生游戏,一上线就好评如潮

AI 原生游戏「动物去哪儿」基于真实地理数据,让玩家的小动物开启真实旅行,经历随机事件。创始人太一曾在腾讯、育碧任职,受 AI 启发制作此游戏。目前游戏在观猹获 9.1 分,本周五将邀太一直播答疑。

特工宇宙
算法论文8

告别微调!腾讯提出Training-Free GRPO:无需更新参数,还能保证泛化性,成为传统RL的有力替代

大型语言模型在专业领域表现不佳,传统微调方法成本高、易过拟合。腾讯优图实验室提出Training - Free GRPO,无需更新参数,通过上下文学习提升性能,成本低且泛化性好,是传统强化学习有力替代。

深度学习自然语言处理
开源动态8

港科大(广州)联合腾讯AI平台部开源VibeWorlding,3D世界构建迎来Vibe Coding时刻?

香港科技大学(广州)联合腾讯AI平台部提出VibeWorlding,是可通过多轮对话等自主构建和编辑交互式3D世界的多模态智能体框架。团队开源多项数据,其模型经强化学习后表现超GPT - 5.5等。

机器之心
算法论文8

Qwen&清华团队颠覆常识:大模型强化学习仅用20%关键token,比用全部token训练还好

Qwen与清华LeapLab团队研究发现,大模型强化学习训练推理能力时,仅20%高熵token就能撑起效果,甚至超全部token训练。团队用此在Qwen3-32B创造新SOTA记录,还探讨了强化学习的相关特性。

量子位
开源动态8

腾讯发布混元3D世界模型1.0:首个支持物理仿真的开源世界生成系统

在2025年世界人工智能大会上,腾讯发布混元3D世界模型1.0,它是首个开源且兼容传统CG管线的可漫游世界生成模型。可通过文图生成3D世界,支持编辑、仿真,有360°沉浸、工业兼容、原子级交互优势。

量子位
算法论文8

腾讯发布SpecExit算法,无损压缩端到端加速2.5倍!解决大模型长思考效率难题

腾讯发布 SpecExit 算法,将思考早停与投机采样融合,利用轻量级草稿模型预测“退出信号”,在不引入额外探测开销的前提下,实现动态、可靠的思考早停,在 vLLM 上推理端到端加速 2.5 倍,准确性和推理效率得到双重保障。

机器之心