「跨模型泛化」共找到 7926 篇相关文章
【DeepSeek-OCR系列第一篇】Language Modelling with Pixels【ICLR23】
当前主流语言模型依赖固定词表,扩展到多语言、多脚本时面临覆盖受限、计算昂贵、鲁棒性差等问题。ICLR 2023论文提出不依赖词表的PIXEL模型,通过将文本变成图像用视觉Transformer理解,实验验证其有跨语言、抗噪声等优势。
Qwen&清华团队颠覆常识:大模型强化学习仅用20%关键token,比用全部token训练还好
Qwen与清华LeapLab团队研究发现,大模型强化学习训练推理能力时,仅20%高熵token就能撑起效果,甚至超全部token训练。团队用此在Qwen3-32B创造新SOTA记录,还探讨了强化学习的相关特性。
两张图就能重构3D空间?清华&NTU利用生成模型解锁空间智能新范式
ICCV 2025中稿的LangScene-X以全新生成式框架,仅用稀疏视图就能构建可泛化的3D语言嵌入场景。它攻克传统方法痛点,将多模态信息统一在单一模型,为空间智能领域打开新大门。
破解「长程智能体」RL训练难题,腾讯提出RLVMR框架,让7B模型「思考」比肩GPT-4o
腾讯混元AI数字人团队提出RLVMR框架,将‘元认知’理论引入RL,通过奖励‘好的思考过程’解决长程任务中智能体的低效探索与泛化难题,经其训练的7B模型表现出色。
世界模型混战,Momenta率先冲刺IPO
当下世界模型是AI领域热门且混乱的概念,主流路线有四类。Momenta的R7世界模型已量产,其CEO定位公司为物理AI基座模型构建者。Momenta率先冲刺IPO,商业模式正转型,为后续玩家提供价值评估体系。
与Generalist顶峰相见,30天狂吸30亿,千寻智能做对了什么?
2026年4月7日,千寻智能完成新一轮10亿融资,30天内累计融资30亿,由雷军、马云旗下资本领投。其开源具身模型Spirit v1.5展现泛化能力,技术路径获认可。千寻构建多源数据引擎,还通过现实场景数据反哺模型。
腾讯发布SpecExit算法,无损压缩端到端加速2.5倍!解决大模型长思考效率难题
腾讯发布 SpecExit 算法,将思考早停与投机采样融合,利用轻量级草稿模型预测“退出信号”,在不引入额外探测开销的前提下,实现动态、可靠的思考早停,在 vLLM 上推理端到端加速 2.5 倍,准确性和推理效率得到双重保障。
Claude团队用Qwen测试全新训练方法
Anthropic最新研究提出中训练(MSM),在预训练后、后训练前给AI立规矩。实验显示,新增MSM能让通义千问两款32B大模型失准率大幅下降,还能精简微调数据。MSM与对齐微调结合,可提升模型泛化能力。
蚂蚁·安诊儿医疗大模型:正式开源并登顶权威医疗榜单
近日,蚂蚁集团联合浙江省卫生健康委开源自研的蚂蚁·安诊儿医疗大模型。它基于蚂蚁百灵大模型架构,经深度训练,是参数规模最大的开源医疗模型。该模型在多评测中表现出色,有三阶段训练流程,架构高效、推理快,已开源助力行业发展。
Anthropic神话模型发布,但不让你用
Anthropic发布神话模型Claude Mythos Preview却不开放使用,发起玻璃翼计划联合科技巨头用该模型修复全球软件漏洞。此模型能自主发现众多零日漏洞,合作伙伴应用后强调跨行业协作应对网络安全挑战。