「统一表示学习」共找到 2040 篇相关文章
上海AI Lab、浙大EagleLab等提出RRVF:利用「验证非对称性」,只输入图片学习视觉推理
上海AI Lab、浙大EagleLab等联合完成研究,提出RRVF框架,利用「验证非对称性」,仅输入图片学习视觉推理。它构建闭环系统,通过迭代推理、视觉反馈等步骤训练模型,实验显示效果佳,证明验证法则力量。
“最强具身VLA大模型”,究竟强在哪儿?
机器人基础模型π*0.6刷屏,能让机器人高效完成多项任务。它引入Recap学习法,突破传统模仿模式。其核心方法RECAP让VLA用奖励反馈和人类介入训练,还能从异构数据学习,实现自我进化。
北大联合阶跃星辰提出TensorCast:统一可编程管理大模型张量,推理「首字延迟」最高降低93.2%
随着模型规模增长、新应用兴起,大模型基础设施面临管理「张量状态」挑战。北大、阶跃星辰与北邮联合提出 TensorCast,解耦张量状态,复用管理能力,在多场景测试中表现出色,为大模型基建提供新范式。
SFT「不完全学习」之后,研究的下一个前沿在哪?ACL 2026 腾讯混元论文未来方向展望
本文从不完全学习现象出发,展望SFT领域未来研究方向,如未知根因探索、检测方法改进等,还提及推广到其他训练范式、CPT精细化研究等,给出研究优先级和社区建议。
1.5B参数撬动“吉卜力级”全能体验,国产开源之光多模态统一模型,来了
GPT-4o引发“吉卜力”风暴,改变AIGC范式。昆仑万维开源多模态统一模型Skywork UniPic,1.5B参数就能接近甚至超越十几亿参数专用模型,可在消费级显卡运行,还公开全套资源。
NeurIPS25高分论文|以判别式监督学习强化推理LLM,解决难度偏差和熵崩塌难题
德州农工大学博士生李港在NeurIPS25高分论文中,分析GRPO优化目标,发现难度偏差局限及与判别式监督学习联系,提出DisCO框架强化大型推理模型,其优势显著,实验表现优于GRPO及其变体。
Google 发布首个全模态 Embedding 2 模型,文本图片音视频 PDF 统一到一个向量空间
Google发布Gemini Embedding 2模型,它是业界首个原生支持文本、图片、视频、音频和PDF五种模态的Embedding模型,可将这些数据映射到同一向量空间,在多模态RAG、跨模态搜索等场景有应用,还介绍了跑分、用法、竞品、价格等情况。
首次解释LLM如何推理反思!西北大学谷歌新框架:引入贝叶斯自适应强化学习,数学推理全面提升
西北大学与Google、谷歌DeepMind团队质疑传统强化学习与反思的关系,提出贝叶斯自适应强化学习方法,首次解释为何、如何及何时反思探索新策略,还给出决策数学形式,实验显示其性能更优。
实战·Agentic 上下文工程(下):实现一个可自我学习与进化的智能体原型
文章参考ACE论文架构与提示词设计,实现可自我学习与进化的ACE智能体原型。介绍整体架构、各模块实现逻辑、工作流组装测试,也指出当前问题如LLM表现波动大等,并给出改进方向。
Sglang 源码学习笔记(三)- 分布式和并行(以deepseek 为例)(WIP)
文章是 sglang 源码学习笔记,聚焦分布式和并行,以 deepseek 为例。介绍通信域类型,分析 ZMQ 和 torch.dist 通信,阐述 TP、DP、EP 实现,包括初始化、使用等,还涉及不同 Linear 层 TP 及 MoE 不同实现情况。