自监督学习」共找到 2376 篇相关文章

算法论文8

SFT「不完全学习」之后,研究的下一个前沿在哪?ACL 2026 腾讯混元论文未来方向展望

本文从不完全学习现象出发,展望SFT领域未来研究方向,如未知根因探索、检测方法改进等,还提及推广到其他训练范式、CPT精细化研究等,给出研究优先级和社区建议。

InfoQ
新闻资讯8

WAIC机器人探展:我被全场最靓的崽「Moz1」种草了

2025 年世界人工智能大会上,千寻智能的人形机器人 Moz1 大放异彩。它搭载研 VLA 模型 Spirit v1,具备强大泛化能力,硬件也有多项突破。千寻智能全栈研技术,资本持续加码,有望推动具身智能商业应用。

机器之心
产品应用8

华为升级行业Agent算法架构!MindScale己写prompt和工作流,KV Cache减少5.7倍token

华为诺亚方舟实验室更新面向行业应用的算法包MindScale,融合算法创新与业务实践经验。它梳理了Agent时代技术挑战,给出技术论文与昇腾代码,应对工作流维护等难题,还提升训推效率、适配国产硬件。

量子位
算法论文8

首次解释LLM如何推理反思!西北大学谷歌新框架:引入贝叶斯适应强化学习,数学推理全面提升

西北大学与Google、谷歌DeepMind团队质疑传统强化学习与反思的关系,提出贝叶斯适应强化学习方法,首次解释为何、如何及何时反思探索新策略,还给出决策数学形式,实验显示其性能更优。

量子位
算法论文8

LLM内部竟藏着众多策略模型?所&腾讯团队首次揭示大模型RL新机制

中国科学院动化研究所与腾讯AI Lab团队从可解释性分析出发,发现LLM内部含多个可采样内部策略,揭示不同模型推理熵模式,提出BuPO算法,在复杂推理任务上性能显著优于传统算法。

深度学习自然语言处理
推荐文章7

实战·Agentic 上下文工程(下):实现一个可学习与进化的智能体原型

文章参考ACE论文架构与提示词设计,实现可学习与进化的ACE智能体原型。介绍整体架构、各模块实现逻辑、工作流组装测试,也指出当前问题如LLM表现波动大等,并给出改进方向。

AI大模型应用实践
开源动态7

Sglang 源码学习笔记(三)- 分布式和并行(以deepseek 为例)(WIP)

文章是 sglang 源码学习笔记,聚焦分布式和并行,以 deepseek 为例。介绍通信域类型,分析 ZMQ 和 torch.dist 通信,阐述 TP、DP、EP 实现,包括初始化、使用等,还涉及不同 Linear 层 TP 及 MoE 不同实现情况。

GiantPandaLLM
开源动态8

突破Claude-4编程上限!进化Agent框架拿下新SOTA,底模越好性能越高,已开源

中科院、清华等提出SE - Agent进化框架,突破Claude - 4编程上限。它让智能体系统性修订、重组与精炼思考过程,在SWE - Bench Verified上刷新开源框架SOTA,已开源。

量子位
新闻资讯8

机器学习先驱Daphne Koller警告:AI制药不是魔法棒,下一代药物发现还缺1000倍数据

知名学者 Daphne Koller 在 a16z News 发文指出,AI 制药当前最受关注的进展多在分子设计,但新药研发难题在上游,疾病机制的靶点选择错误导致大量临床试验失败,且当前数据距构建完整生物学因果模型差约 1000 倍。

DeepTech深科技
开源动态8

阿里通义的视觉RAG革命!VRAG-RL:基于强化学习的视觉感知RAG框架,性能飙升30%

阿里巴巴通义实验室推出VRAG - RL,融合视觉感知、多模态推理与强化学习,已在GitHub开源。它破解传统RAG处理视觉数据难题,通过创新机制提升性能,在多数据集表现出色,还将向更拟人化和低幻觉方向发展。

开源星探