「同策略蒸馏」共找到 1178 篇相关文章
腾讯LLM团队:对下一个 Token 预测的深入剖析,多样性 or 精准度?
最新研究证实RL能增强LLM推理,但成效受限预训练token分布。腾讯LLM部把交叉熵重写成单步策略梯度,用超参压熵,为RL打造‘低熵高信号’起点,经实验验证低熵模型优势明显。
智能体的记忆管理机制及其潜在风险 | 直播预约
大语言模型(LLM)智能体兴起,记忆机制是核心。本次报告将探讨记忆管理对其性能的影响及潜在风险,展示缓解关键挑战的策略,介绍新攻击范式,揭示安全漏洞,强调需重新审视与建模。
AI 真能看懂物理世界吗?FysicsWorld:填补全模态交互与物理感知评测的空白
多模态大语言模型正经历范式转变,目标是实现全模态协同交互。但现有评测体系难跟上模型发展。飞捷科思和复旦团队推出 FysicsWorld 基准,可评测模型多能力,还提出 CMCS 策略,为全模态智能发展提供指引。
谷歌营收被Nano Banana带飞!季度首破千亿美元,Gemini APP月活6.5亿
Nano Banana成爆款后,Gemini月活达6.5亿。AI业务带动下,谷歌季度营收首破千亿美元。谷歌CEO称全栈式AI策略推动增长,谷歌还将加码AI基建投资,且与能源企业合作重启核电站。
LangChain联合Manus季逸超最新分享!也许当前最好的「上下文工程」讲解
文章由LangChain创始工程师与Manus联合创始人深入探讨上下文工程,介绍其兴起背景、重要策略。指出AI Agents上下文膨胀致性能下降,上下文工程能解决此问题,还阐述了避免模型专业化陷阱及相关实战经验等内容。
从 AI 创业角度看 GEO:如何引流、效果评估,以及创业机会在哪里?
文章从AI创业角度剖析GEO,介绍其原理、内容优化策略、实操建议、效果评估搭建、代表产品等,指出GEO与SEO不同,虽有争议但值得做,还探讨了相比SEO的更多想象空间。
开源Agent模型榜第一名,现在是阿里通义DeepResearch
阿里开源首个深度研究Agent模型通义DeepResearch,在多权威评测集上超越多个Agent模型。它采用多阶段数据策略,有两种推理模式,革新训练流程,已赋能高德出行Agent和通义法睿等应用,且模型等均已开源。
如何实现RAG与MCP集成
文章聚焦RAG与MCP集成,介绍RAG突破传统模型局限及不足,引出Agentic RAG。阐述MCP革新AI工具连接方式,结合二者构建集成架构,还给出实现步骤、优化策略与代码实践,为释放AI系统潜力提供方案。
快手Klear-Reasoner登顶8B模型榜首,GPPO算法双效强化稳定性与探索能力!
快手Klear团队推出Klear-Reasoner模型,基于Qwen3 - 8B - Base打造,在多基准测试达同规模SOTA。其核心GPPO算法能强化稳定性与探索能力,团队还对训练流程多环节深入分析,给出优化策略。
大模型进入研发体系后,我们看到了这些变化
InfoQ《极客有约》X AICon 直播邀请同程、网易、百度工程师,探讨大模型入研发体系的变化。涉及提效、协作、角色分工等方面,还谈及工程师特质、效率焦虑、岗位数量等问题,6 月北京 AICon 大会将深入交流。