「自我修正机制」共找到 1195 篇相关文章
UW天才少女官宣入职OpenAI!46场面试,地狱级求职笔记刷屏
华盛顿大学华裔女博士Alisa Liu为入职OpenAI经历57轮面试,事后公开面试准备笔记成“LLMs面试圣经”。她分享求职经验,如合理安排面试、刷题备考、每场面试专门准备、学会薪资谈判等。
Meta|提出RECAP,通过动态目标重加权回放,解决RLVR遗忘【文末送书!Agent相关】
近年来,可验证奖励强化学习(RLVR)提升了大模型在多任务上的性能,但带来“能力退化”问题。Meta等提出RECAP策略,结合“回放”与“动态目标重加权”,保持模型通用能力,提升推理性能,还提高推理效率。
如何判断 AI 将优先自动化哪些任务?
思考AI优先自动化哪些任务,可从‘描述 - 执行鸿沟’视角出发。‘描述 - 执行鸿沟’大的任务是自动化沃土,反之自动化价值有限且创建训练数据难,它与‘判别器 - 生成器鸿沟’相似又不同。
字节开源高效解析文档图像的新型多模态模型Dolphin,快速将复杂的文档图像转化为结构化数据。
字节开源新型多模态模型Dolphin,采用“先分析后解析”范式,能将复杂文档图像转化为结构化数据。它有卓越性能和多种特性,还提供安装、推理使用指南。
DeepSeek Harness和V4 Pro正式版同时重磅上线,一手实测:DSH更像是AI操作系统
DeepSeek V4 Pro正式版0813上线,升级Agent能力,网页、API、app皆可用。DeepSeek Harness亮相并开源,基于“一切皆插件”理念。V4 Pro跑分部分能力突出但价格将涨,其实际表现待更多测试。
翁荔最新博客:我们可能高估了模型,却严重低估了那层“脚手架”
前OpenAI安全研究副总裁翁荔在新博客聚焦AI领域Harness Engineering。她认为Harness是决定模型在现实任务中走多稳、多远的‘脚手架’,并梳理其演进路线,也指出研究面临评估、安全等瓶颈。
Agent的自演进,被刚刚开源的AReaL 2.0按下了加速键
Agent 正从「会使用工具并完成任务」向「在使用中学习并改进方法」转变,但面临自演进难题。AReaL 2.0 上线,解决 Agent 服务侧问题,给出在线学习闭环方案,其价值已在实践中得到验证。
1.5K Star!网页提取神器 webclaw:让 AI 精准抓取网页核心内容!
webclaw是专为AI工作流打造的高性能网页提取工具,能把网页转成适合大模型的内容。它有Token优化、极速响应等亮点,支持多种安装和使用方式,解决了传统抓取工具的痛点。
跳过88%专家,保住97%性能!MoE推理的正确玩法| CVPR’26
多模态大模型走向大规模,MoE架构虽降低计算开销,但推理成本仍高。香港科技大学等团队提出MoDES,它是training - free动态专家跳过框架,能跳过88%专家还保留97%性能,推理速度提升2倍。
“心内推理”:一种动态多模态潜在空间推理范式 | 直播预约
当前多模态大模型推理效率低、稳定性不足。本次分享将介绍DMLR,它无需额外训练,仅在推理阶段生效,通过在潜空间优化潜在思考token、引入关键视觉信息,实现高效稳定的多模态推理。