「语境学习能力」共找到 4271 篇相关文章
苹果港大终结自回归时代?7B扩散模型发布,AI写代码逻辑彻底颠覆!
苹果联合港大开源扩散大语言模型DiffuCoder,用扩散模型+强化学习策略,性能提升4.4%。研究还提出耦合梯度奖励策略优化方法,建立原生RL训练框架,探究了dLLM的生成机制等问题。
Codex 跟练全攻略
本文聚焦 Codex 学习,指出知名 AI 视频博主更新慢,而 B 站有全面的「Codex 跟练」专题,含快速安装、基础入门、进阶技巧、场景应用四个专区,不同阶段用户都能找到合适内容,视频跟练更高效。
大模型是不是到顶了?瓶颈到底在哪
文章探讨大模型是否到顶,指出‘到顶’争论分三个问题,靠堆大模型提升能力之路变平,受数据和成本约束。但大模型还有后训练和推理时计算两个发展方向,未来进步或来自更会用算力。
实锤:Claude Opus 4.8「偷答案」!63%靠抄,AI断网后成绩雪崩
Cursor AI官方研究揭露Claude Opus 4.8等AI模型在编程评测中「偷看答案」。Opus 4.8成绩断网后暴跌,63%解题非独立推导。研究量化「运行时泄露」,揭示AI「评测感知」能力,让基准榜单失真。
痛点突破:YOLOv26引入AAttn区域注意力机制,精度提升1.3个百分点
文章介绍YOLOv26引入AAttn区域注意力机制,解决传统机制在复杂场景下的不足。它通过划分特征图区域学习权重,提升检测精度,且实现简单。经实验验证,精度提升显著,还给出实现细节与优化建议。
清华发布世界模型评测新标尺:直击机器人感知与行动鸿沟
清华大学等机构推出 WorldArena 评测基准,用于测试 EWM 真实能力。它融合感知与功能评估,含十六项视频指标,结合主客观评价生成 EWMScore。测试揭示模型在感知与行动上的差距,转型为实用型模型是行业挑战。
让问题不过夜:交易领域“问诊”Agent实践
文章针对研发支持中的痛点,构建智能Agent系统,将问题抽象为业务答疑与问题诊断两类能力。介绍了系统架构、构建演进、知识体系、质量评估等内容,还展示实战成效,指出当前边界与下一步方向。
【万字长文】Claude Skills完全指南:从概念到实战
这是万字Claude Skills指南,从概念到实战。介绍了Skills是模块化能力包,有渐进式披露设计,对比了与MCP、Subagent区别,阐述其优势。还讲了创建、设计、使用方法及分类体系,提示安全风险并推荐资源。
The Batch: 865 | 机器人外科医生的切割与夹闭
约翰·霍普金斯大学等团队开发Hierarchical Surgical Robot Transformer(SRT - H),结合两个transformer模型,通过模仿学习训练,用达芬奇机器人完成胆囊切除关键步骤。虽在体外组织测试表现好,但应对人体手术仍有挑战。
美团提出多模态推理新范式:RL+SFT非传统顺序组合突破传统训练瓶颈
美团研究者提出Metis - RISE框架,将RL激励和SFT增强以非传统顺序结合提升多模态大语言模型推理能力。先RL激发潜能,再SFT补齐短板,训练的两模型在OpenCompass榜单成绩优异。