「指标驱动」共找到 874 篇相关文章
LLM 仅靠自身就能增强推理?SePT 给出简洁在线自训练范式
多数推理后训练方法依赖外部信号,SePT仅用模型自身生成的答案自训练,能提升推理能力,数学推理任务准确率升10个点。它核心简洁,设计关键是温度解耦等,不损模型通用能力,代码易迁移复现。
Claude Code 推出 Monitor 功能,帮你随时盯梢
Claude Code 在 v2.1.98 版本推出 Monitor 功能,可让 Agent 后台挂监控脚本,解决轮询痛点。它能覆盖日志监控等多场景,与 /loop、/schedule 功能有别,使用有注意事项,反映 Anthropic 让其成工程系统的方向。
Python新版本去GIL刷屏,Karpathy 点赞敢死队,Python 之父:冷静,别神话并发
Python 3.14 正式发布,将“去 GIL”写进官方发行版,一整套能力同步上线,官方预估可带来约 3% - 5% 的性能提升。开发人员反馈速度明显提高,但 Python 之父认为去除 GIL 的重要性被高估。
别光看 Claude 多厉害!Anthropic 内部拉响警报:“AI 的经济冲击比想象的更危险!”
Anthropic宣布启动‘经济未来计划’,作为‘经济指数’扩展,聚焦深入实证研究、推动数据驱动政策制定、完善经济衡量工具,还将与独立机构合作,现已开放合作申请。
继MCP、A2A协议之后,又一个Agent协议AG-UI来了
AI Agent交互协议不断演进,在MCP、A2A协议后,copilotkit发起AG - UI项目,构建开放、轻量级、基于事件的Agent - 用户交互标准化协议,侧重前端交互,已获部分框架兼容。
未来已来:a16z 描绘Agent时代的开发者工作流(内含 9 大关键模式)
知名风投机构 a16z 发布 Insight,认为开发者将 AI 作为构建软件新基石,传统开发范式因 AI Agent 参与而变革。其识别出九个新兴开发者模式,预示 AI 时代开发工作新图景。
旧手机除了放转转,还能放数据中心提供算力
Google和UC San Diego合作,将退役Pixel手机拆解成主板组成计算集群,跑教学科研任务。研究表明,旧手机算力仍有价值,可用于轻量任务,还能降低隐含碳,或催生新产业链。
一张图生成「能动」的3D资产:VAST+香港大学AniGen把AIGC推向动画、游戏、仿真与具身智能 (SIGGRAPH 2026 TOG)
SIGGRAPH 2026论文AniGen,由VAST和香港大学研究,能从单张图片直接生成带骨架与蒙皮权重的可动画3D资产。它解决了现有方法的不足,在多方面表现出色,对多个领域意义重大。
二元成功率已经过时!PRM-as-a-Judge才是你需要的具身操作评测框架
传统二元成功率评测具身操作任务有局限,难回答策略推进、执行效率等问题。中科院自动化所等机构研究人员提出PRM - as - Judge框架,含进度势能、OPD指标体系和RoboPulse基准,能细粒度审计执行过程。
以「图」破局,HyperOffload定义超节点存储管理新范式
随着生成式AI进入万亿参数时代,大语言模型面临“显存墙”挑战。上海交大与华为MindSpore团队发布技术报告《HyperOffload》,其核心技术集成于MindSpore 2.8,能提升超节点异构资源协同效率,已在多项目落地。