「评测机制」共找到 1467 篇相关文章
VC开始靠AI预测未来了
七月,DigClaw的预测框架Rhizome v1在FutureX评测平台取得优异成绩,支持了预测能力可沉淀在基座模型之外的判断。大语言模型不擅长预测,而DigClaw构建了以因果结构为骨架的预测基础设施。
UCSD谢澎涛创业:用AI搞科研,4小时交付顶刊水平成果,已获数百万美金融资
谢澎涛团队推出面向AI for Science的AIBuildAI Science Agent,在NatureBench评测中排名第一,超多数通用编程智能体。该智能体可独立完成模型研发,效率大幅提升,还探讨了其能力边界、应用及对行业的影响。
相比层出不穷的 Agent 框架,不变的 Agent Protocol 是什么
文章围绕 Agent Protocol 展开,指出框架更迭但生产级 Agent 系统问题不变。以 Agent Protocol 为主线拆分 Agent Runtime,探讨其核心、稳定对象、执行模型等,还对比各框架在多维度的表现并给出设计建议。
Coding Agent 在百度的落地实践:从反馈闭环到工程范式重构
本文整理自百度文心快码研发经理牛万鹏演讲,介绍了Coding Agent在百度的落地实践。包括落地成效、Agent Loop框架问题、Feedback Loop构建、Benchmark评测及Agent Engineers理念,还提及企业级Agent落地的工程问题。
NUS、牛津等联合发布音视频智能综述:系统梳理大模型时代的AVI全景图
NUS领衔近10家机构发布音视频智能综述,系统梳理大模型时代AVI发展全貌,涵盖感知、生成与交互,复盘子方向工作,构建任务蓝图,整理评测体系,总结基础技术,还探讨应用、安全及未来研究方向。
3B激活参数,干翻GPT-5.4和Opus4.6,商汤绝影把龙虾塞进了车里
商汤绝影发布端侧多模态大模型Sage,32B总参数、3B激活参数,在PinchBench评测超Claude Opus4.6等。自研SCOUT和ERL技术助力,从多维度领先同量级端侧模型,为座舱智能体提供支撑。
2026 AI 大模型技术体系综合开源影响力榜单发布,中国开源实力领跑全球
2026年全球AI产业迈入新阶段,开源生态影响力成关键。4月17日CSDN联合多家机构发布《2026大模型技术体系综合开源影响力榜单》,从四大维度、53项细分指标评估,呈现开源生态地图,助力中国AI开源跨越。
OpenAI彻底重构Codex!长出独立鼠标,自己排班狂卷打工人
OpenAI重磅更新Codex,它能在后台开模拟器、修Bug,不影响前台工作。有独立光标,支持在渲染网页上操作改代码,还上线90多款插件,新增‘心跳’机制,能自己排班,补齐日常刚需功能。
26.7K 标星!GitHub 高分教程 Learn Claude Code:12 节课带你手搓一个 Cursor!
Learn Claude Code是shareAI - lab开源教学项目,目标是让人理解AI编程Agent工作原理。它有12节课,每节加一个机制,逻辑清晰。配交互式Web平台,文档‘心智模型优先’,还提供后续项目助知识落地。
星标超 29 万,OpenClaw 两天两次大更!适配GPT 5.4,告别“抽卡式 Prompt”
GitHub星标超28万的AI Agent开源项目OpenClaw,在周六与周日迎来两轮重量级更新,集中在模型能力、Agent架构、工程部署及安全机制四个方向。2026奇点智能技术大会将邀专家探讨其产业实践价值。