「评估标准」共找到 1007 篇相关文章
Databricks × Snowflake 纷纷下注,PostgreSQL 成 AI 时代数据库标准?
文章结合作者对数据基础设施的实践与反思,探讨生成式AI时代数据系统的挑战与机遇。介绍数据基础设施新趋势,分析Neon、Supabase等公司受关注原因,指出PostgreSQL成行业标准,还提出Data Warebase概念及优势和应用场景。
陶哲轩转发!DeepMind开源「AI数学证明标准习题集」
DeepMind开源形式化数学猜想库,收录经典数学猜想,还提供代码函数方便形式化表述。此库可作测试基准提升AI数学推理能力,是AI+ATP范式关键前置步骤,团队邀更多人参与丰富内容。
从Demo到行业落地的Agents:技术、应用与评估
通用LLM Agent工业落地有短板,哈工大深圳与华为提出L1 - L5工业Agent能力成熟度框架,映射技术演进与产业场景,覆盖50+行业案例、300+评测基准,给出可量化‘爬级’路线。
吴恩达来信:AI 技能正在重新定义优秀开发者的标准
吴恩达指出市场对懂 AI 的开发者需求大,应届生失业率上升。面试看重利用 AI 辅助开发等能力,具备这些技能的人效率远超传统开发者,AI 工程正掀起变革,基础与 AI 知识结合造就高效开发者。
新研究重新评估 AGENTS.md 文件在 AI 编码中的价值
苏黎世联邦理工学院新论文指出,`AGENTS.md` 文件可能常阻碍 AI 编码智能体。研究构建 AGENTbench 数据集测试,发现 LLM 生成文件降低性能,人类编写文件有边际收益但也增加成本,开发人员对此研究看法不一。
超越纯视觉模型!不改VLM标准架构,实现像素级深度预测
Meta开源DepthLM,首证视觉语言模型不改架构,也能媲美纯视觉模型的3D理解能力。它通过视觉提示等策略,解锁VLM多任务处理潜力,为自动驾驶等领域带来前景。
超越纯视觉模型!不改VLM标准架构,实现像素级深度预测
Meta开源DepthLM,首证视觉语言模型不改架构就能媲美纯视觉模型的3D理解能力。通过视觉提示等创新策略,它精准完成像素级深度估计等任务,为多领域带来前景。
谷歌重磅开源 A2UI,这将会是2026年Agentic UI的王炸级标准!
过去人和AI交互多靠文本框和语音,实际应用中存在问题。谷歌开源A2UI,是AI Agent和用户界面的中间层协议,核心是声明式JSON和客户端原生渲染,有多种能力,还给出快速入手步骤。
LLM+RL遭严重质疑,随机/错误等虚假奖励也能提升至标准效果?
论文在AI领域观察到类似随机给糖或奖励错误答案让孩子成绩提升的现象,‘虚假奖励四大奇招’效果接近用标准答案训练,Qwen2.5 - Math - 7B模型在测试集上性能飙升,还揭示了Qwen特别的原因及随机奖励有效的推手。
ACL2025 | 代码助手火了,但安全吗?所有模型评估结果都很扎心
近期,GitHub Copilot、ChatGPT等AI代码生成工具爆火,效率显著提升,但代码安全性存疑。北大团队用CoV-Eval评测20款主流大模型,结果不佳,论文还给出优化方向,呼吁代码上线前严格测试。