「同质化评估」共找到 1447 篇相关文章
Anthropic 提出透明度框架以保障前沿 AI 发展
Anthropic提出新透明度框架,针对大型AI公司,实施安全开发框架评估并减轻潜在风险,要求公开披露SDFs和系统卡片,小型公司豁免,还设执行合规条款,旨在平衡安全与创新。
Google | 溯源分析RAG系统错误,提出选择性生成框架,让RAG问答准确率提升10%
Google对RAG系统错误深入分析,引入‘充分上下文’概念,指出幻觉或因上下文不足。构建评估器,提出选择性生成框架,结合多信号决策,实验显示可让RAG问答准确率最高提升10%。
「AI 100」榜单启动招募,AI产品“年会”不能停丨量子位智库
2025年国内AI产品关键词频现,各有代表性产品。量子位智库2025年度「AI 100」榜单开启招募,分三大板块,用定量与定性结合评估体系,还公开AI产品知识库。
企业官网GEO优化:可直接复制JSON-LD+llms.txt模板(适配AI推荐)
文章提供企业官网GEO优化方案,含首页、FAQ页结构化代码及llms.txt模板,还有通用FAQ选题。介绍使用方法、上线校验步骤和生效判断标准,助企业适配AI推荐。
AI 行业最被低估的武器,是审美
AI竞赛激烈但产品趋同,品牌价值愈发重要。文章从品牌视角切入,阐述AI产品美学的三点基础洞察,梳理14个视觉标识趋势,还将品牌归为五类原型,强调品牌建设的重要性。
深度解读《AI 智能体的上下文工程》:构建高效 Agent 的七个宝贵教训
作者解读 Manus 团队文章,结合自身理解总结出构建高效 Agent 的 7 个关键点,如依赖上下文工程、提升 Prompt 缓存命中率等,还给出总结与核心启示,对 Agent 开发有借鉴意义。
何恺明首个语言模型:105M参数,不走GPT自回归老路
何恺明团队推出全新连续扩散语言模型ELF,不走GPT自回归老路。它将生成过程留在连续embedding空间,最后离散化变回token。ELF用较少参数、训练token和采样步数,跑赢主流扩散语言模型。
92% 工程师都在用 AI 后,Uber 开始给 AI “限额”了
Uber的‘零增长技术栈’解耦容量与业务需求,优化Go运行时性能。还将生成式AI集成开发,92%工程师在用,但成本压力大。为此,Uber限额每位开发者,审查代码效果,完善评估指标。
80%代码由Claude合并,Anthropic内部人员点破Agent真相:「Close the Loop」
Anthropic团队研究产品经理Theo演讲指出,Claude已深入其工程流程,超80%代码由它合并。模型角色转变,能力提升,失败率下降。开发者应升级研发战术,如刷新评估基准、精简“脚手架”、闭环设计。
翁荔最新博客:我们可能高估了模型,却严重低估了那层“脚手架”
前OpenAI安全研究副总裁翁荔在新博客聚焦AI领域Harness Engineering。她认为Harness是决定模型在现实任务中走多稳、多远的‘脚手架’,并梳理其演进路线,也指出研究面临评估、安全等瓶颈。