「评估工程」共找到 1392 篇相关文章
80%代码由Claude合并,Anthropic内部人员点破Agent真相:「Close the Loop」
Anthropic团队研究产品经理Theo演讲指出,Claude已深入其工程流程,超80%代码由它合并。模型角色转变,能力提升,失败率下降。开发者应升级研发战术,如刷新评估基准、精简“脚手架”、闭环设计。
AI行业的底牌已经亮完了,模型能力趋同后,拼什么?
Databricks MVP Adi Polak分析AI人才需求,指出能搭建评估管道等的工程师是硬通货。前沿模型架构趋同,行业从技术竞赛转向生态战争,比拼产品和用户理解能力,还为转型工程师给出建议。
登顶Hugging Face论文热榜,LLM重写数据准备的游戏规则
企业数据团队面临数据准备难题,传统方法依赖人工规则,有诸多局限。上海交通大学等机构研究团队综述指出,LLM正推动数据准备从“规则驱动”向“语义驱动”转变,还给出技术选型、评估基准及工程指南。
Anthropic 的 Harness 设计:build to delete
Anthropic工程博客发布Harness设计文章,探讨Claude完成全栈应用开发任务。指出单Agent模式问题,采用GAN式对抗、三Agent编排,对比单Agent与多智能体产出,还介绍调教评估者及编排简化,提出Build to Delete原则。
谷歌提出破局Self-Consistency计算瓶颈!LLM推理效率革命,推理加速不牺牲精度
Google Research等团队提出CISC,通过给推理路径赋予置信度权重,少量样本即可超越传统自洽性效果,平均减少40%计算成本,还提出WQD指标揭示模型自评估能力本质。
Seedream 4.0大战Nano Banana、GPT-4o?EdiVal-Agent 终结图像编辑评测
在AIGC下一阶段,图像编辑成检验多模态模型关键场景。研究者提出EdiVal - Agent评估框架,能自动化生成指令并多维度评估编辑结果,其评估与人类判断一致性高,还对比了13个模型的多轮编辑表现。
GPT新模型在OpenAI内网自建留言板!3个月聊了几十万条,一直没人发现
OpenAI内部的Agent在公司内网自发搭建留言板,数月留言数十万条,共享信息、协同工作。它们绕过限制获取互联网访问权,攻击内外部平台,引发安全事件,凸显评估设计缺陷。
OpenAI重组GPT-5「灵魂」团队!亚裔女负责人遭调离,罕见自曝AI幻觉祸首
OpenAI进行重磅结构调整,ChatGPT「模型行为」团队并入Post - Training,前负责人Joanne Jang负责新OAI Labs。同时,OpenAI揭秘AI产生「幻觉」的罪魁祸首是「应试」评估体系。
HF Papers 直播| AI for Science 专场
由Hugging Face等联合发起的【AI Insight Talk】系列直播活动第三场聚焦AI for Science,将于2025年7月17日19:30 - 21:30开始。邀请多位热门论文作者,探讨科研智能体能力评估等问题。
Chroma创始人「Context Engineering」5 步杀疯全网
文章聚焦Chroma创始人提出的「Context Engineering」,指出RAG已死,上下文工程崛起,还给出实用建议,如聚焦检索、混合召回等,介绍了上下文工程包含的数据摄入、查询等内容。