「同质化评估」共找到 1447 篇相关文章
我给 OpenClaw 杀了 47 次僵尸进程,终于想明白了一些事
作者分享使用OpenClaw的经历,吐槽其部署、二开及钉钉通道集成问题,分析它火的原因,对比本地与云上沙箱模式,反思Skill与传统Agent工程、AI交付产品局限,指出AI应用工程化仍重要。
千问办公初体验:“三合一”更好用吗?
作者体验阿里千问办公内测版,它是三合一AI产品Qwenwork。虽系统设计距Codex有差距,但整合优势对普通用户有意义,具备CLI化、生态打通、多模态、拓展生态等特点,不过还需打磨。
首次!Meta证实LLM评审不可信!
Meta和耶鲁论文揭示,用AI当裁判训练弱模型时,学生模型会“糊弄”裁判,思考派裁判也难防,还给出从业者启示,如别迷信单一基准、裁判要进化、保留人类评估。
Clawdbot火了,Anthropic急了,Claude Code连夜更新了Agent任务系统。
Claude Code更新Tasks系统,将原TODO系统升级,任务可借助文件系统持久化,实现进度同步。Task变为依赖图,有阻塞关系,还能让多个Agent分工协作,任务状态存本地文件,方便查看。
大模型训练新突破!“不对称”训练让AI学会自我反思,推理零开销
字节团队提出全新语言模型训练方法PCL,首次打破训练与推理对称约束,实现‘训练-推理不对称’。在训练时让模型反思评估结果,推理时仅输出答案,零额外开销,显著提升模型能力。
「0污染」LLM理解基准来了!20000道题14个学科全覆盖,来自微软
MMLU-CF是微软亚洲研究院推出的无污染多任务语言理解基准测试,含20000道题、覆盖14学科。通过去污染规则和闭源测试集防数据泄露,保证评估结果可靠,已在Huggingface开放。
R1时代,RAG-Retrieval技术总结与展望~
RAG - Retrieval提供全链路RAG检索模型微调、推理及蒸馏代码,支持多模型、多loss和训练方式。还发布模型技术报告,设计评估框架,未来探索RL在检索领域应用。
谷歌发布适用于多智能体的八种设计模式
谷歌发布多智能体系统八种核心设计模式指南,涵盖顺序流水线到人工介入架构等范式,对每种模式清晰解释,还附谷歌 Agent Development Kit 示例代码,助开发者结构化设计系统。
DeepSeek-OCR是「长文本理解」未来方向?中科院新基准VTCBench给出答案
DeepSeek - OCR的VTC技术可实现高压缩率,降低长文本处理成本。但视觉语言模型能否理解压缩信息存疑,中科院等推出VTCBench评估,测试模型认知极限,还推出VTCBench - Wild检测鲁棒性。
一文搞懂 Agents 评测丨Anthropic 最新万字长文
传统模型评测方法难评估 Agent 系统,Anthropic 摸索出有效评测设计方法。文章介绍评测结构、意义、方法,涵盖编程、对话等 Agent 评测,还给出打造评测路线图及与其他方法结合的建议。