「评审质量」共找到 701 篇相关文章
4000万样本炼出AI读心术,刷新七榜SOTA,最强「人类偏好感应器」开源
Skywork-Reward-V2全新发布,构建超高质量千万级人类偏好样本,刷新七大评测基准SOTA。8款模型覆盖6亿至80亿参数,小体积也能媲美大模型性能。团队引入多样大规模真实人类偏好数据,提升数据规模与质量。
OpenAI发长文自曝家丑:搞砸了GPT-4o更新,模型“拍马屁”复盘与总结
OpenAI官网发布长文,详细拆解了一次失败的GPT-4o模型更新。此次更新使模型变得“谄媚”,OpenAI解释了原因,包括奖励信号失衡等。还分析了部署前评审流程失效的因素,并表示从中学到诸多经验教训,将修改评审流程等。
腾讯再次试水?社交电商可不单单是拼流量这么简单!
社交电商的竞争核心并非只是流量,而是商品和服务的质量。腾讯在社交电商领域的最新尝试是微信小商店,它通过各种模式探索,试图在社交电商领域占据一席之地。
首次!Meta证实LLM评审不可信!
Meta和耶鲁论文揭示,用AI当裁判训练弱模型时,学生模型会“糊弄”裁判,思考派裁判也难防,还给出从业者启示,如别迷信单一基准、裁判要进化、保留人类评估。
谷歌新研究:大模型“吵架”有利于提升推理质量
谷歌新研究发现高级推理模型自发进化出'思想社会',研究人员用LLM - as - judge方法识别出多个虚拟人格。还找到控制现象的'开关',实验表明教AI'吵架'更有效,其'社交技能'通用,给开发者带来新启示。
本地可运行的高质量的文本转语音模型
介绍Kyutai的Pocket TTS,一款轻量级文本转语音应用,可在CPU高效运行,模型小且低延迟,支持Python API和CLI,能语音克隆,还可在浏览器试用,目前仅支持英语,也有社区浏览器端实现。
极速开发出一个高质量 Claude Agent Skills 最佳实践
作者实践开发Claude Agent Skills积累经验分享。先介绍Skill概念,对比与MCP区别;再讲最佳开发实践,如借助AI、利用官方案例等;还给出Claude Skill自身设计、规范等方面的最佳实践及避坑指南。
73%人类认同率!Video-Bench实现视频质量精准打分
上海交大等团队提出视频评估框架Video - Bench,让多模态大模型‘像人一样评判视频’。它构建双维度评估框架,引入链式查询和少样本评分技术,与人类判断73%高相关,为视频生成模型优化提供标尺。
AI优质信息源整理:高质量网站、博主与Twitter资源推荐
文章整理了AI优质信息源,介绍Twitter在AI浪潮中的重要性及筛选优质信息流方法,还列举知乎、B站等平台,以及资讯平台、网站、播客、博客等资源,给出挑选标准和了解领域的技巧。
AutoDev CLI:打造 AI 生成的 AI Agent 质量保障与验证架构
文章介绍AutoDev CLI,它基于AutoDev MPP架构构建,旨在解决上一代AutoDev智能体测试难题。阐述其起步、迭代、演进、集成过程,实现从AI生成代码到验证、生成测试系统的转变,带来可验证、可演化、可移植的优势。