「质量评估」共找到 1290 篇相关文章
给你一群顶尖AI,如何组队才能发挥最大战力?UIUC用一个新的多智能体协作基准寻找答案
现有的评测基准无法衡量多智能体系统内部的协作效率、沟通质量和竞争策略。为此,伊利诺伊大学厄巴纳 - 香槟分校的研究者推出 MultiAgentBench,能全面评估 LLM 多智能体系统协作与竞争能力。
DoorDash 如何打造了一款不完全依赖大型语言模型(LLM)的 AI 购物助手
DoorDash 分享对话式 AI 助手 Ask DoorDash 的架构,它借助 LLM、AI 代理等构建系统。测试显示其提升了结账转化率等指标,还构建自动评估框架改进质量衡量,架构分离协调与业务功能。
腾讯开源混元Image 2.1:2K高清+完美文字嵌入,图文天花板来了
今天凌晨,腾讯开源最新图像模型混元Image 2.1,支持原生2K分辨率与长提示词,文字嵌入能力强,适用于专业场景。还开源加速版模型权重和提示词改写模型,评估显示其性能达开源最优,接近闭源商业模型。
The Batch:836 | 基准测试成本攀升
独立AI测试实验室披露评估推理模型成本上升。这些模型生成“思维链”提升输出质量,但计算需求增加,成本上升使资源有限组织难复现结果,且新模型定价、按需分配推理token也让成本更复杂。
76%程序员依赖AI?代码安全挑战解析
GitHub报告显示76%程序员用AI编程,代码安全成挑战。腾讯等团队建A.S.E评测框架,有项目级代码生成等优势,能评估代码安全、质量与稳定性,未来将扩充功能,邀开发者参与。
利用大模型从开源情报中自动提取检测规则:LLMCloudHunter,有开源
随着网络攻击增加,威胁情报成主动安全关键。以色列本古里安大学发布LLMCloudHunter框架,用大模型从开源情报自动生成检测规则,评估显示其规则质量高,且大部分能编译成Splunk查询,软件已开源。
中山大学&华为联合提出 Issue Resolution 数据集构建神器SWE-Factory:每条只要$0.024
中山大学和华为联合提出低成本开源方案 SWE-Factory,可自动收集代码打造高质量代码评估数据集。它能解决传统构建流程繁琐、依赖人工的问题,实现全流程自动化,还构建了 SweSetupBench 数据集,表现出色。
工具增强的多模态LLM综述
多模态大语言模型(如GPT - 4V)虽有强大图文理解能力,但受数据稀缺、复杂任务表现不佳和评估标准不统一限制。论文提出为MLLM集成外部工具,构建全景图,覆盖多维度,还指出挑战与对策。
揭秘!腾讯如何训练多智能体像专家一样设计游戏场景
腾讯游戏提出游戏场景自动布局生成系统IntelliScene 2.0,利用图像引导生成3D场景。它构建多智能体工作流,结合高质量数据集,经模型微调、视觉解析等步骤生成场景,经评估效果良好,为AI生成三维信息提供新路径。
谷歌提出破局Self-Consistency计算瓶颈!LLM推理效率革命,推理加速不牺牲精度
Google Research等团队提出CISC,通过给推理路径赋予置信度权重,少量样本即可超越传统自洽性效果,平均减少40%计算成本,还提出WQD指标揭示模型自评估能力本质。