测试评估集」共找到 2678 篇相关文章

算法论文8

Nature新研究:AI竟然分不清事实和信念

斯坦福大学团队在Nature发表研究,测试15个大模型,发现其区分事实、信念和知识存在严重缺陷。如处理第一人称信念准确率低,对语言线索依赖高,在高风险领域应用令人担忧。

AI工程化
推荐文章8

直播预约 | Evaluation论文分享@ICML&ACL2025

2025年6月11日20:00将直播分享Evaluation论文。多位嘉宾参与,涉及SyncPL奖励建模、文本事实一致性验证、大模型评测方法等多领域论文,涵盖模型优化、基准测试等内容。

深度学习自然语言处理
推荐文章7

[Triton编程][基础] Triton Fused Softmax Kernel详解: 从Python源码到PTX分析

文章详细介绍Triton Fused Softmax Kernel实现,从Naive Softmax到Triton实现,分析访存量、row索引计算、num_stages作用等,还修复官方年久失修代码,性能测试带宽吞吐提升约4倍。

GiantPandaLLM
开源动态8

让AI自动构建AI模型:UCSD 推出 AIBuildAI 智能体,斩获OpenAI MLE-Bench榜单第一

近日,加州大学圣地亚哥分校研究团队开发 AIBuildAI 智能体,可全自动构建 AI 模型。它在 OpenAI MLE - Bench 基准测试 75 个任务上以 63.1% 获奖率居榜首,实现端到端自动化。

机器之心
算法论文8

GPT-4o-Image仅完成28.9%任务!上海AI实验室等发布图像编辑新基准,360道人类专家严选难题

上海人工智能实验室等团队针对图像编辑AI提出问题,推出RISE任务及配套评测基准RISEBench。测试九个视觉编辑模型,结果显示当前模型完成复杂指令能力欠缺,闭源与开源差距大。

量子位
新闻资讯7

92% 工程师都在用 AI 后,Uber 开始给 AI “限额”了

Uber的‘零增长技术栈’解耦容量与业务需求,优化Go运行时性能。还将生成式AI成开发,92%工程师在用,但成本压力大。为此,Uber限额每位开发者,审查代码效果,完善评估指标。

InfoQ
产品应用7

80%代码由Claude合并,Anthropic内部人员点破Agent真相:「Close the Loop」

Anthropic团队研究产品经理Theo演讲指出,Claude已深入其工程流程,超80%代码由它合并。模型角色转变,能力提升,失败率下降。开发者应升级研发战术,如刷新评估基准、精简“脚手架”、闭环设计。

机器之心
算法论文8

让思考更准更长!强化学习新算法FIPO来了

阿里通义实验室Qwen Pilot团队发布系列博客剖析大模型强化学习机制与局限,推出新算法FIPO。该算法引入Future - KL机制,解决‘推理长度停滞’问题,在多项测试表现优异,还介绍招聘信息。

千问大模型
开源动态8

Insanely Fast Whisper:开源社区让音频转录速度提升19倍

Insanely Fast Whisper工具将OpenAI Whisper转录速度提升19倍,采用Flash Attention 2技术,零质量损失。它成多语言支持、说话人分离等实用功能,还支持跨平台,免费运行。最初是基准测试demo,值得音频处理用户关注。

AI工程化
推荐文章7

翁荔最新博客:我们可能高估了模型,却严重低估了那层“脚手架”

前OpenAI安全研究副总裁翁荔在新博客聚焦AI领域Harness Engineering。她认为Harness是决定模型在现实任务中走多稳、多远的‘脚手架’,并梳理其演进路线,也指出研究面临评估、安全等瓶颈。

DeepTech深科技