基准集」共找到 1340 篇相关文章

推荐文章8

AI 怎么自我改进?Lilian Weng 的答案是:先写好Harness

提出 Agent 基本公式的 Lilian Weng 探讨 AI 递归自我改进,强调‘harness’重要性,介绍其设计模式、优化方法,还提及未来挑战与有用基准。如 harness 工程额外包含工作流设计等,优化方式多样但也面临评估器弱等问题。

AI工程化
开源动态8

Qwen-AgentWorld:一个语言世界模型,模拟七大Agentic领域

今天正式发布 Qwen-AgentWorld,它是首个原生语言世界模型,能在七大领域模拟智能体交互环境。同步发布 AgentWorldBench 评测基准。Qwen-AgentWorld 经三阶段训练,在评测中表现出色,还探索两种范式增强通用智能体能力。

千问大模型
算法论文8

ICSE 2026杰出论文 | 突破代码模型真实工程落地瓶颈,北大团队提出SEAlign对齐框架:显著提升软件工程智能体决策质量

现有代码模型在经典基准表现好,但在真实软件工程环境表现差。北大金芝、李戈团队提出 SEAlign 框架,通过识别与对齐智能体轨迹关键决策点,提升模型在真实工程任务表现,成果获 ICSE 2026 杰出论文奖。

机器之心
开源动态8

超越VLA与世界模型,银河通用发布LDA,全谱系数据跑通Scaling Law

近期具身智能领域竞争激烈,银河通用联合多机构发布 LDA-1B 模型,能统一利用各类具身数据。它在基准测试中表现出色,代码已开源,还解决了数据格式、质量等问题,实战效果也很突出。

机器之心
算法论文8

警惕!大模型成本倒挂:你正在为模型的多余「思考」买单

一项来自多所高校和微软研究院的研究揭示AI模型价格倒挂现象,低定价模型可能产生更高实际开销。研究聚焦8个前沿推理模型和9个主流数据,指出推理token是成本倒挂主因,且实际开销难以预测。

机器之心
产品应用8

全球第一,13个SOTA!我们找到了龙虾界掌管GUI的神

明略科技推出自研 GUI-VLA 智能体模型 Mano-P 1.0,不依赖 API 对接与浏览器场景,可操作桌面软件与网页界面。它在 13 个多模态基准榜单达 SOTA,支持本地运行,数据零上云,采用分阶段开源策略。

机器之心
推荐文章8

AutoResearch实战:让AI自己训YOLO,mAP从0.729到0.773

本文作者复盘用AutoResearch训练YOLOv8模型全过程。先介绍其要素框架,选YOLOv8 + NEU - DET做实验,经V1轻量验证后升级到V2完整闭环,64轮实验后mAP从0.729提至0.773,还总结工程结论并给出迁移场景建议。

机器学习AI算法工程
新闻资讯8

Google悄悄下了一盘大棋:一天三个端侧AI项目同时爆发

Google 一天内三个端侧 AI 项目爆发,包括离线听写 App Eloquent、端侧 AI 示例 AI Edge Gallery 和端侧大模型推理运行时 LiteRT-LM。云端大模型竞争趋同,端侧 AI 是差异化战场,Google 全栈布局有优势。

AI Reading Hub
开源动态8

Memento-Skills VS OpenClaw 不改模型也能进化

Memento - Skills让AI Agent自己设计自己,通过部署时学习进化,不动模型参数,将经验写进技能库。经测试,在HLE和GAIA基准测试中准确率大幅提升,与OpenClaw等定位不同,有多种部署方式,不绑定模型。

CourseAI
产品应用8

安谋科技Arm China“玲珑”VPU IP来了!瞄准这些应用场景

安谋科技Arm China推出面向AI应用的新一代VPU IP——“玲珑”V560/V760。该产品性能硬核,是“六边形战士”,高性能、高鲁棒性等六大特性于一身,已完成首批客户授权,助力AI时代视频处理。

芯师爷