评估基准」共找到 1426 篇相关文章

新闻资讯7

2026 Data+AI 中场纪实:企业决策者,敢把真实业务交给 Agent 吗?| 直播预告

Snowflake携手InfoQ发起直播,探讨企业将真实业务交予Agent的问题。贾天下将分享相关内容,其博客展示有本体团队可实现的能力,还通过生物医学基准测试比较不同方案,为构建企业级AI智能体提供参考。

InfoQ
开源动态8

小模型推理极限在哪里?微博开源3B小模型,比肩顶级闭源

微博新开源的VibeThinker - 3B小模型,将特定能力维度性能推向极限。它在数学竞赛、编程等可验证推理基准上表现优异,成绩直逼顶尖大模型。其训练流程层层叠加,还提出参数压缩 - 覆盖假说。

AIGC开放社区
开源动态8

少 61% Token、多10倍成功率,这个终端 AI 编程代理火了!

现在多数AI编程工具问题多,而在Github上火爆的`oh-my-pi`是运行在终端的AI编程代理,有哈希锚定编辑等实用功能,支持多模型,经基准测试效果好,还能解决实际开发痛点。

开源先锋
新闻资讯7

Kimi总裁张予彤北大实录:我们想要有抽象能力和偏执的人|甲子光年

Kimi总裁张予彤在北大分享,谈AI时代人才标准,偏好有抽象能力和偏执的人。还探讨AI创造新工作、学校课程设计、企业管理等问题,分享Kimi招人标准、组织特点及对行业诸多问题的看法。

甲子光年
新闻资讯7

首个语音智能体端到端测评出炉:Grok登顶,真实场景通过率仅一半

Artificial Analysis推出业内首个语音转语音智能体端到端性能基准τ - Voice,测试真实客服场景能力。结果显示最强S2S模型成功率刚过一半,Grok Voice Think Fast 1.0夺冠,但也面临诸多质疑。

AI工程化
产品应用7

回敬 Codex,Claude Code 推出 /goal 功能,不干完不睡觉

Claude Code随2.1.139版本推出 `/goal` 命令,设定完成条件后可持续工作至目标达成。它与Codex互相借鉴功能,且在设计上采用裁判分离,官方也给出目标制定建议,还带来其他更新。

AGI Hunt
算法论文8

CVPR 2026|用互联网视频替代3D标注:通研院团队打造SceneVerse++「最大规模」真实3D场景数据

北京通用人工智能研究院团队在CVPR 2026接收论文中,提出自动化数据引擎,用互联网视频构建SceneVerse++数据集,规模超现有同类,在3D检测、VQA、VLN任务提升性能,还指明3D空间智能发展方向。

机器之心
新闻资讯7

Claude Opus 4.7深夜上线,评分碾压

周四晚间,Anthropic 宣布 Claude Opus 4.7 全面上市。它在高级软件工程、视觉效果上表现出色,多项基准测试优于 Opus 4.6。还具备新特性,如自动模式等,安全性能与 Opus 4.6 相似。此外,Anthropic 还有相关更新。

机器之心
新闻资讯7

烧Token成KPI,8.5万Meta员工狂刷60万亿Token,争榜一大哥

硅谷兴起“tokenmaxxing”,将token使用量作为生产力基准和竞争指标。Meta超8.5万员工参与烧token竞赛,30天消耗超60万亿。国内阿里、腾讯也有相关动作,科技大佬推波助澜,Anthropic年化收入破300亿美元。

机器之心
开源动态8

清华、西交联合开源发布了Cheers : 一条更简洁、更高效的统一多模态路线

清华、西交联合开源发布CHEERS,提出面向统一多模态理解与生成的架构路线,在保持系统简洁前提下,统一理解与生成任务,继承开源预训练模型知识,在多项基准测试中表现优异,还实现4× token压缩。

机器之心