自动评测体系」共找到 1694 篇相关文章

新闻资讯7

DoorDash 如何打造了一款不完全依赖大型语言模型(LLM)的 AI 购物助手

DoorDash 分享对话式 AI 助手 Ask DoorDash 的架构,它借助 LLM、AI 代理等构建系统。测试显示其提升了结账转化率等指标,还构建自动评估框架改进质量衡量,架构分离协调与业务功能。

InfoQ
推荐文章8

现有AI都是假实时!Thinking Machines发布交互模型,离真正的贾维斯真的近了

Thinking Machines发布交互模型,切入与AI交互方式问题。该模型能原生支持实时交互,由交互和后台模型组成。架构设计独特,解锁多项功能,评测表现佳,但也存在长会话、计算部署等局限。

AI寒武纪
新闻资讯7

解道奥赛题成本5000美元?陶哲轩警告,AI下一步要规模化的「更便宜」

谷歌新一代 Gemini 进阶版在 IMO 竞赛达金牌水平,华人数学家陶哲轩对此关注且担忧。他认为评估 AI 表现应谨慎,AI 发展需从定性转向定量,要‘降本增效’,未来标准化评测很重要。

机器之心
开源动态7

深度体验|京东开源轻量化通用Agent产品 jdgenie,开箱即用!二次开发及踩坑指南。

本文体验京东开源的端到端多智能体系统JoyAgent - JDGenie,它是产品级多智能体协同系统,开箱即用、支持本地部署。介绍其原理架构、本地部署测试步骤、二次开发方式,还指出特点与不足。

AI大模型应用实践
开源动态7

为AI打造的知识图谱服务器MemoryMesh

MemoryMesh是专为AI模型设计的知识图谱服务器,适用于多种结构化数据场景。它有动态模式驱动工具等特性,可自动生成管理工具,还配备记忆查看器,提供安装指南和提示词建议。

GitHubStore
算法论文8

高潮从第几秒开始?GaMMA 让多模态大模型真正「听懂」音乐时间线

现有多模态大模型难以理解音乐时间线。复旦大学与字节跳动团队提出 GaMMA,采用双编码器融合网络,经三阶段训练,还推出 MusicBench 评测基准。实验显示,GaMMA 在多基准上表现优异,刷新 SOTA。

机器之心
开源动态8

别养龙虾了,硅谷Agent新潮流是「爱马仕」

免费开源的Hermes Agent上线一个月霸榜GitHub Trending,标星超6.66万。它强调持续学习和自我进化,能自动提炼可复用技能。安装门槛低,支持多系统,还原生支持个人微信。

量子位
产品应用7

OpenClaw 2026.3.8更新:安全认证及部署回滚能力提升

OpenClaw发布2026.3.8版本更新,聚焦安全性与bug修复。关键更新有ACP来源验证,让代理确认指令来源;更新前自动创建配置快照,可回滚设置。还修复了Telegram重复回复等问题。

AI工程化
开源动态8

字节跳动开源视频生成模型Alive:12B参数,个人电脑也能跑

字节跳动开源视频生成模型Alive,12B参数,支持四种模式,硬件门槛低。在评测中表现出色,技术架构精心设计,解决音视频同步等问题,虽有小瑕疵,但更适合普通玩家。

AI工程化
开源动态7

不写、不看、不审查:这家安全公司决定不再让人类碰代码,还把这套模式开源了

2026年2月,安全公司StrongDM公开“软件黑灯工厂”式生产线成果,人类不直接写代码和审查,由Agent自动生成。该模式开源,虽有开发者指出问题,但获学界认可,不过面临成本高的现实问题。

InfoQ