「评测agent」共找到 3185 篇相关文章
Anthropic深夜叫停“无限套餐”!一份万亿Token账单,揭开AI行业烧钱的恐怖真相!
文章以Anthropic叫停‘无限套餐’为例,揭示AI行业烧钱真相。指出‘模型降价能盈利’是错觉,存在‘没人用旧模型’和‘AI Agent耗Token’两大陷阱,还给出三条破局出路。
让小爱音箱超越「指令-响应」模式,开启真正智能交互新时代
2017年智能音箱诞生,却被困于「指令 - 响应」模式。此次Open - XiaoAI进化,接管小爱音箱“耳朵”和“嘴巴”,通过多模态大模型和AI Agent释放其潜力,还给出项目运行教程等。
吴恩达推出 Context Hub,专治 AI 写代码时的「瞎编」问题
吴恩达推出开源工具 Context Hub,解决 AI 写代码时的「API 幻觉」问题。它通过喂最新文档,让 Agent 按需取用,还能做批注。与 MCP 路线工具不同,它按需拉文档,且引入反馈机制更新文档。
ACL 2026 | OPeRA Dataset: LLM真的能模仿人类行为了吗?首次系统评估LLM的人类行为模拟能力
美国东北大学等机构研究者提出OPeRA数据集,采集真实用户在线购物行为,支持系统评测LLM个体化行为预测能力。实验显示当前主流LLM在模拟人类行为上表现有限,揭示其能力边界。
刚刚,OpenClaw登顶GitHub软件星标历史第一!已超越Linux
仅两月,本地AI框架OpenClaw击败Linux,登顶GitHub星标第一。它是开源本地运行的AI Agent框架,能接入通讯工具,虽引发安全危机和限制,却热度不减,反映开源社区趋势变化。
Anthropic 反杀 OpenAI,LLM 企业市场新格局
Menlo Ventures 报告显示,Anthropic 超越 OpenAI 成企业 LLM 市场新王者。代码生成成杀手级应用、强化学习成扩展路径、Agent 时代到来支撑其胜利。企业重性能,支出从训练转向推理。
ACL 2025 | 大模型乱试错、盲调用?KnowSelf让智能体有「知识边界感知」能力
ACL 2025 论文《Agentic Knowledgeable Self-awareness》聚焦提升智能体「知识边界感知」能力。KnowSelf 方法让智能体自主调节知识运用,实验显示其性能优,还探索了智能体自我认知多方面影响。
爆火的 DeepSeek Harness,全网最全小白接入教程!
DeepSeek Harness 在 GitHub 上线不到三天 Star 数破 10 万。文章给出小白接入教程,介绍三种部署思路,包括手动安装、用 Agent 一键安装、一键安装桌面版,还给出其与多个框架的测评对比。
现有AI都是假实时!Thinking Machines发布交互模型,离真正的贾维斯真的近了
Thinking Machines发布交互模型,切入与AI交互方式问题。该模型能原生支持实时交互,由交互和后台模型组成。架构设计独特,解锁多项功能,评测表现佳,但也存在长会话、计算部署等局限。
从「片段生成」到「长视频漫游」:OmniRoam探索轨迹可控的长视频生成新范式
在生成式视频发展中,长时序视频生成面临挑战。研究者提出 OmniRoam 新方法,通过全景表示和分阶段生成框架,提升视频时空一致性,还构建数据评测体系,实验表现优,有效率和 3D 应用潜力。