「智能体评估」共找到 4021 篇相关文章
一句话生成无限逼真3D场景!匹兹堡大学新作直击VLM空间推理软肋丨CVPR'26
VLM在3D空间推理上表现不佳,且缺乏合适测试基准。匹兹堡大学团队提出InfiniBench框架,用LLM Agent迭代优化和聚类策略,可按需生成3D场景,还能精准定位大模型空间推理缺陷。
TDSQL Boundless:AI时代的多模态数据库
在AI与数据分析处理技术融合的当下,传统数据库架构面临诸多挑战。腾讯云TDSQL Boundless推出,通过统一架构处理多模态数据。本文从核心架构、关键技术特性及对未来数据平台建设的启示三方面解读。
ICLR 2026 Oral | 告别多步去噪!清华团队推出MVP,实现机器人动作单步极速生成
清华大学智能驾驶课题组 iDLab 与加州大学伯克利分校人工智能研究院 BAIR联合发表研究,提出 MVP 策略。它引入瞬时速度约束解决均值流学习问题,设计复合生成与选择机制,在多任务测试中表现出色。
网易游戏 Tmax 平台实践:基于 Fluid 的云原生 AI 大模型推理加速架构
网易游戏打造 Tmax AI 机器学习平台,但大模型推理业务规模爆发带来资源弹性等挑战。经评估,选用 Fluid + AlluxioRuntime 构建三层架构,有自动预热等配置,带来性能、成本等多方面收益。
1美元时薪?这才是打工人的「梦中情模」
Anthropic 的 Opus 4.6 好用但贵,MiniMax 推出 M2.5 与之抗衡。M2.5 在多方面表现卓越,参数量小,成本低,推理速度快,还经实测能成打工人得力助手,其背后有独特训练体系。
想让机器人春晚包饺子?阿里达摩院:别急,先把「大脑」优化一下
阿里达摩院推出 RynnBrain 模型,从底层出发将时空记忆和物理空间推理训进模型,在 16 项具身 Benchmark 上达 SOTA。还开源 7 个模型,解决通用大模型在物理世界的局限,在多项任务表现出色。
Vibe Coding“血洗”开源,社区吵翻了:封杀菜鸡 AI 开发者?不如给维护者打钱!
多位研究人员在预印本论文中指出,氛围编码或摧毁开源生态,使官网访问量下滑、社区论坛使用量骤减。研究称要维持开源规模需改革维护者报酬方式,同时分析了其对开发效率、开源软件可持续性的影响,社区对此看法不一。
大模型Agent的核心还是prompt? 目前有什么挑战?
文章指出大模型Agent核心并非Prompt,而是工程化架构设计、工作流编排与数据闭环。介绍Flow Engineering等概念及工具,分析规划、记忆、工具使用要点,还谈及开发面临的延迟、稳定等挑战,并给出应对建议。
黑森林FLUX.2 Klein开源,亚秒级高质量图像生成和编辑,普通电脑就能跑
黑森林实验室发布开源的FLUX.2 Klein模型家族,是紧凑架构,将高质量图像生成与编辑速度压缩至亚秒级,在消费级显卡实现旗舰性能。其统一架构打破生成与编辑壁垒,还与NVIDIA合作优化。
LLM 竟然会内省!Anthropic 整了个大活:首次揭开 AI 意识
Anthropic最新研究《大语言模型中涌现的内省意识》,首次通过直接操控模型内部状态验证AI能否觉察自己思想。研究采用概念注入技术,发现AI有内省能力,且不同模型表现有差异。