智能体评估」共找到 4013 篇相关文章

新闻资讯7

抢天才还是拼算力?前 Llama 推理负责人详解 AI 的真实天花板

前 Llama 推理负责人 Ross Taylor 在播客访谈中指出,AI 竞赛中的混乱和挖角是噪声,最终会被指数级算力淹没。他阐释了算力指数曲线决定竞赛天花板,强调系统性实验、高质量评估的重要性。

机器之心
开源动态8

Qwen-Scope:看穿大模型的“小心思”

Qwen-Scope是基于Qwen3和Qwen3.5系列模型训练的可解释性模块,通过在隐藏层插入SAE提取可解释特征。它能分析模型行为、优化模型,应用于推理、数据、训练、评估等场景,可前往Huggingface或魔搭验。

千问大模型
产品应用8

AI 驱动的数据库心脏:如何让云原生「自我进化」

本文深度解析腾讯云自研云原生数据库 TDSQL - C,它融合 Serverless、AI 技术,解决传统数据库痛点。具备存算分离、智能伸缩、AI 预测等特性,能降本增效,还可全球部署,为企业数字化出海提供数据基座。

InfoQ
推荐文章7

[Triton编程][基础]vLLM Triton Merge Attention States Kernel详解

文章详细介绍vLLM中Triton Merge Attention States Kernel的实现,与PyTorch原生实现对比,该Triton kernel最高可实现3 - 5倍以上算子加速。内容涵盖Merge Attention States概念、PyTorch实现、Triton基础算子、分析及性能评估等。

GiantPandaLLM
产品应用7

把远程控制封装成MCP,这个国民神器发力了!

向日葵推出重要更新向日葵MCP,将远程控制能力封装成标准接口,让AI替用户远程操控电脑。它功能多样,配置简单,如智能检索设备、支持多种会话类型等,还能一站式搞定多种远程操作。

开源先锋
新闻资讯7

AI 太烧钱!微软选择「倒戈」DeepSeek

微软宣布Copilot Cowork全球上线并引入按使用量计费机制,还评估引入DeepSeek V4。Agent普及使AI成本问题凸显,微软进行系统性重构,构建质量保障系,成本工程化能力成竞争新焦点。

AI科技评论
开源动态8

刚刚,机器人练成了宁次的「白眼」:∞帧画面边看边3D重建我们的世界!

蚂蚁灵波开源的LingBot - Map模型实现无尽流,可看∞帧视频稳定实时3D重建。它打破“既要实时、又要记路、还要省显存”的不可能三角,在多项测试中表现优异,补齐具身智能关键拼图。

量子位
算法论文8

谷歌最新发表的Science论文,颠覆了人类对ASI的想象

谷歌等机构研究者在《科学》发文,提出真正智能爆炸已发生,是多元、社会性且与人类深度缠绕。推理模型内部涌现‘思想社会’,当下人机协作进入‘半人马时代’,还探讨了AI扩展、对齐及治理问题。

新智元
产品应用8

当黄仁勋将存储定义为「AI运行内存」,基础设施该如何实现物种进化?

AI算力需求使全球内存市场疯狂,黄仁勋称存储技术需重构。XSKY星辰天合发布AIMesh方案,战略转向数据智能,其方案可破传统存储架构三堵墙,还坚持中立,助力企业数据转化。

机器之心
新闻资讯8

45年数论猜想被GPT-5.2 Pro独立完成证明,陶哲轩:没犯任何错误

2025年1月17日,研究者Neel Somani让GPT-5.2 Pro解1980年提出的埃尔德什猜想第281号问题,证明经陶哲轩验证成立。此外,网友发现有更简单经典解法。陶哲轩提醒评估AI真实成功率有报告偏差。

量子位