自主智能测试」共找到 5117 篇相关文章

新闻资讯7

2025年了,AI还看不懂时钟!90%人都能答对,顶尖AI全军覆没

AI基准ClockBench测试AI读模拟时钟能力,人类平均准确率89.1%,11个主流大模型最好仅13.3%。研究展示了LLM局限性,分析了可能原因,还对比了不同模型表现及在各类问题上的差异。

新智元
产品应用8

Claude Code团队谈产品哲学,自己是第一用户

Claude Code团队分享产品开发哲学与多智能体协作玩法。其迭代快,靠独特流程:成员用它原型化功能,经内部试用调整。用户使用偏好多样,SDK易用,团队鼓励做自己产品的第一用户。

AGI Hunt
开源动态8

Meta刚刚开源DINOv3,横扫60+任务,无标注封神!

今天凌晨,Meta开源视觉大模型DINOv3,采用自我监督学习,无需标注数据。它在60多个视觉任务测试中表现出色,超越同类模型。还引入后处理优化策略,扩展应用场景,能适应多种部署环境。

AIGC开放社区
新闻资讯7

The Batch: 844 | AI 天气预测加速推进

美国国家飓风中心与 Google 的 Weather Lab 合作,利用新模型预测风暴。该模型能比传统方法更准确预测风暴形成、路径和强度,最长提前 15 天,测试表现优于 Google 之前的 GenCast 模型和 ENS 模型。

DeeplearningAI
开源动态8

阿里云通义点金发布DianJin-R1金融领域推理大模型,32B模型荣膺榜首

阿里云通义点金团队与苏州大学合作推出DianJin-R1金融领域推理大模型,介绍其开源数据集与模型、基于通义点金平台的数据合成,展示了其在性能测试中的优异表现,推动金融科技智能化进程。

机器之心
新闻资讯8

AI 创业怎么做?500+ 技术领导者给出了他们正在实践的答案| TGO 杭州十周年庆 & GTLC 杭州站

2026年6月27日,TGO杭州十周年庆·GTLC全球科技领导力大会杭州站举办,近二十位嘉宾从多领域分享。如汪源指出智能体上下文工程是瓶颈,许式伟称AI是企业“外挂”等,还有创业者展示产品。

InfoQ
新闻资讯8

8.99万的人形机器人来了!中国版Figure发力,价格打穿地板

星尘智能发布T1新品,价格8.99万元起,6月发货。它强调商业化能力,能「一机多用」,打穿多场景。星尘自研「AI模型 - 具身OS - 绳驱本体」架构,已量产,订单多,领先同行。

新智元
新闻资讯7

深度解读 AGI-Next 2026:分化、新范式、Agent 与全球 AI 竞赛的 40 条重要判断

文章总结了 AGI-Next 2026 活动上核心观点。指出模型分化是趋势,有 To B 和 To C 等场景差异;自主学习是新范式;模型即 Agent,Agent 即产品;还分析了中美 AI 竞赛的现状与挑战。

海外独角兽
产品应用8

世界最强医疗模型百川M3发布:AI医疗,奇点已至

百川智能发布并开源全球最强医疗模型Baichuan - M3,各项指标SOTA且超越人类医生平均水平。它告别机械‘背医书’,学会主动追问、排查病因,解决AI‘胡说八道’问题,准确度超GPT - 5.2 - High。

新智元
产品应用8

字节手里的牌,比收购 Manus 更狠 - AnyGen 体验一周有感

本文作者分享使用字节海外推出的通用AI Agent产品AnyGen的体验,介绍其功能亮点、多场景测试效果,对比竞品,认为它定位职场场景,性价比高,或引领通用Agent竞争转向用户体验。

特工宇宙