测试平台」共找到 2960 篇相关文章

新闻资讯7

训练机器人方式对了吗?英伟达DreamZero双榜第一新反思

NVIDIA的DreamZero在RoboArena和MolmoSpaces基准测试双登顶。分析文章《Why is DreamZero so good at robotics?》从多维度拆解其表现突出原因,质疑传统认知,如数据量并非万能,模型规模和信息输入方式也很关键。

机器之心
推荐文章7

更多非共识,Test-time Scaling 能否一直大力出奇迹?

机器之心PRO会员通讯解读三个AI业内要事,包括Test - time Scaling非共识、Skills与MCP谁是大模型的HTTP时刻、OpenAI打造最强平台等问题,探讨流行路线局限、Scaling改进方向等。

机器之心
新闻资讯8

特朗普按下「创世纪」核按钮,AI曼哈顿计划正式启动!

2025年11月24日,特朗普正式签署「创世纪计划」,被比作AI版「曼哈顿计划」。由美国能源部牵头,整合资源打造「美国科学与安全平台」,剑指六大领域,要求9个月内构建AI科研闭环。

新智元
推荐文章7

2025 年 InfoQ 趋势报告:云计算和 DevOps 篇

InfoQ 2025 年云计算和 DevOps 趋势报告展示技术采用阶段趋势图,介绍新增或更新技术。涉及 AI Agent、MCP、平台工程等趋势,指出云 DevOps 生态成熟有新挑战,新阶段需整合多种要素。

InfoQ
产品应用8

OpenAI 推出 GPT-5 驱动的安全卫士Aardvark:Codex 绝佳搭档

OpenAI推出由GPT - 5驱动的自主安全研究智能体Aardvark,用于软件安全保障。它能持续分析代码仓库,识别并修复漏洞,目前在内部及合作伙伴代码库效果良好,正处私有测试阶段。

AGI Hunt
产品应用8

挑战Claude code和Cursor:阿里Qoder对标全球,AI编程迎来“上下文”革命

AI编程工具爆发式增长,‘上下文’成实用化难题。阿里推出Qoder平台,结合大模型与Agent,可深度检索代码、理解上下文。本文采访Qoder团队工程师,解析其定位、成本、技术路线等关键问题。

InfoQ
产品应用8

Claude Sonnet 4.5 发布,30 小时自主编码刷新行业纪录

Anthropic发布Claude Sonnet 4.5,号称最强编程模型,自主编码达30小时。它性能超GPT-5等,Claude Code升级,文件处理、API能力增强,价格不变,多平台集成,还通过白盒审计提升安全性。

AGI Hunt
开源动态8

The Batch: 855 | 为智能体而生

总部位于北京的 Moonshot AI 发布 1 万亿参数的 Kimi K2 系列大语言模型,包括预训练和微调版本。它输入输出能力强,架构独特,在多基准测试领先,支持工具调用,多家服务商已集成。

DeeplearningAI
开源动态8

V4Flash 的价格、Opus4.8的能力,Ox Alpha (牛来)正式开源!

Ox Alpha 匿名模型上线 OpenRouter 后表现亮眼,消耗大量 tokens 并终结 DeepSeek 霸榜纪录。官方揭晓其为智谱 GLM - 5.3 Flash,价格低、能力强,经多场景测试,多模态理解等维度达顶尖水平。

歸藏的AI工具箱
新闻资讯7

贴广告的ChatGPT,一夜之间让全球网友破了防

周六凌晨,OpenAI 公告计划在 ChatGPT 加广告,测试将在美国率先启动。此前已上线低价订阅版 ChatGPT Go。此外,马斯克与 OpenAI 官司相关文件解封,案件将进入审判。

机器之心