真实世界测试」共找到 2937 篇相关文章

新闻资讯8

联手诺基亚入局6G,老黄要制定全球标准!GTC最新演讲揭秘:「美国科技的未来」就靠这6张王牌

老黄在华盛顿 GTC 大会演讲,英伟达要和诺基亚合作干 6G,重新构筑世界通信系统。演讲涉及 6 大核心,包括利用物理人工智能和数字孪生技术重塑美国工业化等,还介绍了加速计算、AI 变革等多方面内容。

AI寒武纪
推荐文章7

GLM-4.6 vs Claude 4.5:当AI编程模型能力趋同,会用比选什么更重要

文章对比GLM - 4.6和Claude 4.5在AI编程中的表现。用两套提示词测试,发现二者能力接近,GLM - 4.6性价比高,还给出Claude Code + GLM - 4.6的组合使用方法,建议聚焦做产品而非纠结工具。

花叔
产品应用8

2.12页/秒,MinerU2.5太快了,1.2B硬刚腾讯、阿里

GPT - 4o等刷新OCR榜单,但产业界仍面临文档图像处理难题。MinerU2.5提出1.2B轻量级文档解析模型,采用创新解耦范式,在多基准测试表现出色,单卡吞吐快,还给出可借鉴创新点。

CourseAI
新闻资讯8

刚刚,GPT-5 横扫编程奥林匹克,5 小时打穿 12 题!人类最强队伍只能做出11道

2025年国际大学编程竞赛世界总决赛(ICPC)上,GPT - 5和OpenAI实验推理模型5小时解完12道题,超越人类最强队伍。Google DeepMind的Gemini 2.5 Deep Think获10/12。此成绩展示推理系统惊人进步。

AI进修生
产品应用8

全面拥抱AI Agent,从0到1动手用GPTBots搭建企业数字助理智能体,办公效率翻倍~

文章指出当下Agent/Agentic AI是热门风口,企业级智能体受资本追捧。重点分享运用GPTBots平台从0到1搭建企业数字助理智能体,涵盖架构、流程、设计、测试等内容,介绍选择该平台的原因及实践成功关键。

PaperAgent
推荐文章8

对话RoboScience邵林:VLOA大模型如何突破具身智能泛化瓶颈

本文对话RoboScience联合创始人邵林,探讨VLOA大模型突破具身智能泛化瓶颈。他介绍了模型优势、设计思路,对比VLA,还谈及范式、难点及落地场景等,强调以人中心、做有温度技术,重视模型落地。

甲子光年
产品应用7

全球首款AI原生游戏引擎再进化:GTA6再不来,我们就AI一个

GTA 6跳票成梗,其场景常被用于研究。一个多月前全球首个AI原生UGC游戏引擎发布,如今Mirage迭代为更强大的Mirage 2,支持多样场景,与Genie 3有不同优势且已上线,不过仍有技术问题待解决。

机器之心
产品应用7

AutoGLM 2.0 深度解析:云端智能体的技术跃进与现实挑战

2025 年 GUI Agent 赛道升温,多数产品依赖本地执行。智谱 AI 在 8 月 AutoGLM 2.0 闭门交流会上展示新路径,其由国产模型驱动,具多能力,在 Agent 云端执行架构、训练方式等方面有突破,也面临一些挑战。

特工宇宙
新闻资讯7

深度揭秘OpenAI如何让GPT-5「技术性」超越Claude:悄悄跳过最难的23道题

OpenAI发布会上称GPT-5代码能力全球第一,其在SWE-bench Verified基准获74.9%通过率,略高于Claude Opus 4.1的74.5%。但OpenAI未做23道难题,若计入,GPT-5实际通过率或低于Claude。

新智元
新闻资讯7

GPT-5、Grok 4、o3 Pro都零分,史上最难AI评测基准换它了

AAI机构提出新基准FormulaOne,让GPT - 5、o3 Pro等前沿大模型集体得零分。该基准含220个图结构动态规划问题,分三类难度。测试结果显示,模型在深层及最深层难度表现差,引发关注。

机器之心