智能测试平台」共找到 5757 篇相关文章

新闻资讯7

GPT-5.2破解数论猜想获陶哲轩认证!OpenAI副总裁曝大动作:正改模型核心设计,吊打90%研究生但难出颠覆性发现

OpenAI 发布由 GPT - 5.2 加持的科研平台 Prism 并免费开放。副总裁 Kevin Weil 称目前模型难有颠覆性发现,但能加速科研。GPT - 5 能力超 90% 研究生,OpenAI 将优化其设计,让它更谦逊并自我核查。

InfoQ
算法论文8

准确率腰斩!大模型视觉能力一出日常生活就「失灵」

EgoCross项目团队聚焦跨域第一视角视频问答评测,揭示现有MLLM在多场景泛化瓶颈。团队提出跨域第一视角视频问答基准EgoCross,经测试揭示模型短板,验证改进方法潜力,研究入选AAAI 2026且数据集等已开源。

量子位
算法论文8

为什么给机器人装上昂贵的触觉传感器,反而让它变笨了?

伊利诺伊大学香槟分校等多校合作研究发现,当前机器人学习主流的多传感器融合算法(特征拼接)在处理任务时存在局限,给机器人加触觉数据会使抓取成功率暴跌。研究提出组合策略解决问题,经测试效果显著。

机器之心
新闻资讯8

AI教父Hinton末日警告!你必须失业,AI万亿泡沫豪赌才能「赢」

AI教父Hinton警告,这场AI万亿美元豪赌,只有裁员才能盈利。他指出超级智能AI将取代人类、引发失业,还批评部分巨头重商业竞争轻安全。此外,分析显示AI重创部分创意执行工作,不同岗位受影响程度有别。

新智元
新闻资讯7

谷歌新版Gemini马甲被扒! LMArena实测:唯一能看懂表的AI, GPT-5乱答

谷歌Gemini 3.0疑似上线LMArena,其Pro和Flash马甲被扒。实测中,Gemini 3 Pro能精确看表,GPT - 5等表现不佳;SVG测试有提升但也有不足;还能作曲。不过评测方式老套,希望有新花样。

新智元
新闻资讯7

老黄太难了!英伟达Q2营收467亿美元创纪录,股价盘后还跌了5%

英伟达Q2财报营收和每股收益超预期,达467亿美元,数据中心业务贡献大,Blackwell平台表现亮眼。尽管给出高营收指引并扩大回购授权,股价盘后仍下跌。各业务均有进展,正重新定义计算产业规则。

量子位
算法论文8

GPT-5刷屏吊胃口之际,英伟达发出暴论:小型语言模型才是未来

英伟达新论文指出,未来属于小型语言模型(SLM),挑战了智能体需用大型语言模型(LLM)的假设。SLM参数量低于100亿,有低延迟、低成本等优势,还给出从LLM到SLM迁移路线图。

AGI Hunt
7

首届国产机器人足球赛,最忙的是担架

国内首个机器人主体足球赛在北京举行,四支高校战队用加速进化T1平台参赛,全程机器人自主行动。清华火神队夺冠,不过比赛中机器人失误多。主办方预计5年提升其水平,赛事目标是2050年机器人队夺世界杯。

量子位
开源动态7

开源版 Cowork 项目在 X 爆火,创始人:感谢 Cowork,让我们三年的探索被看到

Anthropic的智能体工具Cowork在X上爆火,CAMEL AI的开源项目Eigent作为平替也跟着火了一把。文章复盘了CAMEL AI从2023年发布CAMEL框架到Eigent项目的三年探索经历,介绍了Eigent的产品设计、技术架构、应用场景及发展情况。

Founder Park
产品应用9

我给阶跃星辰 Step 5 Preview 出了一道工程题

本文作者池建强参与阶跃星辰新一代旗舰大模型Step 5 Preview小范围内测,设置带两层bug和隐藏需求的编码工程题,与Qwen 3.8 Max、Kimi K3对比测试,分享实际项目使用体验,给出客观评测。

MacTalk