看图测试」共找到 2378 篇相关文章

新闻资讯7

投资人不再只大模型?AI资本新逻辑揭秘|甲子引力X

2025年AI投资进入新阶段,大模型竞赛趋理性,AI Agent等赛道加速发展,投资逻辑重构。甲子引力X圆桌对话中,六位投资人分享投资逻辑调整、新投企业及法,探讨具身智能、物理AI落地等问题。

甲子光年
产品应用8

终于在国产AI上到了Opus的影子|GLM-5深度实测

作者起初怀疑GLM - 5称对标Claude Opus 4.6、定位“系统架构师”的说法,但实测后改观。通过宝可梦策略助手、降噪网站沉浸式交互、求职招聘双边匹配三个测试,展现其系统规划、执行、纠错等能力,像真正架构师。

AI产品黄叔
开源动态7

类R1训练不再只结果对错!港中文推出SophiaVL-R1模型

DeepSeek - R1爆火后,类R1结果奖励训练范式引发推理热潮,但仅以结果对错奖励模型有弊端。港中文联合团队发布多模态推理模型SophiaVL - R1,引入‘思考奖励’机制,还用Trust - GRPO算法解决奖励欺骗问题。

机器之心
算法论文7

多模态模型具备“物理推理能力”了吗?新基准揭示:表现最好的GPT-o4 mini也远不及人类!

来自多机构研究人员构建PhyX基准测试,评估多模态模型物理推理能力。测试显示,即便表现最佳的GPT - o4 mini准确率仅45.8%,远不及人类的75.6%,且模型在多方面存在结构性缺陷。

量子位
新闻资讯8

刚刚,GPT-6正式发布!OpenAI:欢迎来到AGI时代

OpenAI正式发布GPT - 6 Astra和GPT - 6 Astra Pro,宣布AGI时代开幕。该模型训练规模大,能力升级显著,价格公布。基准测试成绩优异,在多方面表现突出,还展示诸多实际应用案例,已有企业开始测试

量子位
新闻资讯7

糟糕,Claude Opus 4.7源代码级提示词曝光!底层设计全被

Claude Opus 4.7如期而至,性能全方位提升,编程暴打Gemini 3 Pro、GPT - 5.1。Claude Code之父分享最佳实践,还曝光系统级提示词,揭示其进化逻辑,此外还提及Mythos的一些危险操作。

新智元
开源动态8

四大顶尖模型对决!6000 字测评带你Deepseek R1有多强

昨天 Deepseek-R1 0528 正式开源,作者让它与 Claude Opus 4、Sonnet 4、Gemini 2.5 Pro 在六个前端开发任务中对决。结果显示,Deepseek-R1 在多数测试表现出色,且价格优势明显。

歸藏的AI工具箱
算法论文8

不让“猪队友”拖后腿!哈深新作 AgentDropoutV2,专治多智能体“传话游戏”翻车现场

多智能体系统中,常有agent出错带偏整体。哈工大联合阿里提出AgentDropoutV2,测试时介入,设‘质检员’审核输出,结合失败案例构建‘避坑指南’,在多测试中显著提效,泛化性强。

深度学习自然语言处理
新闻资讯8

OpenAI深夜放出GPT-5狙击谷歌!基准测试碾压前代模型,价格比Claude更便宜

北京时间8月8日凌晨,OpenAI推出GPT - 5,宣称其更智能、准确,幻觉率低。还推两款新模型,介绍了不同用户套餐。它在编程基准测试表现佳,健康领域能力突出,引发各界热议。

AI前线
算法论文8

像编辑模型不止生成:BIGAI&上交大提出EAR范式,系统测试其视觉规划能力

上海交通大学联合北京通用人工智能研究院提出EAR范式,构建AMAZE基准,分析像编辑模型视觉推理能力。研究发现模型零样本表现弱,扩散式模型更适合视觉规划,CoT效果不稳定等。

AI科技评论