o3 - pro」共找到 2511 篇相关文章

产品应用7

夸克 AI 对话助手的邪修打开方式:一句话直通网盘,看电影、找资料全拿下

阿里“C计划”首个成果,夸克App深度整合对话助手,用Qwen3 - Max模型。可随意切换模式,其独特之处是提问资料或电影,能直返夸克网盘链接,“搜、用、存”一气呵成,与其他AI助手不同。

AI进修生
新闻资讯7

2025年了,AI还看不懂时钟!90%人都能答对,顶尖AI全军覆没

AI基准ClockBench测试AI读模拟时钟能力,人类平均准确率89.1%,11个主流大模型最好仅13.3%。研究展示了LLM局限性,分析了可能原因,还对比了不同模型表现及在各类问题上的差异。

新智元
产品应用7

我让10个大模型又参加了完整版数学高考,第一名居然是它。。。

作者让10个大模型参加完整版数学高考,单独制定规则,邀朋友协助测试。结果令人意外,单选题第6题成噩梦,多模态题大模型几乎全军覆没。讯飞星火和豆包145分并列第一,Qwen3屈居第三。

数字生命卡兹克
产品应用7

GPT-5.4发布,最适合OpenClaw的天选模型登场了。

GPT-5.4发布,作者认为它是OpenClaw天选模型。此前Claude贵且受限,GPT-5.3-Codex世界知识差。GPT-5.4代码能力强、世界知识优,还具多特性,如大上下文窗口,目前ChatGPT已上线。

数字生命卡兹克
新闻资讯7

AI看不懂的色盲测试背后,藏着一场像素与诗意的战争。

作者和同事测试AI色盲测试图,多模态模型Gemini 3 Pro、Claude Opus 4.5等纷纷答错,仅GPT 5.2 Thinking答对且靠代码作弊。研究发现,AI看图断章取义,缺乏人类的“格式塔”能力。

数字生命卡兹克
开源动态8

DeepSeek又拿第一!首创「因果流」视觉推理,超越Gemini

DeepSeek开源DeepSeek - OCR2,引入DeepEncoder V2视觉编码器,打破传统模型扫描限制,模仿人类视觉「因果流」逻辑。它解决了传统VLM忽略图像语义结构问题,在多项测试中表现出色,还验证了「LLM作为视觉编码器」可行性。

新智元
算法论文8

Skills刚火,就有零Skill的Agent来了…

Skills爆火之际,云玦科技团队提出不用Skills的零Skill Agent。它以Gemini 3 Pro为后端,在多个评测集表现出色。采用原位自进化框架,开源且成本低,或助力开源模型弯道超车。

量子位
开源动态8

超越纯视觉模型!不改VLM标准架构,实现像素级深度预测

Meta开源DepthLM,首证视觉语言模型不改架构就能媲美纯视觉模型的3D理解能力。通过视觉提示等创新策略,它精准完成像素级深度估计等任务,为多领域带来前景。

新智元
开源动态8

Nano Banana不及格,开源模型一分难求!上海AI Lab新基准直击文生图模型痛点

上海人工智能实验室等联合发布首个多学科文生图考试基准GenExam,覆盖10学科、1000题。实验显示,GPT - 4o严格评分正确率仅12.1%,开源模型接近0分,暴露出模型在专业场景的短板。

量子位
开源动态7

从GPT-2到gpt-oss,深度详解OpenAI开放模型的进化之路

OpenAI 近日发布 gpt-oss-120b 和 gpt-oss-20b 两个开源模型,Sebastian Raschka 发布博客对其详细分析,回顾自 GPT - 2 以来 AI 社区进步,还与 Qwen 3 比较,介绍架构、训练、推理等细节。

机器之心