Qwen3-4B-Thinking」共找到 2290 篇相关文章

新闻资讯7

蒙娜丽莎让大模型们几乎全军覆没!网友:懂了,AI不会眯眼睛

日本艺术家北冈秋吉创作的蒙娜丽莎图难倒一众大模型,ChatGPT、Gemini等表现不佳,国产玩家如豆包等也有判断失误。不过o3 - Pro一次性答对,GPT - 4o尝试三次猜对。

量子位
算法论文8

ICLR 2026 | 7B小模型干翻GPT-5?AdaResoner实现Agentic Vision的主动「视觉工具思考」

文章介绍了AdaResoner模型,它学会‘何时用工具’,在拼图推理上击败GPT - 5。Google为Gemini 3 Flash引入‘Agentic Vision’,与AdaResoner殊途同归。AdaResoner有独特训练方法,提升小模型性能。

机器之心
新闻资讯7

开源模型TOP5,被中国厂商包圆了

10月公开数据显示中国开源大模型占据榜单前五,阿里Qwen系列和DeepSeek影响力深远。从LMArena榜单、HuggingFace数据看,国产模型表现佳。还提及Llama 5相关传闻。

量子位
新闻资讯8

刚刚,Figure 03惊天登场!四年狂造10万台,人类保姆集体失业

通用机器人曙光来临,Figure 03正式亮相,专为Helix「大脑」打造,手掌心有摄像头,指尖能感知3克力。其进化亮点多,未来四年将量产十万台,适用于家庭和商用场景。

新智元
新闻资讯7

Anthropic把Claude送去当店长,结果AI疯了~

周末,Anthropic开展“Project Vend”实验,让Claude 3.7 Sonnet在旧金山经营小卖部。实验为期一个月,AI老板Claudius业绩不佳,亏损严重,还出现“发疯”等不可预测行为。Anthropic会继续优化它。

探索AGI
算法论文8

规范对齐时代:GPT-5 断层领先,让安全与行为边界更明晰

上海交通大学等团队提出规范对齐概念,构建评测基准 SpecBench 评测 33 个主流模型,发现多数模型有不足。还探索测试时深思方法,如 Align3 能提升规范遵循度,GPT - 5 在规范对齐上断层领先。

机器之心
新闻资讯8

刚刚,智源全新「悟界」系列大模型炸场!AI第一次真正「看见」宏观-微观双宇宙

6月6日第七届智源大会,智源研究院推出全新「悟界」系列大模型,含原生多模态世界模型Emu3、脑科学多模态通用基础模型见微Brainμ等,反映其对大模型发展的研判,推动AI向物理世界迈进。

机器之心
产品应用8

字节发了个机器人全能大模型,带队人李航

字节推出Seed,其Robix视觉—语言单模型能搞定机器人推理、任务规划和自然语言交互,核心采用思维链推理和三阶段训练策略,效果超Qwen2.5 - VL、GPT - 4o等,负责人是李航。

量子位
算法论文8

中国团队让AI拥有「视觉想象力」,像人类一样脑补画面来思考

上海交通大学等团队提出 Thinking with Generated Images,让大模型像人类一样用「脑内图像」推理。该研究区分三种视觉思维模式,提出核心技术框架,解决视觉推理局限,实验效果好,未来有望在多领域突破。

机器之心
产品应用7

Cursor自研模型反超Opus 4.6!价格脚踝斩,氛围编程沸腾了

Cursor新编程模型Composer 2性能超Claude Opus 4.6,价格“脚踝斩”。它靠引入新强化学习方法,让模型学会“做笔记”突破上下文瓶颈,在任务中表现出色,研究员还放出Composer 3消息。

量子位