「小模型推理能力」共找到 9427 篇相关文章
Sora2甚至可以预测ChatGPT的输出
Sora2表现太卷,能预测ChatGPT输出,模拟交互还能渲染HTML,懂代码也懂物理,能体现玻璃折射现象,还能精准还原游戏支线任务关键要素,或基于LLM训练。
AIME'25满分炸场!Qwen一波七连发,全家桶大更新
云栖大会上,通义团队成果丰硕。Qwen3-Max性能提升,数学评测满分,多测试成绩优异;Qwen3-VL、Qwen3-Omni等开源,各有亮点;Qwen3-Coder升级。吴泳铭称要发展超级人工智能。
镜头被油污糊住,机器人还稳定操作?北大/清华等给VLA加一道信息筛选,不靠额外数据,效率提升14x,真机鲁棒性反而更高了 | ICML 2026
北大、清华等机构联合提出StableVLA,相关工作被ICML 2026接收。该工作提出轻量级IB - Adapter,不依赖额外数据对视觉特征筛选对齐,让机器人遇视觉干扰仍能稳定执行任务,实验展现出鲁棒性提升。
工程师狂喜!Qwen3-VL 检索双雄效率翻倍
通义大模型开源Qwen3-VL-Embedding和Qwen3-VL-Reranker,解决多模态检索难题。两模型多模态全兼容,双塔+单塔协同提速,实用主义拉满,集成成本低,实战表现超预期。
两年内打造AI软件工程师!OpenAI Codex 作者解密人机结对编程新模式
AI科技大本营编译访谈,OpenAI的Josh Ma与Alexander Embiricos分享Codex项目,包括缘起、人与AI结对编程范式,还探讨产品形态、最佳实践等,预测两年内打造智能体软件工程师。
Vibe Coding杀进3D领域!OpenAI总裁都在围观这种新玩法
AI 3D 基础模型领先公司 VAST 发布 Tripo P2.0,直接产出原生四边面拓扑,解决生成后模型可用性问题。此外,VAST 完成约 30 亿融资,Tripo 系列在评测中居首。
迈向长程智能体,人大高瓴发布149页全景综述
新问题出现,长程智能体研究应运而生。人大高瓴发布149页综述,梳理超900项研究,从多视角给出长程智能体统一定义、分类与路线图,分析难点,提出核心论点与发展路径等。
「虾马」之后,openJiuwen社区发布JiuwenSwarm,引领蜂群智能体新架构,开启「养蜂」时代
华为支持的开源AI Agent平台社区openJiuwen发布并开源蜂群智能体JiuwenSwarm,按下“群体智能”加速键。它基于Coordination Engineering理念,有全栈技术体系,在多领域实战效果好,且单Agent能力强。
ICLR 2025 Oral | LLM也有从众心理!
浙江大学团队论文指出,多AI协作系统存在“群体思维”,多个AI共同决策时会盲目跟多数意见。研究者开发BenchForm测试平台验证LLM从众行为,还分析原因、给出让LLM更独立的方法,指出从众利弊及未来挑战。
The Batch: 952 | GPT-5.5 性能领先,但幻觉问题突出
OpenAI 最新旗舰模型 GPT-5.5 是闭源视觉 - 语言模型,在重要基准测试中表现领先,但在区分已知未知内容上有困难,幻觉问题突出,在主观评估中落后于对手。