视觉 - 语言推理」共找到 3219 篇相关文章

新闻资讯8

刚刚,阿里旗舰模型Qwen3-Max-Thinking发布,编程能力“踢馆”Gemini与Claude

阿里发布旗舰模型Qwen3-Max-Thinking,总参数超1万亿,在多项权威基准测试中表现优异,可与顶级闭源模型竞争。千问团队为其引入两项核心创新,提升推理性能,该模型已可免费体验。

InfoQ
新闻资讯8

一场文心大模型的「AI马拉松」

2025 年模型能力至关重要,百度在基础模型研发持续投入。百度 AI Day 上,吴甜解读文心新模型技术,文心 X1 Turbo 推理强、成本低。百度技术体系完备,未来看好多模态与智能体,降成本促应用生态发展。

机器之心
新闻资讯8

成果三年两登Nature封面,这支清华团队想让AI换个方式看世界

清华大学类脑计算研究中心团队成果三年两登Nature封面。晰见科技承接天眸芯技术产业化,重新做AI的眼睛。天眸芯拆解视觉信息,构建互补通路,团队还研究算法融合信息,目前芯片进展良好。

DeepTech深科技
算法论文8

微软 Agentic 组织:下一代 AI 系统

微软研究院提出全新推理范式AsyncThink,让LLM从单打独斗进化成带团队的项目经理。它把并发控制转为纯文本协议,经两阶段训练,实验中全方位碾压传统方法,还具跨领域泛化能力。

PaperAgent
开源动态8

刚刚,全球首个超高帧世界模型诞生!英伟达含量0,狂飙50帧

魔芯科技联合浙大潘云鹤院士团队发布全球首个Flash World Model——MoWorld,全栈基于国产NPU,实现50FPS实时推理推理成本降70%,为世界模型产业化带来新思路。

新智元
新闻资讯7

OpenAI发布权威AI科研基准,扯下AI遮羞布:奥赛金牌≠一流科学家!

OpenAI在2025年12月16日发布FrontierScience基准,用超700道题从物理、化学、生物维度考验AI科研推理能力。评测分竞赛和研究赛道,初测显示GPT - 5.2领先,但前沿模型仍有诸多问题。

新智元
开源动态8

恐怖的 361k+ star!这应该是我见过最给力的宝藏项目,全网最全!

介绍GitHub上的开源项目`free-programming-books`,它汇集海量免费编程学习资源,涵盖编程语言、框架、工具等多方面,有361k+ star。资源广、更新快、结构清、支持多语言,使用简单。

开源先锋
新闻资讯7

AI翻译的「最后一公里」

文章指出文化差异成AI翻译难题,通用大模型数据不平衡,存在“算法霸权”。如处理低资源语言,AI易产生幻觉,还因无肉身难理解基于生理体验的隐喻,人机协作才是翻译未来。

新智元
产品应用8

数学奥赛高分摘金,位列大模型榜首,『书生』科学多模态大模型Intern-S1能力再升级 | 通专融合新进展

2025年CMO决赛首设AI测试,书生科学多模态大模型Intern-S1以102分位列大模型得分榜首,远超金牌线和国家集训队入选线。其推理能力提升得益于多项创新,未来将拓展至多领域科研。

OpenMMLab
算法论文8

GUI 精准定位新 SoTA:LASER 让模型从“看全图”走向“锁重点”

多模态大模型在高分辨率、元素密集的 GUI 场景易误判。苏州大学 OpenNLG 团队提出 LASER 方法,让模型学会主动推理,通过关键区域聚焦等提升定位精度,在基准测试中表现出色。

深度学习自然语言处理