「推理任务」共找到 3592 篇相关文章
参数砍到 1B,这个小钢炮拿下多模态第一
面壁智能发布并开源参数量仅 1.3B 的 MiniCPM-V 4.6,虽小但多模态综合能力在 1B 级别中夺冠。它推理快,效率高,靠两大架构创新实现,还为开发者提供完整工具链。
清华2年前预言,正成为全球共识!Meta等三大AI机构已得出同一结论
全球三家AI研究机构结论曲线斜率几乎重合,而中国面壁智能和清华联合团队两年前提出的“密度定律”与它们一致。该定律改写行业假设,如推理成本下降、端侧智能爆发临近、大模型策略反转等。
开源“裸考”真实世界,国产具身智能基座模型拿下全球第二!
国产具身智能基座模型WALL - OSS在RoboChallenge真机评测榜单获全球第二,多个单任务排第一。它是开源模型,开源程度彻底。还介绍其技术突破及团队情况,强调开源对具身智能发展意义重大。
华尔街彻夜难眠!Gemini 3屠榜金融「最难考试」,AI砸了「金饭碗」?
被誉为「黄金职业通行证」的CFA考试被AI攻陷,推理模型不仅全部通过三级考试,部分科目接近满分。如Gemini 3.0 Pro在一级考试创97.6%最高纪录。不过AI仍有局限,还不能完全替代分析师。
OpenAI拉响红色警报!暂停广告和Agent,下周发布新模型硬刚Gemini 3
面对Google等对手的竞争,OpenAI宣布进入‘红色警报’状态,下周将发布新推理模型硬刚Gemini 3 pro。Altman暂停部分项目,调配资源升级ChatGPT,重点修补‘模型行为’,提升产品体验,还注重图像生成。背后是融资需求压力。
谷歌2.5 Image:『你是我的神』,准备丢掉PS了
谷歌新出的大模型Gemini 2.5 Flash Image实现AI图像创作一致性、真实性新高度。它能理解手绘图表、解答问题及完成复杂编辑指令,可在Gemini和Google AI Studio免费使用,表现出色,有望取代很多PS任务。
GPT-5基准测试泄露,被曝两天后发布?打Minecraft震撼开挂网友直呼封神
GPT - 5消息不断,泄露的基准测试及Minecraft实测惊艳网友。有爆料称7月31日发布,也有消息指8月。它或统一o与GPT系列,编码能力强,能处理复杂编程任务,不过也引发对其影响的担忧。
搜索智能体RAG落地不佳?UIUC开源s3,仅需2.4k样本,训练快效果好
当前 Agentic RAG 落地有挑战,UIUC 和 Amazon 提出 s3 训练范式。它仅需 2.4k 样本,训练快且效果好,解决了优化目标偏离、检索与生成耦合等问题,在通用和医学 QA 任务中表现出色。
英伟达港大联手革新视觉注意力机制!GSPN高分辨率生成加速超84倍
香港大学与英伟达联合推出广义空间传播网络(GSPN)。它采用二维线性传播与“稳定性 - 上下文条件”,将计算量降低,保留图像空间连贯性。在多视觉任务刷新性能纪录,如高分辨率生成加速超84倍。
在Think中边搜索边调整的搜索增强Reasoning方法
LLM虽知识丰富,但无法掌握训练数据外的信息,传统检索增强生成方法有缺陷。AutoRefine提出“先筛选,再回答”理念,用强化学习训练,实验显示在多方面碾压传统方法,未来或改变知识密集型任务解决方式。