任务感知能力」共找到 4788 篇相关文章

算法论文8

首个实例理解3D重建模型!NTU&阶越提出基于实例解耦的3D重建模型,助理场景理解

人类能自然感知3D世界的几何与语义,但AI做到“两者兼得”是挑战。NTU联合StepFun提出IGGT,将空间重建与实例级上下文理解融为一体,还构建了InsScene - 15K数据集,解决了传统方法的问题。

量子位
开源动态8

没想到,32B清华DeepDive掀翻深度搜索全场的!

文章指出大模型在真实深网搜索场景表现不佳,核心矛盾是缺‘难搜’数据和多轮工具调用 RL。清华 DeepDive 用数据合成造‘难搜’题,端到端多轮 RL 训练,在 BrowseComp 刷新开源记录,迁移能力也强。

PaperAgent
产品应用8

谷歌2.5 Image:『你是我的神』,准备丢掉PS了

谷歌新出的大模型Gemini 2.5 Flash Image实现AI图像创作一致性、真实性新高度。它能理解手绘图表、解答问题及完成复杂编辑指令,可在Gemini和Google AI Studio免费使用,表现出色,有望取代很多PS任务

鲸选AI
新闻资讯7

GPT-5基准测试泄露,被曝两天后发布?打Minecraft震撼开挂网友直呼封神

GPT - 5消息不断,泄露的基准测试及Minecraft实测惊艳网友。有爆料称7月31日发布,也有消息指8月。它或统一o与GPT系列,编码能力强,能处理复杂编程任务,不过也引发对其影响的担忧。

新智元
新闻资讯7

面向 AI Agent 的搜索服务,小宿科技有机会成为百亿美金的新巨头吗?

文章围绕AI搜索展开,分析微软Bing停用API原因,探讨小宿科技做Agent时代AI搜索服务的机会。从多方面剖析小宿优势,如全球通能力、贴合需求打法等,指出AI时代搜索是B端基建博弈。

Founder Park
产品应用7

数据库厂商入局AI又有新思路,OceanBase选择“卖铲子”

国产数据库厂商 OceanBase 入局 AI 有新思路,近期动作频频。其云数据库业务 OB Cloud 实现 AI 能力开发部署并与多平台集成,已在多行业落地。副总裁尹博学谈其 AI 战略逻辑、面临挑战及未来趋势等。

InfoQ
算法论文8

8B模型可以超过GPT-4o!并行KV Cache压缩支持的128K长度外推方法ParallelComp

大模型长文本推理存在瓶颈,作者提出 ParallelComp 方案。它有并行 Attention 分块、KV 缓存智能淘汰与注意力偏差校准三大创新,能让 8B 模型性能达 GPT - 4o 的 91.17%,特定任务超 GPT - 4o。

机器之心
开源动态8

搜索智能体RAG落地不佳?UIUC开源s3,仅需2.4k样本,训练快效果好

当前 Agentic RAG 落地有挑战,UIUC 和 Amazon 提出 s3 训练范式。它仅需 2.4k 样本,训练快且效果好,解决了优化目标偏离、检索与生成耦合等问题,在通用和医学 QA 任务中表现出色。

机器之心
算法论文8

英伟达港大联手革新视觉注意力机制!GSPN高分辨率生成加速超84倍

香港大学与英伟达联合推出广义空间传播网络(GSPN)。它采用二维线性传播与“稳定性 - 上下文条件”,将计算量降低,保留图像空间连贯性。在多视觉任务刷新性能纪录,如高分辨率生成加速超84倍。

量子位
开源动态8

阿里通义开源「推理+搜索」预训练新框架:小模型媲美大模型,多个开放域问答数据集表现显著提升

阿里通义实验室开源通用预训练框架MaskSearch,引入检索增强型掩码预测任务,兼容两种训练方法。实验显示,它在多数据集提升模型性能,小模型能媲美大模型,还验证了训练方式、策略及奖励函数的效果。

量子位