实例级上下文理解」共找到 1427 篇相关文章

算法论文8

Meta「分割一切」3.0曝光!技能语义分割加入概念提示,好好玩,要爆了

Meta第三代“分割一切”模型SAM 3悄然投稿ICLR 2026。它支持基于概念提示的多实例分割,能听懂人话,处理图片快,还设计新架构、构建数据引擎、提出SA - Co基准,实验表现佳但也有局限。

量子位
算法论文7

VL-LN Bench:模拟「边走边问找具体目标」的真实导航场景

上海人工智能实验室等研究者完成VL - LN Bench,模拟真实导航场景。它构建自动化数据收集管线,依托InternVLA - N1训练评测。结果显示主动对话可提升表现,但当前方法在实例感知对齐等环节有短板。

机器之心
算法论文8

LeCun世界模型:48倍规划速度,单卡就能跑

Yann LeCun团队推出LeWorldModel世界模型,仅靠两条数学规则,让机器几小时学会物理运转逻辑,动作规划速度超同类48倍。它跳出复杂训练修补怪圈,单卡训练,在多环境测试表现出色,还展现对物理法则的深刻理解

AIGC开放社区
开源动态8

对标GPT-4o和香蕉!浙大开源ContextGen:布局身份协同新SOTA

浙江大学ReLER团队开源ContextGen框架,攻克多实例图像生成中布局与身份协同控制难题。基于Diffusion Transformer架构,用双重注意力机制实现布局精准锚定与身份高保真隔离,在基准测试中超越开源SOTA模型,对标GPT - 4o等闭源系统。

新智元
产品应用8

Moxt 实测:把你的组织,折叠进一堆文件夹

作者实测 Moxt 后发现,它能解决 AI 产品上下文散且脏的问题,提供工作空间,让 AI 在原生格式工作;用户可创建专属 AI,还能精简 Context。此外,它支持技能组合、定时任务等,输出拓展到视觉形态。

歸藏的AI工具箱
开源动态7

Agent = LLM + Memory + Planning + Tool Use

文章指出LLM设计无状态,产生幻觉,超长上下文窗口也无法解决记忆问题。介绍人类记忆的三个系统,阐述Agent记忆四层演化及每层问题,推荐开源项目Cognee将向量、图、关系型结合互补。

CourseAI
开源动态8

快手在 AI 上,渐入佳境

文章介绍快手多模态大模型 Keye-VL 1.5,参数 8B 适合中小企业。它侧重短视频场景,视频理解能力强,能与业务结合,提升推荐等场景效率。还详述其架构、预训练、后训练及训练架构优化等技术细节。

MacTalk
新闻资讯8

MLLM集体翻车,缺乏婴儿级常识!业界首个核心认知基准发布,LeCun转赞

当前大模型在12项核心认知上普遍落后人类10 - 30%,越大的模型越易靠「背答案」糊弄。团队公开首个系统评测框架和题库,用Concept Hacking方法识破模型真假理解,指出模型存在核心知识缺失等问题。

新智元
新闻资讯7

AI遭遇灵魂拷问!这道题所有模型集体翻车,网友:我也不会啊

图像推理现新难题,在Reddit引发热议,目前无AI能真正解决。国内外支持图像输入的大模型答案不同,原因是对大立方体规格理解不同。结合提示多次尝试,部分大模型能找准方向,人类面对该问题也会困惑。

量子位
开源动态8

上海AI Lab发布混合扩散语言模型SDAR:首个突破6600 tgs的开源扩散语言模型

上海人工智能实验室提出全新范式SDAR,通过‘训练 - 推理解耦’融合AR模型高性能与扩散模型并行推理优势。实验证明,SDAR性能与原版AR模型持平或超越,还能加速推理,且已全面开源全系列模型。

机器之心