上下文图」共找到 910 篇相关文章

开源动态8

小红书提出DeepEyesV2,从“看思考”到“工具协同”,探索多模态智能新维度

小红书推出多模态模型DeepEyesV2,它延续视觉推理优势,实现代码执行、网页搜索和像操作的全工具协同。通过多工具协同推理解决复杂问题,采用两阶段训练策略,准确率远超开源模型。

量子位
开源动态8

突破全模态AI理解边界:引入上下文强化学习,赋能全模态模型“意”推理新高度

在多模态大语言模型应用多元的当下,对模型理解人类意需求迫切。阿里巴巴通义实验室团队推出HumanOmniV2,解决现有推理路径问题,其相关代码等开源,在多基准数据集成果突破性领先。

量子位
算法论文7

VQA高分是在看,还是在记答案?ReKey只更新决定答案的那一小块

视觉问答模型准确率提升,但高分可能源于记忆。浙江大学等团队提出 ReKey,保留真实场景,只更新决定答案的视觉线索,使评测面向未见过内容,且多数环节可自动完成。

机器之心
推荐文章7

实战·Agentic 上下文工程(下):实现一个可自我学习与进化的智能体原型

文章参考ACE论文架构与提示词设计,实现可自我学习与进化的ACE智能体原型。介绍整体架构、各模块实现逻辑、工作流组装测试,也指出当前问题如LLM表现波动大等,并给出改进方向。

AI大模型应用实践
新闻资讯8

看透全球大模型!新智元十周年钜献,2025 ASI前沿趋势报告37页首发

新智元十周年峰会发布《2025新智元ASI前沿趋势报告》与《2025新智元ASI产业谱》,预测2027达ASI临界,智能体全面爆发。报告展示全球大模型格局,中国开源模型表现亮眼,还揭晓了创新大奖。

新智元
开源动态8

视频理解新标杆,快手多模态推理模型开源:128k上下文+0.1秒级视频定位+跨模态推理

快手开源能看懂视频并跨模态推理的大模型Keye-VL 1.5,其有时序定位、描述和推理能力,跑分领先。采用三段式架构和Slow-Fast编码策略,经四阶段预训练和多阶段后处理,团队成果多,推动多模态技术落地。

量子位
开源动态7

三重Reward驱动的运维智能体进化:多智能体、上下文工程与强化学习的融合实践

文章阐述了AI原生时代下,面向技术风险领域的智能体系统(DeRisk)的架构设计、核心理念等。介绍运维智能体发展现状,提出其技术演进需找三类Reward,还介绍相关概念、DeRisk架构,给出实践案例并将开源技术产品。

阿里云开发者
开源动态8

开源复现o3像思考!快手让AI不再被动看,模型自主生成代码调用工具

Kwai Keye团队提出Thyme新范式,构建技术方案,赋予开源模型“超越像思考”能力。包括设计训练策略、构建开源配套资源,拓展多模态模型工具使用与决策水平,在基准测试中性能提升显著。

量子位
算法论文8

能效翻5倍!他们复刻人脑双记忆通路,造出能长效记住上下文的类脑AI芯片

帝国理工学院博士后孙鹏飞和苏黎世联邦理工博士后苏哲及合作者,受大脑皮层机制启发,打造“双重记忆路径”类脑网络及配套芯片,处理语音识别任务时能效比此前优方案高5倍。相关论文发表在《自然·机器智能》且代码、设计全开源。

DeepTech深科技
开源动态8

一张生成任意场景3D模型,部分遮挡也不怕|IDEA x 光影焕像联合开源

IDEA研究院张磊团队与香港科技大学谭平团队联合推出SceneMaker框架,以DINO - X与Triverse为基础,实现从任意开放世界像到带Mesh的3D场景完整重建,解决遮挡难题,有多项创新,应用场景广泛。

量子位