「细粒度感知」共找到 344 篇相关文章
Google封神,计算机视觉的GPT3时刻来了!
Google Deepmind称在CV领域做出类似GPT-3的成果,Veo 3经大规模训练涌现通用视觉理解和推理能力,能以图片+提示词完成复杂视觉任务,还具备感知、建模等四大超能力。
集合通信库VCCL释放GPU极致算力,创智、基流、智谱、联通、北航、清华、东南重磅开源
在超大规模智算集群需求下,创智、基流等多方联合开源集合通信库VCCL。它基于NCCL开发,有智能调度、容错、细粒度观测机制,实测能提升算力利用率、降低故障率,还解决了服务器异构等问题。
直播预约 | 强化学习训练能否不依赖外部知识优化模型的弱点?
论文提出 SwS 框架,针对强化学习场景,利用模型自我感知弱点驱动自动化问题生成,合成针对性训练数据。还对其进行多项扩展,在多个基准测试集和模型上验证有效,性能提升显著。
养了只东北味熊猫当AI合伙人,一口一个老铁,还真帮我开了家「一人公司」
腾讯ima上线copilot模式,可“领养”小熊猫并设定人设风格,成专属知识伙伴。它不分对话和任务模式,知识库功能实用,还能私人定制。作者用它模拟创业,体验良好,其记忆和全场景感知实用。
自动驾驶优化:从复杂性到实时工程
本文深入探讨自动驾驶技术栈端到端架构,阐释从上下文感知传感器融合到MPC求解器等优化技术,如何将原始传感器数据转化为安全控制指令,还介绍轨迹规划、实时计算预算及调试等内容。
LeCun团队揭示LLM语义压缩本质:极致统计压缩牺牲细节
图灵奖得主LeCun团队提出全新信息论框架,对比人类与LLM语义压缩策略。通过构建人类概念分类基准、选30+LLMs,发现LLM虽有语义组织能力,但难处理细粒度差异,侧重统计压缩,人类更重细节语境。
deepseek-V4算法工程技术深入浅出
文章围绕deepseek V4技术报告展开,指出当前大模型训练不充分,介绍了算法层面如混合注意力机制、模型结构优化、优化器等,工程层面如细粒度专家并行、算子内核开发等,以及后训练的范式转变和领域专家网络蒸馏等内容。
12项世界第一!国产基模一战封神,11亿参数逆袭70亿大魔王
蚂蚁灵波的LingBot-Depth 2.0空间感知模型,在测试中拿下12个世界第一,解决了玻璃、细小物体等行业难题。它还与奥比中光达成合作落地商业应用。其核心预训练基模LingBot-Vision被开源,有望加速具身智能生态发展。
NUS、牛津等联合发布音视频智能综述:系统梳理大模型时代的AVI全景图
NUS领衔近10家机构发布音视频智能综述,系统梳理大模型时代AVI发展全貌,涵盖感知、生成与交互,复盘子方向工作,构建任务蓝图,整理评测体系,总结基础技术,还探讨应用、安全及未来研究方向。
《动手写AI Agent》上下文工程:比 Prompt Engineering 更重要的事
文章围绕AI Agent的上下文工程展开,指出其比Prompt Engineering更重要。介绍了上下文工程的分层组织,包括角色定义、通用规则、项目状态和用户指令,还提及项目感知、.ling.md文件及完整System Prompt的组装。