「双编码器模型」共找到 7887 篇相关文章
三维空间太难懂?RoboTracer让机器人理解复杂空间指令,推理3D空间轨迹,开放世界也能精确行动
家庭环境复杂,让机器人理解空间指令难,现有VLM多聚焦2D推理。北航、北大等联合推出多模态大模型RoboTracer,能精准生成3D轨迹,在多项评测中领先,还能直接集成到机器人,完成复杂任务。
刚刚,DeepSeek开源OCR 2,首创Qwen编码的「双流架构」
年底 DeepSeek 开源新模型 DeepSeek - OCR 2,首创双流注意力架构,model&paper 一同发布。它重构视觉编码器,采用三阶段训练流程,在 OmniDocBench v1.5 评测及生产环境验证中表现良好。
Agent框架各自为战?谷歌&微软:用Agent-KB让经验自由流动
当前不同框架的Agent知识无法互通,谷歌、耶鲁、字节、oppo等团队联合提出Agent KB,这是通用记忆基础设施,能让异构Agent框架共享经验。它有师生双阶段检索机制,实验验证其能带来显著增益。
阿里开源 Vivid-VR!带来逼真连贯的视频修复
阿里开源 Vivid - VR 用于视频修复,基于 T2V 模型结合 ControlNet 保证画面一致性。它引入概念蒸馏训练策略,设计控制特征投影器和双分支 ControlNet 连接器,实验展现出优异表现。
训练机器人方式对了吗?英伟达DreamZero双榜第一新反思
NVIDIA的DreamZero在RoboArena和MolmoSpaces基准测试双登顶。分析文章《Why is DreamZero so good at robotics?》从多维度拆解其表现突出原因,质疑传统认知,如数据量并非万能,模型规模和信息输入方式也很关键。
腾讯混元最新开源:一套RL框架打通多个模态,庞天宇团队新作
大语言模型的RL技术已成熟,但多模态生成模型的强化学习训练仍“各自为战”,制约AIGC模型能力上限。腾讯混元庞天宇团队开源UniRL框架,打通多模态RL后训练,覆盖多种模型,内置算法与奖励组件。
一图胜千言被实现了!DeepSeek-OCR用图片压缩文本,10倍压缩率
DeepSeek开源DeepSeek - OCR,用图片压缩文本达10倍压缩率且几乎不丢信息。它解决了以往视觉编码器的问题,架构清晰,数据丰富,性能测试亮眼,为解决大模型‘记性差’问题提供新思路。
少 61% Token、多10倍成功率,这个终端 AI 编程代理火了!
现在多数AI编程工具问题多,而在Github上火爆的`oh-my-pi`是运行在终端的AI编程代理,有哈希锚定编辑等实用功能,支持多模型,经基准测试效果好,还能解决实际开发痛点。
中国团队一夜封神,AI出海「全球第一」!曾靠游戏狂赚10亿美金
在大模型竞争激烈的当下,中国出海团队SeaArt(海艺)用2.5年超越Midjourney等,成全球访问量第一的AI内容创作社区。它打造AI原生内容生态,SeaVerse开启全模态时代,还靠洞察用户、游戏基因等优势制胜。
触觉具身来了个梦之队:天使轮近亿
5月27日,上海新智具身智能科技有限公司宣布完成近亿元天使轮融资。该公司源自复旦大学,核心团队实力强。它聚焦触觉具身智能,构建技术闭环,在数据采集、模型训练等方面有进展,已在工厂落地POC验证订单。