「双视觉编码器架构」共找到 2408 篇相关文章
解读Qwen3文本嵌入与重排序技术版图
文本嵌入和重排序是NLP和信息检索关键组件。Qwen3 Embedding、Qwen3 Rerank模型基于Qwen3基础模型构建,有三种参数尺寸。文章介绍其架构、训练方案,还给出实战代码。
你的 AI 助理一闭嘴就在「发呆」?上交大 ProAct:把 Agent 的空闲时间变成生产力
上海交通大学 APEX 实验室提出 ProAct 架构,能把对话空闲时间转化为主动准备机会。它有预测、筛选、交付三级流水线,经 ProActEval 评测效果佳,证明算力用对地方更重要,让 Agent 能提前为用户准备。
MIT团队完成AI控制人类行为实验项目
MIT团队的Human Operator项目是实时人体增强工具,也是MIT Hard Mode 2026获奖项目。它通过视觉 - 语言模型结合电刺激肌肉实现人体运动控制,介绍了技术栈、环境要求、软硬件准备、安装步骤等。
我在OpenAI修中文
OpenAI研究科学家陈博远介绍GPT Image 2官网博客花絮,分享模型训练、测试情况,还展示亲手制作的官网图片,包括中文彩蛋、漫画、杂志页等,体现模型文字渲染、视觉推理等能力。
Meta大手笔收购Moltbook:小札掌控150万AI 智能体,OpenClaw生态颤抖
2026年3月10日,Meta宣布收购Moltbook,这个有150万AI智能体的社区。Meta看重其身份认证与互联架构,想借此补齐“代理人社会”拼图。但收购引发数据垄断担忧和人才出走问题。
Databricks收购Mooncake,Lakebase想给AI应用换个“心”
Databricks收购Mooncake Labs,旨在推进为AI智能体优化的新型OLTP数据库Lakebase。它基于Postgres,想让数据直接用于工作负载,省去ETL流程,简化AI应用后端数据架构设计。
从私域知识到智能 Agent:构建智能运维知识库
抖音算法工程师王宁在 QCon 大会分享,介绍将私域知识与 LLM 融合构建运维系统的方法,详解 SOPAgent 架构解决传统 AIOps 难题,还提及多模态数据处理、知识管理体系等亮点。
MiniMax海螺视频团队首次开源:Tokenizer也具备明确的Scaling Law
MiniMax海螺视频团队首次开源,揭晓视觉分词器难题答案。其推出的VTP框架可提升模型性能,解决传统Tokenizer缺陷,还展示了Tokenizer的Scaling Law,为行业提供新路径。
复旦等推出「第一人称视听基准」,补齐多模态模型「听觉拼图」
多模态大模型在真实世界会“失聪”,现有第一人称视频问答/理解基准长期偏“视觉中心”。复旦等团队推出首个系统评测第一人称声音理解能力的基准EgoSound,能让模型听懂世界,评测显示当前模型与人类差距大。
OpenAI发布Symphony:AI时代的敏捷看板
OpenAI在GitHub发布Symphony项目,处于工程预览阶段。其核心理念是将项目工作转化为自主运行,通过看板管理工作流程。几乎同时,Paperclip项目宣布开源,提供完整企业架构。二者标志AI辅助开发向流程层面转变。