「原生多模态架构」共找到 2911 篇相关文章
让Skill“有图可依”:openJiuwen首发多模态Skill范式Skill-Omni
openJiuwen社区发布业界最早工程化落地的多模态Skill范式Skill-Omni,让Agent经验从‘读得懂’升级为‘看得见’。它能将网页和视频视觉知识沉淀为多模态Skill,还介绍了生成及读取方式和适用任务。
Moonshot AI发布Kimi Linear技术报告,采用混合线形注意力架构
Moonshot AI在Hugging Face发布Kimi Linear技术报告,该48B参数模型采用混合线性注意力架构,称超越传统全注意力机制。官方数据体现其优势,模型已开源,社区反应不一,MiniMax则回归全注意力架构。
清华-腾讯联手:音频 - 视觉多模态任务统一框架
Crab是人大、清华和腾讯合作论文提出的模型,目标是高效一统多模态场景理解任务。它解决了音频 - 视觉理解模型任务干扰、合作显式化不足等难点,通过构建数据集、设计结构和统一架构实现多任务合作。
网易云音乐前 CTO 曹偲:代码越来越不重要,好的架构才是软件工程核心
网易云音乐前CTO曹偲推出AI Coding产品Toco AI,旨在将确定性和工程性带入AI Coding。他认为架构决定软件开发上下限,代码会逐渐黑盒化,业务架构更重要且难被AI取代,产品可助力软件开发。
从DeepSeek-V3到Kimi K2:八种现代 LLM 架构大比较
文章对比了DeepSeek-V3、Kimi K2等八种现代LLM架构。介绍各模型独特技术,如DeepSeek V3的多头潜在注意力和混合专家技术,OLMo 2的后归一化策略,Gemma 3的滑动窗口注意力等,探讨架构改进与突破。
这样更公平:用jina-reranker-m0为多模态文档打分重排
文章指出多模态搜索领域给文档综合评分难,因文本与图像评分缺乏可比性。2025年4月发布的jina - reranker - m0可解决此问题,其两阶段检索流程能显著提升召回率,对多模态AI系统设计有启发。
GLM-5架构曝光,智谱两日涨60%:采用DeepSeek同款稀疏注意力
GitHub代码确认GLM - 5架构细节,它采用DeepSeek - V3/V3.2架构,含稀疏注意力和多Token预测,参数量745B。OpenRouter上神秘「Pony Alpha」被指是其测试版,受消息影响智谱AI港股两日涨60%。
首个国产开源AI原生后端,不再写后端,AI就是全栈工程师。
Aipexbase是首个国产开源AI原生后端即服务平台,能在AI辅助下完成前后端一体化开发。开发者无需编写后端代码,通过前端SDK或MCP一键调用后端能力,适配国内生态,定义了AI原生开发新模式。
配置驱动的动态Agent架构网络:实现高效编排、动态更新与智能治理
本文提出配置驱动的独立运行时 Agent 架构,解决低代码/平台化 Agent 方案企业级落地难题。介绍其核心架构、注册中心、配置定义等,还提及 Agent Studio、执行引擎等,阐述运行部署、协作、治理,提供通用可落地范式。
重磅!中国团队发布SRDA新计算架构,从根源解决AI算力成本问题,DeepSeek“神预言”成真?
国内玉盘AI团队发布《SRDA AI大模型专用计算架构》白皮书,提出全新SRDA计算架构,从硬件源头解决AI算力成本瓶颈。它以数据流为核心,在内存、网络等方面创新,为开发者带来高效、低成本等价值。