「原生多模态架构」共找到 2923 篇相关文章
第一章:AI 技术前沿全景
文章聚焦AI Agent技术前沿,阐述大语言模型三次能力跃迁,从涌现能力到对齐指令遵循,再到推理与行动。还提及Scaling Law变化,推理时计算扩展更划算,介绍代表性推理方案及多模态融合,指出Agent打破传统对话AI局限。
Qoder @database功能上线!自动关联数据库 Schema,后端 AI Coding 效率拉满
Qoder JetBrains插件上线@database功能,将数据库能力内置为核心上下文,可一键让AI结合真实业务表结构处理SQL编写等任务。它是JetBrains上唯一深度支持“数据库原生感知”的AI Coding插件,还介绍了使用方法、场景及注意事项。
AI 时代的洞察方法论:结构化思维与能力迁移
文章以高盛数字化架构设计为例,探讨AI时代技术分析的能力迁移。指出AI使信息采集整合成本降低,技术分析重心从找信息转向构建模型,建模仍是洞察主战场,AI可加速知识铺垫,但模型切换需人类完成。
从《塞尔达传说》理解 Agent 的上下文工程:Claude Skills 还是被低估了
Claude Skills 是为 AI 设计的「技能包」,能把复杂任务指令打包。作者认为其信息分层设计哲学是关键突破,以《塞尔达传说》为例,介绍了信息分层和按需加载理念,还阐述了三层架构及应用案例、挑战和通用原则。
Unsloth宣布更新,可免费用强化学习训练视觉大模型Qwen2.5-VL-7B
Unsloth宣布更新,支持视觉/多模态模型强化学习训练,含Gemma 3和Qwen2.5 - VL。其独特机制使VLM RL训练速度提升、显存占用降90%等。还引入GSPO算法,能在免费Colab T4 GPU训练Qwen2.5 - VL - 7B。
VLA不够了?触觉,将改写具身智能新格局
2026 年数据成具身智能竞赛焦点,IEEE 专访机器人学家王煜。他认为 VLA 架构难支撑机器人落地,触觉数据是关键。他与团队提出 VTLA 框架,创立戴盟机器人,发布数据集并开源部分数据,还阐释对具身智能多方面的思考。
李飞飞、Jim Fan和徐丹飞联合重磅论文:机器人灵巧手,可能走错了路
李飞飞等学者联合发表论文,分析当前触觉融合方案缺陷,提出 T - Rex 架构。它改变触觉输入方式,使用新编码方法和数据集,经三阶段训练,在 12 项任务评测中平均领先 30 个百分点,也指出了局限与未来方向。
智能体编程“小钢炮”:Qwen3.6-35B-A3B开源!
Qwen3.6-35B-A3B开源,是稀疏MoE模型,总参350亿、激活参数30亿,轻量高效,在智能体编程等方面表现卓越,超越前代,可与稠密模型媲美,支持多模态,已在Qwen Studio上线并发布开源权重。
AI祛魅之后:2026年将是AI脱下华丽外衣并穿上工装的一年
2026年AI将从概念验证迈向产业深处,展现实用价值。行业焦点从构建大模型转向让AI好用,还会从依赖算力扩张过渡到研究新架构。小模型崛起、智能体互联标准化、世界模型构建及物理智能落地成趋势。
AI 智能体实战:100+次迭代后的意图识别提升之道
文章围绕AI智能体意图识别与槽位抽取展开,介绍初级到高阶四种方案。初级方案简单高效但意图多易出错;中级解耦架构,适用于复杂场景;进阶用RAG召回解决意图识别不准;高阶应对多轮对话挑战,各有优劣。