「开源实现」共找到 4737 篇相关文章
7.3K Star!用 Orca 组建 AI 舰队:让 Claude Code 和 Codex 同时开工!
Claude Code 大火后,多家大厂推出自家 Code CLI,多终端操作上下文切换成本高。Orca 是开源 AI 编排器,可让多个 AI 编程助手并行工作,集中查看结果,有并行工作区、统一管理界面等亮点。
Speech LLM 的下一个突破口:你的语音大模型可以是个「带韵律的文本模型」
语音大模型存在‘模态代沟’致性能‘降智’,此前两波改进未根本解决。香港中文大学论文提出TextPro - SLM架构,从输入端破局,仅用约1000小时数据就实现低‘模态代沟’,对多模态模型设计有启发。
Qwen3-VL-Seg 深度解读:当多模态大模型学会"像素级精准手术",仅用0.4%参数碾压8B模型
文章深度解读阿里通义实验室发布的Qwen3-VL-Seg,它解决开放世界指代分割问题,用仅17M参数(占基础模型0.4%)在4B规模超越8B模型。介绍其原理、架构、数据、实验结果,还给出实战代码。
两分钟Claude Code模型换成DeepSeek,立省17倍,缓存后爆省120倍
GitHub开源deepclaude,两分钟可将Claude Code模型换成DeepSeek V4 Pro,开销直降17倍。自带上下文缓存机制,重复对话成本降120倍。支持多后端选项,可丝滑切换,还能打破设备限制远程编程。
当我把 AI 变成一个"算法":Skill 工程化设计的心路历程
作者分享将 Agent 工程化设计的历程。指出 LLM 做 Agent 有痛点,引入 CLI 接管确定性任务和上下文管理,还设计了 Workflow 串联工具,实现自动扩展和无缝互转,最后做 workflow - creator 形成自洽闭环。
刚刚,何恺明团队新作,「嵌入式语言流」ELF来了
何恺明团队提出ELF模型,将扩散过程置于连续向量空间,只在最后翻译成词。它用一个网络实现去噪和解码,引入自条件机制。实验显示,ELF用不到其他方法十分之一数据,生成质量全面领先。
深度解析LLM Wiki / Obsidian-Wiki / GBrain:Agent时代知识的“自组织”与“自进化”
文章深度解析LLM Wiki、Obsidian - Wiki和GBrain项目,探讨Agent时代知识的“自组织”与“自进化”。指出传统知识管理有短板,而这些项目通过不同方式解决知识结构化、沉淀和更新问题,各有优劣。
CVPR 2026 Oral|告别模型合并冲突!南大等提出OrthoReg:极简正交正则化,揭开任务算术的底层机制
南京大学等团队为任务算术建立底层理论框架,提出「任务特征特化」属性,推导出几何约束方法OrthoReg。该方法引入极简正交正则化项,提升模型合并性能,论文被CVPR 2026接收并评为Oral,代码等已开源。
DeepSeek多模态新范式:一张图压缩7056倍,思考能力反超GPT和Claude
DeepSeek上线多模态并开源新范式技术。该研究让AI用视觉原语思考,弥合语言与视觉指代鸿沟。它构建紧凑模型架构,信息压缩率达7056倍,训练分三阶段,测试中表现出色,也存在局限。
还在为拍视频头疼?AI 一键生成短视频,这工具也太香了吧!
文章介绍开源工具 Pixelle-Video,它能让视频创作变得简单。输入主题,它可自动撰写文案、生成配图、合成语音、添加音乐并合成视频,还支持多种功能和大模型,有多种使用和付费方案。