架构重构」共找到 2739 篇相关文章

算法论文7

人大-清华-腾讯发布:音频 - 视觉多模态任务统一框架

人大、清华和腾讯合作发布Crab论文,目标是实现多模态场景理解任务的高效一统。它针对音频 - 视觉理解模型难点提出解决方案,建数据集、设计LoRA结、统一架构,训练分预训练和指令调整两阶段。

CourseAI
产品应用7

Deep Search 如何理解业务仓库代码?

文章系统介绍Deep Search和Deep Research概念、与传统RAG区别、主流商业产品与开源方案、在代码领域应用及未来规划。提出Deep Search方案,建独特代码理解与检索架构,还计划研发专用代码搜索Agent。

阿里云开发者
开源动态8

自定义轨迹驱动AI视频生成,ATI无需训练适配多种生成模型

字节提出视频生成运动控制统一框架ATI,通过轻量级运动注入器将用户定义轨迹投影至预训练图像 - 视频生成模型潜在空间,实现协调控制。用户指定关键点及路径控制运动,无需新训练,适配不同架构

带你学AI
开源动态8

MiniMax M2.5:230B参数仅激活10B,开源模型首次逼近Claude Sonnet,成本仅十分之一

MiniMax推出新一代开源模型M2.5,官方称其为‘为现实世界生产力设计的开源前沿模型’。性能逼近Claude Opus 4.6,采用混合专家架构,成本低。已在内部大规模部署,定位为‘AI员工’。

AI工程化
产品应用7

阿里通义发布Z-Image非蒸馏版基础模型版本,支持完整CFG和负向提示

阿里通义发布Z-Image基础图像生成模型,采用单流扩散Transformer架构,具核心创新技术。它是非蒸馏模型,支持完整CFG和负向提示,注输出多样性和创意控制,已在Hugging Face开放下载。

AI工程化
新闻资讯8

Claude Code 的创始人揭秘工作流程:开 5 个智能体“玩编程游戏”,不看的程序员就落后了?

Anthropic公司Claude Code创始人Boris Cherny在社交平台分享工作流程,引发行业关注。他并行运行5个Claude智能体编程,用最大最慢模型Opus 4.5,还解决AI“健忘症”,实现复性任务自动化。

InfoQ
开源动态8

Meta开源史上最强语音“基座模型”:一口气支持1600+种语言

Meta AI FAIR团队发布Omnilingual ASR模型套件,能为超1600种语言提供自动语音识别能力。它引入新架构提升性能,改变引入新语言范式,还发布相关数据集和模型,与全球伙伴合作。

AI寒武纪
推荐文章7

Claude Agent Skills:从第一性原理深入剖析

本文深入剖析Claude的Agent Skills系统,它是基于提示的元工具架构,借助‘提示展开’与‘上下文改写’扩展大模型能力。文中以具体技能为例,介绍其机制、建方法、编写规范及常见模式。

PaperAgent
新闻资讯7

奥特曼给ChatGPT空降高管,11亿美元收购独角兽创始人加入OpenAI…这剧情好熟悉啊

OpenAI将以11亿美元全股票收购Statsig,原高管加入负责要产品线,内部还完成大人事调整,将心进一步放在应用程序方面,组织架构向应用层面倾斜并加强ToB业务拓展。

量子位
开源动态8

微软开源新版Phi-4:推理效率暴涨10倍,笔记本可运行

今天凌晨微软官网开源Phi - 4家族最新版Phi - 4 - mini - flash - reasoning,它参数小性能强,适合边缘设备。采用自研SambaY架构,推理效率涨10倍,延迟降2 - 3倍,多场景测试表现优异。

AIGC开放社区