模型架构」共找到 8617 篇相关文章

开源动态8

Sora2还在5秒打转,字节AI生视频已经4分钟“起飞”

字节和UCLA联合提出Self - Forcing++方法,无需更换模型架构或重收集数据集,就能生成分钟级长视频,最长达4分15秒,高质量且开源,在长、短时长生成上性能领先。

量子位
开源动态8

刚刚,DeepSeek全新多模态技术开源!

DeepSeek联合北大、清华开源多模态技术及论文,提出“视觉基元推理”框架,解决MLLM指代鸿沟问题。基于DeepSeek - V4 - Flash构建的模型,性能比肩GPT - 5.4等。论文还介绍架构、训练流程等。

PaperAgent
算法论文8

Agent进入下一篇章!Alita:不靠人工预设,自己造工具,成绩碾压OpenAI

当前AI Agent依赖人工预设,存在工具不够用、缺乏创造力、兼容性差等问题。Alita秉持少预设多进化理念,用MCP协议,架构含三大模块,实验成绩超OpenAI,还能让小模型提效。

深度学习自然语言处理
推荐文章8

摩尔线程天使投资人:对近期AI的四十个观察

摩尔线程天使投资人王捷整理关于AI经济四十个问题,涵盖模型发展、经济影响、就业冲击等方面,如Scaling Law收敛、AI扩散时间、数字层机制等,为探讨AI经济提供观察视角与分析框架。

机器之心
开源动态7

DeepSeek悄悄开源LPLB:用线性规划解决MoE负载不均

昨天,DeepSeek 在 GitHub 上线新代码库 LPLB 解决 MoE 负载不均。它利用线性规划算法优化专家并行工作负载分配,能处理动态波动,但也存在忽略非线性成本等局限,对 MoE 架构训练加速有参考价值。

机器之心
推荐文章8

商汤林达华万字长文回答AGI:4层破壁,3大挑战

在WAIC 2025上,商汤发布国内首个实现“图文交错思维”的商业级大模型日日新6.5。商汤科技联合创始人林达华发文,剖析多模态通用智能实践,解答AI领域关键问题,提供通往AGI的参考。

量子位
开源动态8

微软重磅开源!22K星的 VibeVoice 再添新成员,60分钟音频 ASR 端到端统一输出!

现在的 ASR 模型处理长音频存在断章取义、说话人错乱等问题。微软开源 VibeVoice-ASR,可一次性处理 60 分钟音频,实现“三位一体”输出,补齐 VibeVoice 生态,还介绍了特点、架构、使用方法与应用场景。

开源星探
产品应用8

Qoder 发布首个自进化的智能体:看 Quest 如何重构了 Quest

Qoder 发布首个自进化智能体 Quest,它能自主完成重构自身长程任务执行逻辑等任务。Quest 从上下文管理、工具选择、Agent Loop 三方面优化架构,还具备自主进化能力,正探索自主编程新可能。

阿里云开发者
开源动态8

The Batch: 855 | 为智能体而生

总部位于北京的 Moonshot AI 发布 1 万亿参数的 Kimi K2 系列大语言模型,包括预训练和微调版本。它输入输出能力强,架构独特,在多基准测试领先,支持工具调用,多家服务商已集成。

DeeplearningAI
算法论文8

盘一盘,2017年Transformer之后,LLM领域的重要论文

本文梳理2017年Transformer后LLM领域重要论文。如提出Transformer架构的论文成现代AI基石;介绍GPT - 3的论文确立‘大模型 + 大数据’缩放定律,引领LLM军备竞赛等。还列举各论文内容与影响。

机器之心