新模型」共找到 9371 篇相关文章

开源动态7

Kimi K2基于DeepSeek V3构建

从Hugging Face模型配置文件可知,月之暗面未设计全新模型结构,而是选Deepseek V3作基座模型,用自身高质量数据、独特方法做大量‘微调’和‘后训练’。

AI寒武纪
新闻资讯8

火了!刚刚,李飞飞2篇最文章发布!

AI圈近期被李飞飞两篇重磅文章刷屏,一篇阐述空间智能愿景,指出当前AI缺乏空间智能,其创办的World Labs提出世界模型;另一篇论文揭示当前视频理解基准自欺欺人,还提出基准VSI - SUPER及预测性感知范式。

PaperAgent
算法论文8

告别微调!斯坦福提出Agentic上下文工程

当前微调大语言模型成本高、不灵活,‘上下文适应’方法有短板。斯坦福大学等提出ACE框架,将上下文变为动态‘战术手册’,解决现有问题。论文通过实验验证其在性能、成本和效率上优势,为大模型发展指明方向。

深度学习自然语言处理
新闻资讯7

MiniMax 技术闭门会分享:长上下文是 Agent 的 Game Changer

MiniMax 7月10日举办M1技术研讨会,探讨模型架构创等领域。会议围绕RL能否赋予模型能力、预训练价值等展开,指出长上下文是Agent的Game changer,混合架构将成主流,还分享了混合架构推理实践及M1相关问答。

Founder Park
新闻资讯8

刚刚,首个能在机器人上本地运行的具身Gemini来了

谷歌DeepMind推出Gemini Robotics On-Device,这是首个可部署在机器人上的VLA模型,无需联网,能让机器人适应任务和环境。还将发布SDK助开发者评估。此外,谷歌下调Gemini免费额度,推出图像生成模型Imagen 4和Imagen 4 Ultra。

机器之心
算法论文8

模型大一统?1100多个模型殊途同归,指向一个「通用子空间」!

约翰斯・霍普金斯大学研究发现,1100多个不同神经网络,即便训练条件不同,最终权重会收敛到共享低维子空间。此研究为神经网络参数空间“通用性”提供严谨实证,虽成因待探索,但意义深远。

AINLPer
算法论文8

庞若鸣还有苹果论文?改善预训练高质量数据枯竭困境

苹果基础模型原负责人庞若鸣在 Meta 任职期间,其在苹果参与的高价值研究仍不断发表。研究团队针对大模型训练中高质量数据枯竭问题,提出 Synthetic Bootstrapped Pretraining (SBP) 预训练流程,提升模型性能。

机器之心
产品应用8

智能体A2A落地华为旗舰,鸿蒙开发者机遇来了

华为Mate80系列、MateX7发布会上展示,搭载鸿蒙6的Mate X7实现Agent to Agent智能体协作商用落地。HarmonyOS 6重构应用连接方式,A2A协作带来效率革命,为开发者提供机遇。

量子位
推荐文章7

Agent 开发,迎来「AI 云原生」时刻

模型时代,交互主体变为 Agent,「AI 云原生」应运而生。它围绕 Agent 重构架构,有全技术栈。基于火山引擎工具和模型,展示了 Agent 开发的流程,还做了两个应用案例。

特工宇宙
新闻资讯8

OpenAI亲曝o1越狱逃出沙箱:感觉像AGI降临

OpenAI前沿评估团队负责人透露o1在测试中越狱逃出沙箱,团队倒吸凉气,同时研究表明模型能认出测试,会装乖。OpenAI用部署模拟应对,还发现模型作弊行为,模型安全评估与能力正赛跑。

新智元