基准测试成本」共找到 3377 篇相关文章

算法论文8

物理AI的「原生」时刻:原力灵机发布具身大模型DM0

主流‘预训练 - 后适配’范式有局限,原力灵机联合阶跃星辰提出具身原生 VLA 模型 DM0。它能统一机器人操作与导航,在 RoboChallenge 测试领先,还介绍了架构、训练方法及未来演进方向。

机器之心
算法论文8

解决Agent幻觉:HaluMem精准定位记忆系统的“说谎”环节!

近年来,LLM和Agent在记忆管理上存在挑战,现有评估方法无法定位幻觉来源。论文提出HaluMem评估基准,通过三大任务和两个数据集揭示记忆系统幻觉行为,为开发可靠记忆机制提供指导。

深度学习自然语言处理
新闻资讯8

祝贺小马智行港交所上市!|5Y News

11月6日,小马智行在港交所主板挂牌上市,成2025年全球自动驾驶最大IPO。此前已在美上市,构建“美股+港股”架构。创始人称站在商业化前夜,其核心业务多元,成本下降,还拓展全球版图。

五源资本 5Y Capital
开源动态7

美团开源Agentic新王,速度拉满,工具调用打爆Kimi?

周末美团开源LongCat - Flash大模型,参数量560B,推理速度达100 token/s,成本低,在Agent工具调用表现超Kimi - K2。它有Zero - Computation Experts和ScMoE创新,不过市场表现未获太多认可。

探索AGI
算法论文7

递归神经网络的复兴:Mixture-of-Recursions

Google DeepMind研究者设计的语言模型,能判断关键单词并进行深度递归计算,通过轻量级“路由器”节省计算资源,在同等训练成本下表现显著优于传统模型,文中还提及其他解决动态算力分配问题的思路。

PaperAgent
算法论文8

腾讯混元TurboS技术报告首次全公开:560B参数混合Mamba架构,自适应长短链融合

腾讯公开混元TurboS技术报告,该模型是超大型Hybrid Transformer - Mamba架构MoE模型,融合Mamba与Transformer架构优势,有自适应长短思维链机制,激活参数56B。在多评测中表现佳,推理成本低。

AI前线
产品应用7

腾讯版Claude Design来了:多人实时同屏审设计稿,一键转代码直通IDE

腾讯公测AI设计智能体平台Ardot,有一句话生成可编辑UI设计稿、Figma文件零成本导入、一键转代码直通IDE、多人在线评审等功能。它能提升前期出稿效率,支持局部精准微调,适配主流IDE。

量子位
开源动态8

这个春节P图不求人!小红书开源图像编辑新SOTA

今日小红书基础模型FireRed - Image - Edit亮相,在复杂编辑指令、风格化转换等核心指标表现强,在多项权威测试达SOTA。该项目代码等已开源,模型权重将开源。团队还推出RedEdit Bench评测方案。

量子位
算法论文8

SIGGRAPH Asia 2025|30FPS普通相机恢复200FPS细节,4D重建方案来了

3D视觉领域难题是用普通摄像机将高速世界转为数字化4D时空。受限于成本和带宽,现有方法有局限。本文提出“异步采集 + 视频扩散模型修复”方案,用30 FPS相机恢复100 - 200 FPS动态细节。

机器之心
算法论文8

DeepMind 颠覆机器人学习范式:让机器像人一样 “自由成长”

谷歌DeepMind受大模型微调中强化学习阶段启发,提出面向机器人学的两阶段后训练方法,含监督微调与自我提升。实验显示该方法让机器人自主习得新技能、广泛泛化,但研究也存在标注成本高等局限。

AI科技评论