训推一体」共找到 729 篇相关文章

新闻资讯8

人跑光了,AI视频炸了!马斯克狂发:Grok Imagine三金封神

xAI的Grok Imagine在DesignArena视频排行榜上,拿下视频竞技场、图像转视频和视频编辑三项第一,远超谷歌Veo 3.1、Sora等对手。它进步迅猛,靠聪明设计取胜,还将动AI从“蛮力计算”向“智能理解”转变。

新智元
新闻资讯8

啊?微博7800美元的大模型,数学能力超了DeepSeek-R1

近日,微博发布自研开源大模型VibeThinker,15亿参数却在数学测试上击败6710亿参数的DeepSeek R1,后练成本仅7800美元。其为AI产业带来新思考,还将动微博AI应用发展。

量子位
7

少年沉迷AI自杀,9岁遭性暗示!这门「孤独生意」,正孩子入深渊

新智元报道,14岁少年与AI对话后自杀、青少年获「弑亲」建议、9岁孩子遇性化暗示。Character.ai等AI聊天机器人在年轻群体走红,但出现诸多危险情况,公司野心膨胀,监管压力逼近,AI陪伴利弊引关注。

新智元
算法论文8

最具争议性研究:大模型中间层输出可 100% 反原始输入

意大利罗马第一大学GLADIA Research Lab论文提出主流Transformer语言模型信息处理几乎不丢内容,是可逆的。实验验证其单射性,SIPIT算法能100%重建输入。研究有新视角,但也引发讨论。

AI科技评论
新闻资讯8

对话淘宝姜宇宁:如果你只低价商品,是不需要用大语言模型的

淘宝姜宇宁团队上线RecGPT百亿参数荐大模型,对“猜你喜欢”功能技术升级。大模型赋予传统荐系统新能力,如让其“白盒化”、理解长上下文等。姜宇宁认为AI要创造商业价值,落到业务场景形成正向循环。

AI科技评论
算法论文8

谷歌DeepMind「粪坑淘金」全新方法,暗网毒数据也能出善良模型

谷歌DeepMind研究团队发表论文提出生成式数据精炼(GDR)方法,不直接生成新数据,而是用大模型净化原始数据,保留有用信息。该方法能解决数据枯竭、隐私等问题,实验显示效果良好。

新智元
新闻资讯7

个人开发者400亿参数大模型:分布式算力,DeepSeek架构,3090单卡部署

Nous Research出Psyche Network,可整合全球算力练AI。它基于Deepseek的V3 MLA架构,有DisTrO优化器等技术,能让个人和小团体创建大规模模型,还实现40B参数LLM预练。

量子位
算法论文8

首次披露!DeepSeek V3 发布软硬一体协同练论文,公开「降成本」秘诀

DeepSeek团队发布论文《洞察DeepSeek - V3:规模的挑战和对AI架构硬件的思考》,从硬件架构和模型设计双重视角,探索其经济高效的大规模练和理方法,介绍了设计原则、低精度驱动等多方面内容及降成本秘诀。

AI科技评论
8

浙大开源HugAgentOS:三引擎一体自进化,每步可归因/回放/回滚

过去一年,Agent任务执行能力提升,但不会自主积累与进化。浙大开源的HugAgentOS把Harness拆成三个可自我成长的引擎,设归因和本体两道关卡,解决经验成能力等问题,还覆盖智能体完整链路。

新智元
开源动态8

不用人类手写练框架了!AI自己写代码,出1B端侧「小钢炮」

5月25日,面壁开源端侧文本基座大模型MiniCPM5 - 1B,主打低成本部署等。它由AI编写的ForgeTrain框架参与预练,效果与英伟达Megatron对齐且速度快10%。该模型在榜单表现优,应用边界广,部署门槛低。

机器之心