FP8训练」共找到 2627 篇相关文章

开源动态8

阿里Qwen3一口气开源多个向量&排序模型,冲!

今天阿里正式开源Qwen3-Embedding和Qwen3-Reranker系列,为多语言文本嵌入和相关性排序树立新标杆。提供0.6B/4B/8B三种版本,支持119种语言,在多个数据集达先进性能,赋能多种应用场景。

PaperAgent
开源动态7

Mem0,用LLM给智能体解决记忆问题,开源

大模型训练后知识和记忆不再增加,智能体记忆能力发展不理想。国外Mem0针对AI记忆技术发表论文并开源,提出Mem0和Mem0g两种方案,在不同场景表现出色,已获多应用,还提供SaaS服务。

AI与安全
新闻资讯7

o4-mini暴击六大数学天团,攻破陶哲轩难题!4.5h激战人类阵地失守

Epoch AI团队举办竞赛,约40位数学精英分成8组与o4 - mini - medium在FrontierMath基准上对决。o4 - mini击败6组团队,虽未完全超越人类,但Epoch AI预测到2025年底AI可能超30% - 50%人类基准。

新智元
开源动态8

Nanbeige4.2-3B:探索通用Agent小模型

在模型越做越大的当下,推理成本成了影响Agent大规模使用的关键因素。南北阁实验室推出Nanbeige4.2 - 3B,在架构、数据构造和训练pipeline层面做了系统工作,评测表现良好,还探索本地个人助手等应用。

AIGC开放社区
新闻资讯8

梁文锋叫停签约,DeepSeek百亿新融资或全面暂停;白宫控月之暗面蒸馏Anthropic Fable 5遭驳;腾讯员工晒317万年终奖被辞永不录用|Q资讯

本文汇总一周AI行业热点,有DeepSeek百亿融资或暂停、Karpathy或从Anthropic离职等消息,还涉及腾讯、360、美团等公司动态,以及多个新模型发布与技术成果。

InfoQ
算法论文8

怎么量化机器人数据价值?ATHENA将影响函数扩展到十亿参数VLA,313×加速筛选高价值数据

具身智能进入数据scaling时代,VLA模型训练中数据并非越多越好。上海交大同济等校团队提出ATHENA框架,将影响函数扩展到十亿参数VLA模型,解决计算和筛选难题,实现313倍加速,实验证明其用更少数据获更好效果。

机器之心
算法论文8

李飞飞 、 英伟达 Jim Fan 、徐丹飞三巨头联合重磅论文,改写灵巧手触觉赛道

近日,李飞飞、英伟达Jim Fan等顶尖学者联合发表论文《T-Rex: Tactile-Reactive Dexterous Manipulation》。指出过去具身行业在灵巧手触觉的探索方向可能错误,目前加触觉会让机器人变笨,但也给出解决方法,真机实测T-Rex表现优异。

AI科技评论
开源动态8

登上Nature子刊!Meta脑机接口重大阶段性进展,超高实时解码准确率

Meta在非侵入式脑机接口研究取得重大进展,Brain2Qwerty v2能从原始脑信号实时解码句子,平均词准确率达61%,最优78%。研究团队开源训练代码,数据集也同步开放,但应用于临床仍面临精度和设备限制。

机器之心
7

马斯克麾下最惨打工人:手滑删掉xAI三周训练数据

xAI一名员工在数据迁移时误删了2到3周的核心训练数据,这或为Grok重组震荡后遗症。xAI为追Claude等,采取喂Cursor数据、自研V9等策略,还曾借道访问竞品模型。如今xAI把算力租给对手变现。

新智元
新闻资讯8

Claude 通过率不到 4%,SaaS-Bench 撕碎了 Computer-Use 的「全自动办公」幻想

UniPat AI用SaaS - Bench测试,让Agent在真实工作环境中执行任务。结果显示,Claude Opus 4.7端到端完全通过分数仅3.8%,多数模型表现差,还暴露Agent四种致命缺陷,揭示其与真实工作能力有巨大鸿沟。

机器之心