两阶段训练法」共找到 3112 篇相关文章

开源动态8

12项世界第一!国产基模一战封神,11亿参数逆袭70亿大魔王

蚂蚁灵波的LingBot-Depth 2.0空间感知模型,在测试中拿下12个世界第一,解决了玻璃、细小物体等行业难题。它还与奥比中光达成合作落地商业应用。其核心预训练基模LingBot-Vision被开源,有望加速具身智能生态发展。

新智元
产品应用8

aiX-apply-4B逆袭DeepSeek-V3.2!aiXcoder发布代码变更应用模型,单卡推理提效15倍

3月25日,硅心科技发布专为代码变更应用场景设计的模型aiX - apply - 4B。它平均准确率达93.8%,超越Qwen3 - 4B和DeepSeek - V3.2,算力成本仅为后者5%,推理速度提15倍。还采用创新训练方法,适配企业场景。

机器之心
算法论文7

ICLR 2026 | 越推越快! 首个面向「Test-Time Scaling」的投机解码基准

文章指出推理阶段扩展(TTS)能提升推理大模型解决复杂问题的能力,但会产生大量冗余计算。为此提出首个面向TTS的投机解码加速综合基准,评测显示N - gram方法在特定场景加速潜力大,混合策略性能更优。

AI科技评论
新闻资讯7

AI5芯片搞定,马斯克的纯自研超算Dojo 3又回来了

马斯克宣布AI5芯片设计进展顺利,特斯拉将重启Dojo 3工作。Dojo项目定位为面向机器学习训练的超算,此前曾暂停。如今Dojo 3将集成AI5或AI6芯片,有望助力特斯拉摆脱对英伟达依赖,自建算力体系。

机器之心
开源动态7

压缩之外,Visual Tokenizer 也要理解世界?

MiniMax和华中科技大学发布视觉tokenizer新研究VTP,引发业界热议。该研究揭示传统仅以重建为目标的视觉tokenizer缺乏高层语义表示,提出在预训练中引入语义理解,还发现Scaling Law现象,虽有争议但为研究提供新视角。

机器之心
算法论文8

Meta超级智能实验室又发论文,模型混一混,性能直接SOTA

大语言模型训练依赖算力和时间,传统模型 Souping 多采用均匀平均。Meta 等研究者提出类专家 Soup(SoCE),利用基准测试类别构成选最优模型,非均匀加权平均,实验显示其提升了模型效果与稳健性,在排行榜获 SOTA 成绩。

机器之心
新闻资讯7

千亿市值巨头,超百亿押注算力产业链

东山精密在今年6月收购光模块企业索尔思光电后股价暴涨、市值破千亿,近日又宣布子公司投资不超10亿美元建高端PCB项目。项投资额超百亿,但索尔思光电有研发迟缓、毛利率低等问题,东山精密高端PCB技术也不足。

芯师爷
推荐文章7

2025-04-努力不是做好事情最重要的因素

作者分享个人生活、工作等多方面情况,提及播客发布,认为努力非工作做好的关键因素,深入探讨Agent在业务应用中的问题,还谈及视频更新、投资经历等,最后表示要审视目标、精简事务。

chaofa用代码打点酱油
新闻资讯8

端侧AI从「能跑」到「会进化」,元空智能跑进惠普预装

北大出身的创业团队元空智能,提出大模型静态互联网数据红利见顶,端侧是下一轮能力跃迁核心,重新定义端侧AI为「模型×Agent×设备」,发布Boxer端侧模型与款Agent产品,其端侧AI已拿下惠普商务电脑预装,实现规模化落地。

量子位
新闻资讯7

全球看中国,灵初智能用10万小时人类数据写下具身智能的中国答案

2026年,“世界模型”成具身智能高频词。灵初智能联合创始人陈源培认为其非核心方向,而是数据迁移工具。灵初关注人类操作数据转化,在10万小时量级上可大幅替代真机数据,还介绍了系统模块、数据集及商业化阶段等情况。

机器之心