多阶段训练」共找到 5959 篇相关文章

算法论文8

打破视觉Token的算力诅咒,RedundancyLens如何为模态大模型推理减负

模态大模型的 Decoder - only 架构处理视觉 Token 有计算冗余。合合信息团队提出无需额外训练的动态计算削减方法,在不影响性能前提下降低推理成本,适用于场景。

PaperAgent
开源动态8

本地运行、支持视觉与工具调用:Meta 开源智能体模型

Meta AI Research 推出 300 亿参数的开放权重模型 Muse Glimmer,采用 Apache 2.0 许可证。它专为本地工作流设计,能在消费级硬件运行,经项优化,在基准评估中表现出色,还支持种框架。

AI前线
算法论文8

无Tokenizer时代真要来了?Mamba作者再发颠覆性论文,挑战Transformer

Mamba作者之一Albert Gu参与的论文提出分层网络H - Net,用动态分块取代tokenization。Tokenization虽能压缩序列但有缺点,H - Net在方面表现出色,或预示无需Tokenizer训练时代到来。

机器之心
新闻资讯8

“千问奶茶”在二手平台6元转售;追觅俞浩:年终奖最高20个月奖金,总量会达到10亿级;京东001号快递员:退休金4000,存款百万|AI周报

这是一份AI周报,涵盖行业热点、大模型发布等方面信息。有追觅俞浩高额年终奖计划,马云现身阿里千问项目组引发‘千问奶茶’活动热潮,还有域名交易、企业收购、模型发布及应用等动态。

AI前线
开源动态8

21.7K 标星的开源TTS!FishAudio开源情感语音核弹:200万小时炼成“声优AI”!

FishAudio团队推出新一代TTS语音模型OpenAudio S1,基于200万小时音频数据训练,采用Qwen3+Descript Audio Codec架构。它能实现情感表达,在TTS - Arena榜单登顶,还提供不同版本适配,适用场景广泛。

开源星探
开源动态8

测试时也能RL,英伟达等提出全新范式:TTT-Discover

近日,斯坦福、英伟达、Together AI 等联合开源全新测试时新范式 TTT - Discover,在测试阶段用强化学习微调模型,以刷出 single best 结果,用几百美元就刷新诸领域 SOTA。

PaperAgent
开源动态8

字节开源模态复杂文档解析模型!Dolphin:页面与元素并行解析,精准解析复杂文档!

模态AI与文档解析兴起,传统OCR解析复杂文档常出错。字节跳动开源模态模型Dolphin,通过两阶段机制精准解析,有种功能,安装使用友好,适用于场景,降低了复杂文档解析门槛。

开源星探
新闻资讯7

Stripe 的零停机数据转移平台以毫秒级流量切换迁移 PB 级数据

在旧金山 QCon 会议上,Stripe 工程师介绍零停机数据转移平台,能 PB 级数据库迁移,流量切换毫秒内完成,支持每秒 500 万次查询和 99.9995% 可靠性。还讲了迁移六阶段用途。

InfoQ
算法论文8

推理时扰动高熵词,增强LLM性能

香港科技大学(广州)研究团队发现LLM推理时,一小部分高熵词显著影响输出正确性。基于此提出MTI方法,含Selective CFG intervention与Lightweight negative - prompt guidance,无需额外训练,能提升模型推理能力。

机器之心
新闻资讯7

她拒了贝索斯,离开黄仁勋,只为回答一个问题:AI能学会物理世界吗?

近日,AI初创公司Accelerated Understanding亮相,由Anima Anandkumar夫妇创立。它未随主流,目标是训练模拟物理现象的通用AI模型。该模型处理数据规模大,公司想解决AI验证瓶颈,产品面向科研工程机构。

DeepTech深科技