「训练数据污染」共找到 3922 篇相关文章
OpenAI算力账单曝光:70亿美元支出,大部分钱花在了“看不见的实验”
据Epoch AI统计,去年OpenAI计算资源支出70亿美元,多以租微软云算力支付。其中50亿研发算力,大多用于幕后研究和实验,非爆款模型的最终训练,也解释了其2024年亏损原因。
从BERT到T5再到Qwen3:关于Embedding的八点总结
哈工大30+页综述聚焦通用文本嵌入(GPTE),系统介绍其架构、数据、模型,探讨预训练语言模型(PLM)给GPTE带来的基础能力与高级扩展,还涉及多模态、多语言、代码嵌入等应用。
阿里发布Qwen3-TTS:跨语言混合无缝切换,方言音色全面覆盖!
TTS技术从单一合成进化到多模态表达,但传统模型在跨语言/方言混合场景有不足,商业工具费用高且不开源,开源方案训练数据少。阿里推出Qwen3 - TTS,实现人类级自然度和表现力,功能强大,应用场景多。
4000 万美金新一轮融资,ACE 成为 AI 音乐赛道融资额最高的华人团队
近日,AI音乐公司ACE完成近4000万美元新一轮融资,成AI音乐赛道融资额最高的华人团队。它自己训练音乐基础模型与做应用,构建数据飞轮,还推出新消费级产品Miya,欲打造AI时代的Spotify。
1100多个模型殊途同归,指向一个「通用子空间」,柏拉图又赢一回?
约翰斯・霍普金斯大学研究发现,1100多个不同神经网络,即便训练条件不同,最终权重会收敛到共享低维子空间,表明架构比数据影响大。此发现能解释诸多现象,还有多种应用可能,但也有局限性。
让大模型理解真实医疗视频,全球首个开源技术方案来了!
AI 进入医疗领域需谨慎,此前美国引入不成熟 AI 致手术失误频发。全球首个医疗视频理解大模型元智医疗视频理解大模型发布并开源,解决了医疗视频领域的任务优化、数据缺失和无法评测痛点。
没想到,最Open的开源新模型,来自小红书
向来低调的小红书昨日开源首个自研大模型 dots.llm1,它是中等规模的 MoE 模型,在较小激活量下性能良好。其开源力度堪称行业最大,还介绍了数据处理、训练优化等多方面技术细节。
CVPR2026 | Streamo:让大模型变成实时流式交互助手
香港浸会大学联合腾讯优图实验室提出 Streamo,将‘何时回答’变为模型预测的 token,通过端到端训练框架把离线视频模型转化为实时流视频助手,还构建 Streamo - Instruct - 465K 数据集,实验效果良好。
想进OpenAI?先解出这道题,百万美元算力已就位
OpenAI发起Model Craft Challenge「Parameter Golf」项目,要求在固定数据集上降验证损失,模型产物控制在16MB内,8张H100 GPU 10分钟完成训练。提供百万美元算力,6月招早期人才,挑战3月18日至4月30日。
14万一台家务机器人!斯坦福华人博士具身创业首款产品亮相,用户还能买回去自己教
斯坦福华人博士赵子豪与迟宬创业推出家务机器人Memo,售价2万美元。它能完成多项家务,依赖ACT - 1具身模型,该模型用技能捕捉手套采集人类数据训练,用户还能教它新本领,预计2026年正式推出。