「预训练研究」共找到 3737 篇相关文章
纯血国产!4B模型越级打怪,杀入万亿赛道
9月1日,Hugging Face上线星火X2.5-4B和1.7B开源端侧模型,在多指标测试中表现优异,实现“越级打怪”。该模型基于全国产算力平台训练,在断网笔记本上实测效果惊艳,使用了两项技术提升能力,适配性强。
科学家证实磁场真的能改变基因表达,但它的要求非常严苛
韩国东国大学 Jongpil Kim 团队研究证实磁场能改变基因表达,该团队绕开 ferritin 路线,通过全基因组筛选找到关键基因 Cyb5b,拼起磁场→基因表达分子链,并在抗衰老、阿尔茨海默病、抑郁症血清素调控方面做了活体验证。
坏了,我成AI的乙方了!Anthropic论文爆火,谁还敢无脑Copy?
Anthropic开年论文实锤AI让程序员变傻,用AI辅助的人比纯手写只快2分钟,且测验平均分低17%。研究将工程师使用AI的交互行为归纳为五种模式,指出主动拷问AI才能进化,高分者会主动制造障碍。
陶哲轩:AI 已经把想法成本降到几乎为0了...
著名数学家陶哲轩在与播客主持人Dwarkesh Patel的对谈中分享使用AI一年后的观点,认为AI已将想法生成成本降至几乎为零,但验证和评估成新瓶颈,还探讨其对数学研究的影响及未来发展。
北大团队提出 SHINE:将任意文本转化为大模型 LoRA,仅需一次前向传播!
北大团队提出全新超网络架构 SHINE,仅需一次前向传播就能将任意文本转化为大模型 LoRA 参数,支持多轮对话。该方法实用潜力大、架构创新高效,训练流程成熟,推理快速,为大模型持续学习提供新思路。
10w人看过的龙虾量化系统,评论区骂最多的问题,我花2天补上了。
上一篇龙虾量化系统文章获10w+,评论指出数据是短板。作者经研究找到QVeris,它是统一数据接口平台,使用简单。作者以金融领域为例介绍其用法,还测试其在其他领域的能力,认为它是AI时代的数据基础设施。
对话原力灵机周而进:模型2.4B就够用,关键是“具身原生”;能闭环才是最高效方法
原力灵机推出首个具身原生模型产品DM0,仅2.4B参数,却能支撑实时处理画面与真机进化。其合伙人周而进称要走具身原生路线,还介绍了数据采集、模型训练等多方面内容及公司发展规划。
TypeScript 之父 Anders Hejlsberg:别折腾“AI新语言”了,真正变天是 IDE 让位给 Agent
TypeScript 之父 Anders Hejlsberg 在与 GitHub 研究顾问对谈中回应质疑,称选 Go 重写编译器合理。他认为 AI 编程时代,TypeScript 语言服务将重塑,IDE 或让位给 Agent,还谈到 AI 在代码迁移中的应用及开源可持续性问题。
斯坦福&英伟达提出新范式:推翻Scale Law,在“推理”阶段自我进化,超越人类专家
斯坦福和英伟达提出 TTT - Discover 新范式,允许模型在测试时继续训练,针对难题‘进化’。它设计了自适应熵目标函数和 PUCT 状态复用组件,实验在多领域碾压人类专家与同行,但在部分领域落地有局限且计算成本高。
OpenAI被曝瞄准AI音乐赛道商业化,Suno首当其冲
据悉,OpenAI已和艺术学院合作许久,不久将进军AI音乐。它正与茱莉亚学院学生合作标注乐谱用于模型训练,还可能探索To B市场。此前OpenAI就有音乐模型尝试,此次或因Suno盈利佳而重拾音乐梦,Suno恐受冲击。