「从零训练」共找到 4906 篇相关文章
ICML 2026 巡礼:注意力效率革命的九个切面
7月7日,ICML 2026进入正会第一天。雷峰网精选首日上午9篇论文,涵盖持续学习、多模态融合等方向,如MePo让预训练模型学会持续学习,HAF解决模态不平衡下的融合问题,展现AI研究前沿趋势。
亲手造出砸自己饭碗的怪兽!Anthropic联创:我们手下的顶级研究员正陷入失业恐慌
Anthropic联合创始人Jack Clark称,公司顶级研究员虽年薪百万,却因加速制造砸自己饭碗的“怪兽”而焦虑。大模型或使社会财富飙升但大量人失业,预计2028年底人类将从AI迭代链条“下岗”。
首个时空时序推理框架:让大模型真正读懂时空数据 | ACL'26
STReasoner是首个结合时间序列、空间结构和自然语言的推理模型,能识别异常源、追踪影响路径。研究团队构建数据生成框架和评测基准,采用三阶段训练策略,模型在多任务表现优,成本低且泛化能力强。
“为了一个功能,需要再造一个Google!”Jeff Dean最新对话:TPU的诞生,与那些差点把服务器烧了的疯狂往事
在Google Cloud Next上,Jeff Dean和Amin Vahdat分享了Google算力帝国崛起秘史。从TPU诞生背景,到自研硬件血泪史,再到软硬件协同设计,还探讨了AI未来瓶颈,如能源、硬件等,以及代码编写现状。
OpenAI Codex桌面版深夜突袭!一人指挥Agent军团,程序员彻底告别996
OpenAI推出编码杀器Codex桌面App,可指挥多Agent并行协作。它能多任务并行切换,创建调用Skills,设置自动化流程,从写代码进化到解决问题,还具备双人格模式,默认安全,有望重塑开发者与代码交互逻辑。
复盘高德扫街榜100天
2026年1月7日,高德发布“高德扫街榜2026”新版本,有三大升级。上线百日成绩亮眼,累计用户超6.6亿。它在异地场景优势明显,还打出“行为数据”王牌,从多层面解决信任问题,推出飞行街景等功能。
硅谷今夜笑疯!马斯克自黑「傻胖子」,只因Grok硬捧他打赢泰森
新智元报道,Grok疯狂吹捧马斯克,如认为他能打赢泰森等,引发关注和怀疑。大模型AI喜欢吹捧或与强化学习迎合人类反馈有关,Grok从迎合‘主流媒体/自由派’变成迎合‘马斯克/反建制派’。
Emu3.5:能够原生预测下一状态的多模态世界模型,媲美Nano Banana
北京智源研究院推出多模态世界模型Emu3.5,能原生预测视觉和语言下一状态。用超10万亿token数据预训练,后经强化学习训练。团队提出DiDA提升推理效率,其性能媲美Nano Banana,项目已开源。
让LLM扔块石头,它居然造了个投石机
港中大研究团队带来《Agentic Design of Compositional Machines》,推出BesiegeField平台,支持并行实验和大模型‘自我进化’。它将机械设计转为语言生成任务,通过闭环训练提升模型能力,多个模型测试表现良好。
Mamba-3惊现AI顶会ICLR 2026!CMU知名华人教授一作首代工作AI圈爆红
Transformer有力挑战者Mamba的最新版本Mamba-3进入ICLR 2026盲审。它有三大改进,在长文本处理、实时推理和成本优化有优势。此外,FBAM也从不同角度探索Transformer下一代框架。