「中训练」共找到 4232 篇相关文章
扩散不死,BERT永生!Karpathy凌晨反思:自回归时代该终结了?
苹果前员工Nathan Barry得出BERT本质是文本扩散一步的结论,将表示学习算法改造成生成算法。OpenAI创始员工Karpathy对此沉思,认为生成逻辑在LLM架构中可变。实验证明RoBERTa可转为生成引擎。
达摩院推出多智能体框架ReasonMed,打造医学推理数据生成新范式
在人工智能领域,推理语言模型在医学场景应用存在挑战,达摩院推出多智能体框架ReasonMed,提出医学推理数据生成新范式,开源百万级高质量数据集ReasonMed370K,验证了‘小模型 + 高质量数据’的潜力。
AI 浏览器压根不可能成为新的操作系统
近期AI浏览器成大模型主战场,营销中模糊Browser和OS边界。文章指出‘AI Browser = OS’不成立,分析原因,还提出定义为Agent操作层更合适,未来或走向能力优先、标准互通的‘通用容器’模式。
理解规范驱动开发:Kiro、spec-kit和Tessl
作者尝试理解规范驱动开发(SDD),查看了 Kiro、spec - kit 和 Tessl 三个自称 SDD 的工具。介绍了 SDD 定义、规范含义,分析评估工具的挑战,还指出工具存在不适合多数编程问题、审查体验差等问题。
单张4090跑到30fps,范浩强团队让VLA实时跑起来了
Dexmal原力灵机团队在RT - VLA论文中公布,常用Pi0级30亿参数VLA模型在单张RTX 4090上最快能跑30fps。他们深入分析优化模型,成果已开源,还设计了未来控制框架。
张小珺对话李想:3小时长谈总结(AI、VLA与组织进化)
张小珺半年前与李想3小时长谈,围绕AI展开多话题探讨。李想认为AI应成生产工具,赞赏DeepSeek,还分享VLA架构、理想终局规划,提出管理心法,思考AI与人关系。
美团杀入视频生成模型赛道,LongCat-Video 136亿参数媲美顶尖模型,效率提升10倍
美团LongCat团队发布LongCat - Video基础视频生成模型,有136亿参数量,多任务表现出色。它核心亮点多,还建立了数据处理流水线,采用特殊架构和训练方法,提升了生成效率,性能媲美顶尖模型。
当 AI 下场炒 A 股,「推理」成了新的直觉
海外“AI Trading Battle”实验中,不同大模型交易表现差异大。港科大等团队提出RETuning方法,基于A股数据集验证,显著提升大模型金融预测准确率、推理可解释性,是综合改进方案,但有算力等局限。
P图老本事搭上了对话框,美图这AI Agent到底香不香?
本文对美图AI Agent RoboNeo进行实测。它web端操作简单,生图和p图功能丰富,拆分图层功能好用,工作流能辅助创作。不过它生成速度慢,视频生成有画面逻辑、文字生成等问题。其开发节奏快。
AI杀入美股,DeepSeek又是第一!港大90后开源,AI股神人人都能造
在港大「AI - Trader」项目中,DeepSeek以9.68%收益率击败GPT、Claude等顶级模型,成为能在美股自主盈利的AI交易系统。项目开源,还暴露出AI不同「性格」,显示市场是AI终极试金石。