「模型训练难题」共找到 8633 篇相关文章
刚刚,Andrej Karpathy放出大招:开源nanochat项目,仅8000行代码100美元就能训练出一个ChatGPT
Andrej Karpathy发布nanochat项目,用8000行代码实现ChatGPT完整训练流程。在8xH100节点跑4小时、花100美元,就能有对话、写故事、答题的AI助手。项目覆盖广,含多训练步骤及评估体系。
顶级视频模型半衰期只有 30 天,但生成式媒体 infra 公司的收入却在一年增长了 60 倍
文章聚焦生成式媒体 infra 公司 fal.ai,其借统一 API 和云端平台让开发者高效调用多模态模型。深入分析其成功因素,如早期押注生成式视频、优化算力和成本、构建生态等,还探讨用户使用模式与行业发展趋势。
专访贾奎:世界模型不是Demo是生意,10亿融资到位,跨维智能冲刺IPO|甲子光年
甲子光年专访跨维智能创始人贾奎,他提出“Physical Token经济学”,认为物理AI不能只依赖巨量投入和宏大叙事。跨维智能近期完成10亿B轮融资,正冲刺世界模型赛道第一股。贾奎还介绍了公司技术路线、世界模型选择和落地进展。
Anthropic CEO:模型可在一亿上下文窗口中学习,且不改变权重,未来AI将每月10万美元
Anthropic CEO Dario Amodei预测几年内将出现月费10万美元、支持1亿词上下文窗口的AI模型。Google Research论文揭示LLM能在不改变权重下,通过「临时便签」机制学习,还介绍了其原理与实验验证。
第一个用物理做计算原语的大规模生成模型Un-0来了,或将AI能耗降低1000倍?
Unconventional AI 发布首个以物理为计算原语的大规模生成模型 Un-0,由‘模拟耦合振子系统’驱动。其目标是降低 AI 能耗,在 ImageNet 64×64 上 FID 达 6.74,质量接近部分主流传统图像生成方法刚发布时水平。
OpenAI新模型gpt-oss-120b怎么样?三大场景实测首发(对比GLM-4.5-Air)
OpenAI发布新开源模型gpt-oss-120b,时隔6年再推开源权重语言模型,给LLM开源生态增添变数。作者实测它在三大场景的表现,并与GLM-4.5-Air对比,认为其距开源SOTA有距离。
Luma Uni-1.1 API开放,图像模型榜单第三,文字渲染直逼GPT image 2
今年图像生成模型迭代快,海外AI初创公司Luma将统一图像模型Uni - 1升级到1.1版并开放API。它在榜单排名前三,价格与延迟低,有诸多品牌客户接入。展示了多场景应用效果,技术路线独特,定价有优势。
Google 发布首个全模态 Embedding 2 模型,文本图片音视频 PDF 统一到一个向量空间
Google发布Gemini Embedding 2模型,它是业界首个原生支持文本、图片、视频、音频和PDF五种模态的Embedding模型,可将这些数据映射到同一向量空间,在多模态RAG、跨模态搜索等场景有应用,还介绍了跑分、用法、竞品、价格等情况。
南大等8家单位,38页、400+参考文献,物理模拟器与世界模型驱动的机器人具身智能综述
当下,具身智能成研究热点。南大等8家单位学者撰写综述论文,指出物理模拟器与世界模型融合是实现具身智能的潜力路径。论文系统梳理两者协同推动机器人演进全貌,还提出分级标准等内容。
视频实时生成可交互! 两位自动驾驶大牛创业世界模型:40毫秒/帧,无需任何游戏引擎,人人免费可玩
李飞飞押注的世界模型领域有新成果,Odyssey公司由两位自动驾驶大牛创立。其AI无需游戏引擎,40毫秒/帧实时生成视频,玩家能实时交互。虽处于早期预览版,但已展现潜力,世界模型或成竞争热点。