「FP4训练」共找到 3412 篇相关文章
4个MIT的00后,两年干出全球最火AI编程工具,600亿美元卖给了SpaceX
今年1月,Cursor CEO Michael Truell决定训练自有模型,不再依赖Anthropic的Claude。5个月后,SpaceX以600亿美元收购Cursor母公司。此前Cursor增长快但依赖Claude,自研模型有成本优势却缺算力。
高潮从第几秒开始?GaMMA 让多模态大模型真正「听懂」音乐时间线
现有多模态大模型难以理解音乐时间线。复旦大学与字节跳动团队提出 GaMMA,采用双编码器融合网络,经三阶段训练,还推出 MusicBench 评测基准。实验显示,GaMMA 在多基准上表现优异,刷新 SOTA。
同一天两件大事!小模型直接掀翻千亿参数,走向效率为王
5月13日AI圈有两件大事,何恺明团队发布语言模型ELF,面壁智能开源MiniCPM-V 4.6。二者显示AI正从‘堆算力’转向‘省算力’,拉开AI轻量化浪潮序幕,未来小模型或成关注方向。
统一视觉多模态与多任务!快手可灵与港科大团队发布视频生成模型,加速真实世界理解
港科大、港中文、清华和快手可灵团队提出全新视觉框架UnityVideo,统一训练多种视觉模态,让模型更懂物理规律,视频生成更真实可控,还实现零样本泛化,在多任务表现优异。
Meta 发布 Docusaurus 3.9,新增 AI 搜索功能
近日 Meta 发布 Docusaurus 3.9,重点更新有现代化运行时环境、增强 AI 搜索能力、提升国际化灵活性。如支持 DocSearch v4 让用户对话查内容,提高 Node.js 最低要求,改进 i18n 配置等。
公开模型一切,优于DeepSeek-R1,英伟达开源Llama-Nemotron家族
英伟达推出面向高效推理的 Llama-Nemotron 系列模型,包括 Nano、Super、Ultra 等规模,具备卓越推理能力与效率,采用开放许可。模型支持动态推理切换,训练结合多方法,性能优于 DeepSeek-R1 等。
没有头,没有脚,还能三折叠,周衔团队发布首款「非人形」机器人
机器人创业公司Genesis AI发布首款通用机器人Eno,它是轮式且配机械臂,无腿无头部,外壳颜色可定制。其由自研模型GENE驱动,预计2026年Q4发货,落地从工业到生活场景。
两分钟Claude Code模型换成DeepSeek,立省17倍,缓存后爆省120倍
GitHub开源deepclaude,两分钟可将Claude Code模型换成DeepSeek V4 Pro,开销直降17倍。自带上下文缓存机制,重复对话成本降120倍。支持多后端选项,可丝滑切换,还能打破设备限制远程编程。
第六章 Coding优先编的是「过程与约束」,不是「参数」
本章以开面包店类比训练大模型,介绍 AutoResearch 自主实验框架。它将研究生助理工作循环交给 Agent,在固定时间用单一指标判断好坏。仓库获约 64.7K Stars,Karpathy 设计哲学为极简主义与固定约束。
GenEnv:智能体与环境模拟器之间的难度对齐协同进化 | 直播预约
训练高性能 LLM 智能体受限于真实世界交互数据的成本和特性,为此推出 GenEnv 框架,它建立难度对齐协同进化博弈,能让智能体表现提升,减少数据使用量,为扩展能力提供数据高效路径。