「微调加速」共找到 886 篇相关文章
OpenAI首席研究员Mark Chen长访谈:小扎亲手端汤来公司挖人,气得我们端着汤去了Meta
OpenAI首席研究官Mark Chen在访谈中爆料Meta抢人大战升级成送汤大战,还谈到OpenAI核心研究团队规模、应对Gemini 3策略等。他认为OpenAI本质是研究公司,有信心在预训练和模型性能上超越对手,还提及OpenAI for Science等计划。
营收破亿,光轮智能完成数亿元 A 及 A+轮融资,揭秘机器人「数据荒」背后的生意经
近日,光轮智能完成数亿元 A 及 A+轮融资,已与全球头部企业合作,年营收破亿。其创始人谢晨博士指出机器人基础模型开发存在数据短缺问题,光轮通过仿真环境生成数据,是 NVIDIA 生态核心伙伴。
Lumina-DiMOO:多模态扩散语言模型重塑图像生成与理解
上海人工智能实验室推出多模态扩散语言模型 Lumina - DiMOO,它基于离散扩散建模,打破多模态任务壁垒。相比传统自回归架构模型,它解决了生成慢、质量受限等问题,在多项评测中夺魁。
Nano Banana 2突然现身!能画公式解数学题,监控画面都能伪造
Nano Banana 2代以预览版现身第三方网站,后被移除。其能力远超1代,能处理复杂提示,可生成复杂UI、解数学题甚至伪造监控画面。谷歌正将Nano Banana整合进核心产品生态。
祝贺小马智行港交所上市!|5Y News
11月6日,小马智行在港交所主板挂牌上市,成2025年全球自动驾驶最大IPO。此前已在美上市,构建“美股+港股”架构。创始人称站在商业化前夜,其核心业务多元,成本下降,还拓展全球版图。
英伟达用NIM + NV-Tesseract模型,提高芯片生产良率
芯片制造良率控制难题待解,传统方法各有局限。英伟达推出NV - Tesseract模型家族和NIM推理微服务,二者结合用于半导体晶圆厂生产,可实时发现问题、预测故障,降低成本,为制造打开新大门。
无Tokenizer时代真要来了?Mamba作者再发颠覆性论文,挑战Transformer
Mamba作者之一Albert Gu参与的论文提出分层网络H - Net,用动态分块取代tokenization。Tokenization虽能压缩序列但有缺点,H - Net在多方面表现出色,或预示无需Tokenizer训练时代到来。
AI Agents,年中总结!
文章梳理6月旧金山AI Engineering World's Fair重磅分享,指出AI Agent发展方向是成为自主处理复杂工作的助手,还介绍了Ambient Agents崛起、Agent UX设计两派观点、训练进入RL时代等关键趋势。
端到端GUI智能体首次实现“犯错-反思-修正”闭环,模拟人类认知全过程
南洋理工大学MMLab团队提出框架GUI - Reflection,让端到端多模态GUI智能体有“自我反思”能力。它在各训练阶段引入“反思与纠错”机制,实验证明该框架能提升智能体能力。
PolyVivid实现多主体视频定制,身份一致性超越现有模型
现有视频生成模型在多主体定制中难保持身份一致与自然交互,上交和腾讯提出PolyVivid框架解决此问题。它在多方面优于现有方法,还介绍技术原理、演示效果,证明其在多领域有实用价值。