「视觉 - 语言数据」共找到 3799 篇相关文章
GPT 4o-mini华人领队离开OpenAI:真正推动AI进步不是模型架构,而是互联网
前OpenAI研究员Kevin Lu加入Thinking Machines Lab,该公司2025年7月获约20亿美元早期融资,估值约120亿美元。Kevin Lu曾主导GPT - 4o mini发布,他认为真正推动AI进步的是互联网,而非模型架构。
交大&华为联手:AI智能体进化的五种关键能力
随着大型语言模型兴起,基于LLM的聊天机器人能完成多样语言任务。上海交通大学和华为团队提出分析框架,探讨LLM聊天机器人向AI智能体进化的五个关键维度、改进方法及未来发展方向。
OpenAI推出免费的、LaTeX 原生科研写作神器Prism
OpenAI推出免费科研写作工具Prism,可理解为“AI增强版的Overleaf”,整合LaTeX编辑器、协作工具和AI助手。它原生支持LaTeX,能云端实时协作,内置GPT - 5.2,即日起ChatGPT个人账户用户可访问。
全网破防,AI「手指难题」翻车逼疯人类!6根手指,暴露Transformer致命缺陷
最近网友被AI「手指难题」逼疯,给AI六指手,它始终无法数对。GPT - 5.2、Nano Banana Pro等均翻车。此问题揭露当前模型思考机械、割裂等缺陷,也凸显Transformer架构弱点。
看完最新国产AI写的公众号文章,我慌了!
AI 快砸作者饭碗,智谱 GLM - 4.6V 能根据 NeurIPS 2025 最佳论文生成图文并茂的公众号文章。它还能助力学生看论文、分析财报等,可复刻网站、处理视频,在多模态评测中达同级别 SOTA。
9位顶级研究员连讲3晚,华为盘古大模型底层研究大揭秘
华为诺亚方舟实验室成果颇丰,4月开发千亿级通用语言大模型Pangu Ultra,5月推出稀疏大语言模型Pangu Ultra MoE。5月28 - 30日,机器之心联合举办分享会,9位研究员揭秘量化、剪枝等关键技术突破。
把VLM塞进隐式世界模型,小鹏机器人新框架让机器人长出物理直觉
机器人大脑架构中VLM和VAM路线各有短板,香港大学、小鹏机器人等团队提出DIAL框架,让VLM在原生特征空间做隐式世界建模,解耦认知决策与底层执行,在机器人部署中表现优异。
732M模型超越7B!机器人操控新范式:从视频中「悟」物理
机器人操控有「数据困境」,传统方法需大量人工标注动作演示数据。中山大学王广润教授团队从视频生成模型「借」物理直觉,提出PAR和PhysGen,与英伟达DreamDojo核心思路一致,验证了新的技术路线。
8.9K Star!号称 Notebook LM 开源平替,支持 16+AI 模型,一键部署!
Google Notebook LM 虽方便,但有数据泄露风险且被平台绑定。开源工具 `open-notebook` 是其平替,支持 16 + 家 AI 模型提供商,可处理多模态内容,能本地部署保障数据安全,还具备多种实用功能。
高性能全闪并行文件系统的设计和实践
焱融科技 CTO 张文涛在 QCon 大会分享‘高性能全闪并行文件系统的设计和实践’,介绍了焱融全闪文件存储架构和 YRCloudFile 技术细节,分享其解决 AI 训练存储难题的方案。