视觉语言预训练」共找到 3299 篇相关文章

开源动态7

推出 AnyLanguageModel:在 Apple 平台统一本地与远程大语言模型的 API

语言模型是构建现代软件的重要工具,但 Apple 平台开发者集成模型困难。Hugging Face 发布 AnyLanguageModel,是 Swift 包,可替代 Apple Foundation Models 框架,支持多模型服务商,降低使用 LLM 难度。

Hugging Face
算法论文8

Nature Machine Intelligence颠覆有机化学研究范式,上海交大发表化学合成大语言模型

上交大AI4S团队依托平台,联合多团队在AI for Chemistry领域获突破。相关研究发表于《Nature Machine Intelligence》,介绍白玉兰化学合成大模型Chemma,它加速有机合成全流程,在多任务表现出色,还能解决数据稀疏等问题。

AI科技评论
新闻资讯7

耗时15年、扫描1400个大脑!她发现了藏在人脑中的「生物版ChatGPT」

MIT神经科学家Ev Fedorenko扫描约1400人大脑,识别出“生物版ChatGPT”——语言网络,它负责将词语与意义映射、拼成句子,揭示了语言与思维分离,研究发表在《Nature Reviews Neuroscience》。

新智元
新闻资讯7

The Batch: 867 | 印度推动本土人工智能建设

印度在资金有限、语言与方言众多情况下,正加倍努力建设本土大模型。政府资助初创企业、调配算力,多家公司研发多语言模型,虽面临挑战,但旨在开发符合自身需求的人工智能。

DeeplearningAI
算法论文8

直播预约 | SwS: 强化学习训练能否不依赖外部知识优化模型的弱点?

该论文提出强化学习场景下的启发式数据合成流程(SwS),利用模型自我感知弱点驱动自动化问题生成,弥补推理缺陷。对其扩展后适应性更广,在多基准测试集和模型上验证有效,性能提升显著。

深度学习自然语言处理
算法论文8

10个小模型并联跑赢GPT-4.1!无额外训练,方法仅4步

上海人工智能实验室等机构提出Avengers框架,无需额外训练,通过四步集结小模型优势。实验表明,其在15个数据集上平均得分超GPT - 4.1,还探究了框架有效的要素,对AI研究和开源社区意义重大。

量子位
开源动态8

用多模态LLM超越YOLOv3!强化学习突破多模态感知极限|开源

华中科技大学、北京邮电大学等多所高校研究团队共同推出纯多模态开源LLM——Perception-R1,该模型用强化学习优化视觉感知,目前论文和代码均已开源,其在视觉任务上表现出色,为后续研究提供强大baseline。

量子位
产品应用7

训练世界模型,开始从人类的肌肉和脑子里偷师了

具身智能数据竞争进入新阶段,第一视角视频虽缓解数据量问题,但未记录人行动的原因及大脑身体实时修正。FaceMind提出Ego - NeuroLoop数据范式,配套NeuroMatrix和NeuroBooster,将训练数据从“行为库”推向“闭环库”。

量子位
推荐文章7

如何为 GPU 提供充足存储:AI 训练中的存储性能与扩展性

文章分析 MLPerf Storage v2.0 测试结果,探讨不同存储系统在 AI 训练中表现。在满足 GPU 利用率阈值下,能支撑更多 GPU 的存储系统扩展性与稳定性更强,还需关注资源利用率。以太网存储方案灵活且成本效益高。

AI前线
算法论文8

蚂蚁VLDB最佳论文:用一张“逻辑表”驯服3050亿条训练数据

蚂蚁集团论文《OmniTable: A Unified Wide-Table System for Petabyte-Scale LLM Data Curation and Exploration》获VLDB工业赛道最佳论文。其研发的OmniTable系统能管理超35PB、3050亿条以上训练数据,解决数据准备难题,如在SFT任务中大幅缩短周期。

量子位