视觉语言预训练」共找到 3315 篇相关文章

推荐文章8

对话际数科技联创:质量赛道的先驱者,要做空间数据的「精炼厂」

本文是对际数科技三位联合创始人的访谈。在具身智能时代数据采集火热但数据荒严重背景下,际数关注数据质量,其以测绘背景为底气,用‘一张图、一把尺、一个飞轮’搭建技术护城河,打造质量因子库,还创新训练质量模型,有稳定商业路径。

机器之心
算法论文8

大模型外挂“三维物体知识库”来了,大幅增强机器人长程自主操作能力

现有视觉语言大模型(VLM)能让机器人理解指令,但在操作中缺三维空间知识。近日研究提出 RAM 框架,它像“三维物体知识库”,为 VLM 补充空间知识,经 14 项实验验证其操作能力,还探索了在铰接与柔性物体操作中的应用。

DeepTech深科技
新闻资讯7

Sora 2 惊现 LLM 推理能力,视频生成模型也能搞推理?

Sora 2在科学推理基准测试中获55%成绩,虽不敌GPT - 5,但一个视频生成模型能做推理令人惊讶。Epoch AI实验发现其可能借LLM重写提示词答题,网友也证实背后或有GPT - 4o等处理。此外,Google研究显示视频模型经大量训练或有推理能力。

AGI Hunt
新闻资讯8

阿里一口气发了N款新模型,让我们向源神致敬。

阿里云栖大会发布众多模型,有Qwen3 - Max、Wan2.5等。Qwen3 - Max对标顶尖模型;Wan2.5支持音画同出;Qwen3 - VL是强大视觉语言模型且已开源;Qwen3 - Omni是全模态模型。此外还有多个新模型,构建全场景生态。

开源星探
开源动态7

Unsloth-MLX:在Mac上微调LLM,代码无缝迁移到云端GPU

对于Mac用户,在原型实验阶段反复租云端GPU是资源浪费。开发者推出Unsloth - MLX,基于MLX框架,让Mac用户本地高效微调大模型,改一行导入语句就能无缝迁移代码到云端,还介绍项目特点、状态等。

AI工程化
算法论文8

Anthropic让AI先读员工手册再上岗:失控率从54%降到7%

Anthropic最新研究「模型规范中期训练」(MSM)显示,相同训练数据配不同行事原则,模型表现不同。MSM在预训练和对齐微调间加中间阶段,让模型读规范文档理解准则,在特定实验中,将Agent失控率从54%降到7%。

新智元
开源动态8

LeCun的世界模型单GPU就能跑了

LeCun世界模型有新进展,开源极简训练方案LeWorldModel,单GPU就能跑,基于JEPA架构,速度快、参数小、控制强且懂物理,完胜此前JEPA方法,训练更简单。

量子位
新闻资讯7

OpenAI这招太狠!AI从「躲猫猫」到「自爆黑料」,主打一个坦白

随着AI进入高风险场景,透明、安全变得重要。OpenAI提出「忏悔机制」,让模型回答后产出自我坦白报告,不影响主回答评分,只考察诚实,能提升不良行为可见性,目前仍处概念验证阶段。

新智元
新闻资讯8

在 AI「囤粮潮」里,拆解智谱 50 亿美元的「技术账本」

AI行业进入下半场,竞争重心转向持续迭代能力,本文围绕智谱50亿美元融资事件,拆解其资金投向与技术布局,分析头部大模型厂商的竞争逻辑。

AI科技评论
开源动态8

一个LoRA实现GPT-4o级图像编辑!浙大哈佛新模型冲上Hugging Face榜二

随着Gemini、GPT - 4o等把基于文本的图像编辑推向高峰,提高性能常需大量数据和大参数量模型。而浙大哈佛团队提出ICEdit,用少量数据和参数实现高质量图像编辑,媲美甚至超越商业大模型。

新智元