对象级理解」共找到 1688 篇相关文章

推荐文章7

OpenAI 首位营销负责人:产品没找到 PMF 之前,营销没价值

OpenAI首位营销负责人Krithika Shankarraman表示,ChatGPT这类产品营销核心是帮用户理解应用场景与价值。有效营销需全公司协同,产品找到PMF后营销才真正有价值,还分享了营销四步法等经验。

Founder Park
算法论文8

AI终于“长”进机器人身体里!机械臂学会用触觉思考

香港科技大学申亚京教授团队研发出具身机器人手臂 EmArm,实现亚毫米触觉定位与实时‘感知 - 行动’闭环。研究还提出‘感知 - 驱动’一体化算法,为打造物理 AI 机器人提供可扩展技术路径。

DeepTech深科技
产品应用7

豆包也开始抢程序员饭碗了,首个编程模型来了!

字节给豆包升编程能力,推出首款编程模型Doubao - Seed - Code。它刷新国内编程模型上下文长度,支持视觉理解,API价格良心。经测试,虽未达全球顶尖,但弥补国产编程模型短板。

开源星探
开源动态8

文生图进入R1时代:港中文MMLab发布T2I-R1,让AI绘画“先推理再下笔”

港中文MMLab团队发布首个基于强化学习的推理增强文生图模型T2I - R1。它提出双层CoT推理框架和BiCoT - GRPO强化学习方法,解决生成评估难题,为多模态生成提供新范式。

量子位
产品应用8

黄仁勋100万亿预言兑现!易鑫Voice Agent落地,汽车金融迎效率革命

2024年GPT - 4o问世后,Voice Agent创业公司涌现,但通用方案在金融等场景「水土不服」。易鑫深耕汽车金融,自研工业Voice Agent系统,采用Model + Harness方法论,实战数据亮眼,还将向泛金融领域延伸。

新智元
开源动态8

AI下半场的战场,从Agent记忆体正式打响

OpenClaw开源项目爆火,标志AI进入下半场走向真实应用。关键在于解决AI在现实中持续干活的问题,核心是Agent Memory。论文梳理该赛道,指出其是系统记忆体结构框架,未来关键在memory策略可学习。

机器之心
产品应用8

这届MWC真成了中国AI主场,小米直接把AI从对话框里拽出来接管物理世界了

全球AI竞争从技术探索进入应用兑现期,中国凭场景、数据和硬件生态领跑。小米在MWC展示人车家全生态,用顶尖AI能力和10亿生态让AI走出屏幕,实现空间智能,率先占位全球竞争。

量子位
开源动态8

LTX-2开源:首个能同时生成视频和音频的模型

LTX-2开源,它是Lightricks团队开发的首个开源多模态基础模型,能联合生成音频和视频。采用非对称双流扩散变换器架构,用深度多语言文本编码器,速度比许多纯视频开源模型快,让模型理解声画关联。

AI工程化
算法论文8

UNC | 发布Bifrost-1,构建“最强大脑”与“顶画师”的桥梁,低成本实现“文生图”自由

随着AI发展,打造能推理又能创作的系统成为焦点。但让LLM学习视觉创作面临训练成本高和能力受损问题。BIFROST - 1框架在MLLM和扩散模型间建通信信道,解决核心痛点,实验表现出色。

AINLPer
算法论文7

The Batch: 931 | 统一视觉媒体的单一分词器

Apple团队开发多维分词器AToken,可将图像、视频、3D对象映射到共享token空间,统一处理视觉媒体。它由预训练编码器和解码器组成,经多阶段训练,在多任务上达或接近先进水平,为视觉模型带来通用性。

DeeplearningAI