「跨视角视觉理解」共找到 1460 篇相关文章
小鹏加速冲向L4终局:对VLA架构「动刀」成关键一环
在辅助驾驶领域,端到端的VLA方法虽有效果,但面临中间层语言难以准确表达物理世界细节的问题。小鹏汽车去掉“语言转译”环节,推出第二代VLA,有跨代级驾驶体验,背后是底层技术架构重构。
OpenClaw机器人引爆天网!首次拥有世界记忆,天网在GitHub「开源」了
全球开源机器人圈被引爆,装载OpenClaw的宇树人形机器人开始理解时空,拥有“世界记忆”能力。这是具身智能里程碑式突破,成果开源且硬件无关。网友看法不一,开发者回应质疑。
程序员每十年就“要被取代”一次:这件事从 1969 年开始
文章回顾软件开发史,从 COBOL 到如今的 AI 编程工具,每次新技术都承诺让编程变简单,但始终无法绕开复杂性。指出软件开发瓶颈在处理复杂性的思考能力,提醒用新工具时保持清醒。
实测夸克「千问划词快捷指令」,这7个邪修Prompt,建议收藏
新年 DeepSeek 发布技术论文,网友难理解便求助 AI。夸克 AI 浏览器更新,‘千问划词’支持自定义快捷指令,实测精选 7 类实用指令,还介绍了操作方法,且其功能不断进化。
图像编辑缺训练数据?直接从视频中取材,仅用1%训练数据实现近SOTA效果
百度研究人员提出将图像编辑视为退化的时间过程,Video4Edit利用视频预训练模型知识迁移,仅用主流编辑模型约1%监督数据,在图像编辑任务达近SOTA效果,解决数据稀缺与权衡难题。
这可能是我见过最“接地气”的 AI 科普:从家政阿姨看懂 Agent 和 MCP
作者以家政阿姨打扫卫生为例科普AI名词,如阿姨比作AI Agent,扫地机器人是SubAgent,智能家居协议对应MCP,《家政技能手册》为Skills,借此辅助解释常见AI概念,助读者理解。
AI Native 的影像公司们,颠覆赛道的机会来了!
文章指出过去50年影像公司通过推动坐标点向「计算」端移动创造商业变量。如今计算突破天花板,带来理解、增强、生成现实三层价值释放,解锁新场景,AI Native影像公司机会巨大。
Meta开源多语言语音识别系统,支持1600种语言,可轻松扩展新语种!
Meta研究团队开源Omnilingual ASR,能理解1600种语言,用几条语音 - 文本配对样本就能零样本扩展新语种。提供三种架构,满足不同需求,性能超现有多语种模型,应用场景广泛。
Meta 系 95 后华人明星团队,创业一年就与高通达成合作,让手机拥有多模态记忆
由华人创业者沈俊潇创办的 Memories.ai 发布 LVMM 2.0 并宣布与高通合作,该模型 2026 年将在高通处理器上原生运行。它解决视频可搜索性问题,应用广泛,能降低延迟、确保数据安全等。
AI 的本质不是算力,而是「上下文革命」
上交大刘鹏飞团队提出人工智能本质是“上下文革命”,在论文中把“上下文”提升为智能系统核心结构,提出“上下文工程”学科框架,通过实验揭示智能发展规律,为AI发展指明新方向。