「视觉语言导航」共找到 1627 篇相关文章
Runway Gen-4.5刷屏发布,把重量、尘土和光影都做对了,网友:颠覆
Runway Gen-4.5突袭发布,获“视频生成AGI时刻”评价,在Artificial Analysis测试中拿下SOTA。它能精准执行复杂指令,物理还原与视觉精准度强,官方将逐步开放使用权限,还直言其存在因果推理等局限。
L4大方向有了:理想自动驾驶团队,在全球AI顶会上揭幕新范式
在全球计算机视觉学术顶会 ICCV 2025 上,理想汽车自动驾驶高级算法专家詹锟发表演讲,阐述了‘从数据到训练’的系统化思路,提出将世界模型与强化学习闭环落地于量产自动驾驶系统的完整架构。
这种眼镜我建议外卖快递小哥人手一个
亚马逊为快递小哥配备智能眼镜“Amelia”,早期版本正实测。它基于先进技术,能扫描包裹、导航等,明年中期量产。亚马逊还或推消费级眼镜“Jayhawk”,与Meta竞争。今年AI眼镜赛道热闹,国内外大厂纷纷入局。
Chrome已死,AI浏览器当立!认知革命比技术成熟来得更快。
文章指出AI浏览器重新定义底层逻辑,从导航工具变为执行意图的引擎,有持续意图记忆等核心能力。即便成功率不高,用户也易完成认知转变,还总结了AI产品团队应知道的规律及失败类型。
5大维度、4类模态:LLM/Agent数据分析技术全景图
文章分享《LLM/Agent-as-Data-Analyst: A Survey》,上交大、清华、微软等将「LLM/Agent 当数据分析师」技术拆成 5 大设计维度与 4 类数据模态,给出 100+ 代表性方法等,还介绍不同数据类型的分析技术。
The Batch: 883 | 美国两个州禁止人工智能驱动的心理健康治疗
美国伊利诺伊州成继内华达州后,第二个禁止用人工智能进行心理治疗的州。该法案限制聊天机器人独立治疗及其他AI使用方式,旨在保护患者和人类治疗师,但也引发对全面禁止利弊的讨论。
刚刚,美团开源 SOTA 推理模型 LongCat-Flash-Thinking,性能逼近 GPT5-Thinking
美团宣布开源高效推理模型 LongCat-Flash-Thinking,性能逼近 GPT5-Thinking,是国内首个结合多种推理能力的大语言模型。它采用新方法提升性能,已在多平台开源,API 平台免费开放,还兼容主流 API 格式。
T2R-Bench发布:业内首个由表格生成报告工业基准
为解决大语言模型将表格信息转化为报告的难题,研究团队提出“表格到报告”任务,构建双语基准T2R - bench,其涵盖多垂域表格,还设计评价指标体系,实验显示大模型在该基准上提升空间大。
大模型训练新突破!Meta提出LSP:无数据也能实现能力飞升
Meta提出语言自我博弈(LSP)方法,利用自我博弈框架让模型自我改进,不依赖额外数据。LSP赋予模型挑战者和解题者身份,引入GRPO和KL散度正则化技术,解决了大模型训练的数据依赖难题。
快手发布Keye-VL-1.5,同量级SoTA,让模型真正看懂视频!
近年来,多模态大语言模型兴起,但视频理解仍是难题。快手Keye团队推出Keye-VL-1.5,通过Slow-Fast编码策略、渐进式四阶段预训练和全面后训练流程等创新,实现视频理解突破,综合性能领先。