「视觉理解」共找到 1302 篇相关文章
从「能用」到「好用」:数据可视化的三个维度,你还在第一层吗?——人大提出图表创作新方式
数据可视化面临静态视觉与动态叙事挑战,如设计繁琐、动画门槛高、交互难复用。中国人民大学IDEAS Lab团队与山东大学交叉研究中心推出PiCCL、CAST、Libra,解决创作难题,还探索用大模型提升可视化效率。
端到端智驾新SOTA | KnowVal:懂法律道德、有价值观的智能驾驶系统
北京大学王勇涛团队提出新型自动驾驶系统 KnowVal,通过感知与知识检索模块协同实现视觉 - 语言推理。它构建驾驶知识图谱,有价值模型用于轨迹规划,实验在多基准测试表现佳,还通过定性分析验证效果。
The Batch: 892 | 教育应与 AI 协作,而非对抗
三年多前ChatGPT发布,教育改变。曾寄望用AI检测器识别生成文本,但学生易规避。检测难维持信任,还可能惩罚错对象。生成式AI可提升学习,应构建新评估模型,如展示真实理解等。
国足缺席世界杯,但中国大模型们集体参赛
联想在2025联想天禧AI生态伙伴大会宣布举办AlphaGoal预测杯,8家中国大模型将与普通球迷、开发者的AI Agent同台,预测世界杯赛果。这或触发足球体验革命,推动AI走向真实世界。
OiiOii意外走红背后:为何10万人排队等一个不完美的AI Agent?|甲子光年
OiiOii是成立不到半年、团队仅十余人的初创公司,产品尚处内测,却引来近10万人排队申请。创始人闹闹有丰富履历,不回避产品缺陷,公司已获天使轮融资,将全力投入迭代。
Nano Banana Pro或将引爆新安全危机
基于Gemini 3的图像生成模型Nano Banana Pro昨日上线,支持2K/4K分辨率生成,排版和文字控制能力提升。它展现出复杂推理能力,能理解反光、推理指纹,但这或带来隐私危机。
小红书提出DeepEyesV2,从“看图思考”到“工具协同”,探索多模态智能新维度
小红书推出多模态模型DeepEyesV2,它延续视觉推理优势,实现代码执行、网页搜索和图像操作的全工具协同。通过多工具协同推理解决复杂问题,采用两阶段训练策略,准确率远超开源模型。
识别1600+种人类语言,支持少样本扩展到5400+种语言,Meta自动语音识别模型开源
Meta AI发布Omnilingual ASR自动语音识别模型并开源。它能转录超1600种语言,含500多种首次被AI理解记录的语言,还可通过少样本扩展到5400多种,改变了多语言ASR构建范式。
RAE的终极形态?北大&阿里提出UniLIP: 将CLIP拓展到重建、生成和编辑
北大和阿里团队提出 UniLIP,解决了统一多模态模型中语义理解与像素重建的矛盾。它创新微调 CLIP,实现图像重建,还提出双条件架构用于生成和编辑,在多基准取得 SOTA 性能。
AI百科全书SciencePedia:当马斯克Grokipedia遭遇滑铁卢,有个中国团队默默把活儿干了
在知识爆炸时代,传统互联网平台难以满足用户获取深度见解的需求,马斯克的Grokipedia也未达预期。深势科技等团队推出SciencePedia,它能理解知识关系,追踪科学脉络,让真知高效抵达用户。