「点云视觉」共找到 1842 篇相关文章
C罗刚头球破门,AI解说脱口而出!全模态实时流太狠了
2026世界杯正热,阿里云在Flink Forward Asia 2026大会宣布Apache Flink 3.0进入Agentic Streaming For AI时代,推出全模态数据流处理能力,可让AI实时解说比赛。Flink 3.0解决了流式Agent数据处理难题,已有智能运维等应用场景。
别再乱调图像塔了!浙大 IJCAI 论文揭露 VLM 非对称性真相,给 CLIP 微调「踩刹车」
浙大陈静远教授课题组等提出自适应非对称适配器,放弃对图像分支硬性微调,引入预测置信度自动给视觉塔‘踩刹车’。经实验总结出微调三大核心洞察,在多个数据集测试中表现优异。
终结多智能体视觉幻觉“滚雪球”!新国立等提出ViF:无需改造模型,即插即用
多智能体协同做视觉任务常轮次越多错得越离谱,根源是信息传递方式有缺陷。新国立等研究人员提出轻量通用的ViF范式,无需改造基座模型,可大幅压制幻觉滚雪球,已入选ICLR 2026。
Gemini 3 Pro加持!这款开源神器 Clipsketch AI,帮你自动抓帧、画图、写爆文!
自媒体内卷,‘视频转图文’是流量入口,简单截图难满足需求。clipsketch - ai 开源项目用 Gemini 3 Pro 和 Nano Banana Pro 模型,实现视频理解、AI 绘画和写作自动化,解决创作者素材整理、版权等痛点。
GraphRAG圈新秀:文档级RAKG
随着大模型能力增强,知识图谱成研究热点。传统KGC有实体消歧难、模式僵化等痛点。文章提出RAKG框架,将RAG评估机制引入知识图谱构建,实现文档级自动化构建与评估,多指标表现优异。
这个Coding Agent框架要火!Cursor、Claud太慢了
AI Agent赛道爆发,开发编码代理效率低。新出的jcode框架将Coding Agent功能整合,解决痛点,内存效率高、启动快、资源占用少,还能为开发者省80%底层开发时间。这是赛道成熟信号。
更少的token生成更好的图!香港大学联合阶跃星辰等让AI绘画真正理解了再画
香港大学、阶跃星辰等用VFMTok新方法,让图像生成模型借用顶级视觉AI的眼睛看世界,实现更快、高质量图像生成,且无需复杂引导技巧。它改变图像理解方式,将像素死记硬背转为语义理解。
Qwen深度研究一夜升级!可生成网页和音频播客,新模型能认医生手写体
Qwen版深度研究加速进化,增加听觉和视觉输出,可生成网页和音频。改进功能同时更新模型,Qwen3 VL能识别医生手写体。实测新功能表现出色,Qwen3-VL系列更新后性能优异。
超越免训练剪枝:LightVLA引入可微分token剪枝,首次实现VLA模型性能和效率的双重突破
文章介绍LightVLA框架,它是用于提升VLA推理效率和性能的视觉token剪枝框架。针对VLA模型计算开销大、推理延迟高问题,提出两大创新,在LIBERO实验中性能超经典模型,还实现推理加速。
行业首场丨00 后 Agent 应用创业者的行业观察
外滩大会智能体论坛举办全员 00 后的 Agent 主题圆桌。嘉宾探讨 2025 是否为 Agent 元年,还分享 Agent 应用方向、场景价值、落地卡点、AI Coding 发展及基模与垂直 Agent 关系等观点。