「视觉规划」共找到 974 篇相关文章
广电绝地反击!揭秘多彩新媒「不烧钱」的AI生存法则
传统广电行业面临生存危机,多彩新媒依托1100万IPTV用户,规划‘技术筑基-场景落地-生态协同’转型路径。战略聚焦三核心,技术结合外部能力分层搭建体系,场景围绕三维度落地,生态强调内外联动。
谷歌最新版「深度研究」反击GPT-5.2
GPT - 5.2发布前,谷歌推出新版Gemini Deep Research Agent,基于Gemini 3 Pro构建,功能强大。还开源DeepSearchQA,推出交互API。此外,DeepMind与英国政府合作,在城市规划、科学研究、网络安全等多领域应用AI技术。
无需准确传感信号!轻松搞定「多段软体机械臂」复杂位姿与形状控制
研究人员提出利用双向循环神经网络(biLSTM)的MSCA规划与控制策略,即便用不准确内部传感信号也能完成任务。实验显示该方法在多任务中表现优异,未来还将做进一步研究。
机器狗能当羽毛球搭子了!仅靠强化学习从0自学,还涌现出类人回位行为 | Science子刊
苏黎世联邦理工学院团队让机器狗靠强化学习学会打羽毛球,开发全身视觉运动控制策略,使其最高挥拍速达12米/秒,还涌现类人回位行为,研究证明足式机器人在体育场景应用可行。
解码提速15.1倍、多任务性能不降:复旦&引望WAM-Diff2打通自动驾驶VLA自回归—扩散转换
视觉-语言-动作(VLA)模型是端到端自动驾驶主流技术,但自回归解码架构有瓶颈。复旦大学与引望智能联合提出WAM-Diff2,实现自回归VLA向离散扩散模型迁移,解码加速15.1倍,多任务性能不降。
图像编辑太慢太粗糙?全新开源自回归模型实现精准秒级修改 | 智象未来
AI图像编辑中扩散模型有两大难题,智象未来团队提出全新自回归图像编辑框架VAREdit,引入视觉自回归架构,提升编辑精准度与速度。模型和代码已开源,还提出SAR模块优化,在基准测试表现出色。
刚刚,智谱开源了他们的最强多模态模型,GLM-4.5v。
智谱接连开源GLM - 4.5和GLM - 4.5V,后者为多模态模型,总参数106B,在42个评测基准中41个达到SOTA。经测试,它视觉推理强、速度快,还有视频理解等功能,API定价良心,体现持续开放精神。
AI们数不清六根手指,这事没那么简单。
作者测试发现Grok4、OpenAI o3等多模态模型都将六指图数成五指,仅Claude 4偶尔答对。研究揭示大模型看图片用记忆而非视觉,易受刻板印象影响,在工业等场景或引发严重后果。
豆包可以跟你打视频了,陪我看《甄嬛传》还挺懂!难倒一众AI的“看时钟”也没难倒它
国产AI豆包发布视频通话新功能,能实时报准时钟时间,还接入联网搜索,准确性和时效性强。实测中,它可当看剧搭子,还能识别食材、解答物理题等,背后是豆包·视觉理解模型在发力。
爆火全网FLUX.2重磅上线,开源版Nano Banana来了!
Black Forest Labs的开源视觉模型FLUX.2上新,是专为现实创意工作流程打造的生产力工具。与前代相比,实现从「会画」到「懂你要画什么」跃升,还能在多方面保持一致性,各变体有不同定位与场景。