「视觉x代码」共找到 2518 篇相关文章
家用人形机器人,终于快要来了
作者认为除关注AI大模型进展,更期待家用机器人突破。如今具身智能已具备落地条件,像特斯拉、1X等公司在人形机器人领域有进展,作者乐观预计五年内人形机器人能成熟。
对话灵感实验室:全帧率 VLM、低成本与分层部署,业务现场不止需要炫技模型
InfoQ对话格灵深瞳灵感实验室,探讨多模态大模型下视频理解问题。指出传统视频模型抽帧处理浪费算力和信息,介绍LLaVA - OneVision - 2.0突破长视频理解瓶颈,还提及“视觉智能工坊”助力业务落地。
独家|美图入局 Visual Agent,Chance AI 完成数百万美元天使轮融资
美图布局下一代视觉 AI 入口,领投 Visual Agent 创业公司 Chance AI 数百万美元天使轮融资。该公司成立于 2025 年 8 月,从北美大学生切入,有独特产品逻辑,融资后将推进多方向发展。
马斯克急了,直播回应一切!xAI全新阵容首曝光,华人联创仅剩一人
马斯克召开全员大会回应xAI高层变动,官宣合并后全新阵容。他还介绍了xAI四大核心板块,强调其发展成果,提及编程变革,宣布X平台开源等,更规划在月球建AI工厂。
机器人长出800个心眼?阿里达摩院开源具身新大脑,硅谷又坐不住了
2026年具身智能竞争激烈,阿里达摩院开源RynnBrain“具身大脑”。它采用分层架构,在16项评测中超越前沿模型。还介绍了核心技术、训练策略等,且全系列模型、评测基准和代码均开源。
哈萨比斯:DeepMind才是Scaling Law发现者,现在也没看到瓶颈
哈萨比斯在Axios AI+峰会上称Scaling Law最早由DeepMind发现,靠它可能达成AGI,还预测未来12个月AI发展,如多模态融合、视觉智能突破等,且Gemini目标是成通用助手。
刚刚,Grok 4发布,「人类最后的考试」中拿下50.7%,碾压所有对手,游戏结束?
Grok 4发布并对X Premium+订阅者开放。它是领先的AI模型,人工智能指数超对手,全方位性能爆表,还具备实用功能。在「人类最后的考试」拿下50.7%,显示AI智能增长无上限。
打破长视频理解瓶颈:HoPE混合位置编码提升VLM长度泛化能力
如今视觉语言模型在长上下文任务表现不佳,CMU和小红书团队深入研究,首次提出多模态RoPE扩展策略理论评估框架,指出现有泛化能力不足原因,提出HoPE大幅提升VLM长度泛化能力。
答对了却没看图?EASE给多模态RLVR装上「视线校正器」
强化学习与可验证奖励提升视觉语言模型推理能力,但存在答案奖励只知对错、不知证据区域问题。哈工大等团队提出EASE,把标注证据区转为目标分布,监督空间注意力,推理无额外标注,实验成绩优异。
登上Science Robotics顶刊!清华团队耗时22年,终于教会机器人踢足球
今年8月,清华赵明国教授团队联合字节跳动Seed等在《Science Robotics》发表论文,提出视觉驱动的反应式足球技能学习框架。该研究历经22年技术接力,成果在真机和赛事中验证,加速进化平台助力研究。