「跨视角视觉理解」共找到 1460 篇相关文章
从预测到干预,Aether AI为什么押注因果世界模型?
Aether AI 定义技术路线为「因果世界模型」,关注模型识别影响结果的变量、理解因果结构、模拟干预后果。它从预测未来的局限切入,介绍了因果能力的三类核心问题及研究成果,还用四层架构实现能力落地。创始人黄碧薇看好当下时机,从 Physical AI 切入创业。
国产AI高考708分,这款模型靠什么成为「屏蔽生」?
高考放榜,媒体对国内外大模型进行测试。综合成绩上,讯飞星火X2物理、历史类表现优异;单科专项中,它在数学、作文等测试也领先。其优势源于数据积累、理解评判标准,还采取软硬件一体化落地路径。
GPT-5 不是技术新范式,是 OpenAI 加速产品化的战略拐点
文章从不同视角评价 GPT - 5,指出它是 ChatGPT 产品重要升级,是 Router 驱动系统。介绍其能力提升与短板,如 Vibe coding 性价比高但 Agentic 能力不足,还探讨了商业影响、价格战等,期待其 Agentic 能力发展。
阿里Qwen3一大波更新:代码生成、视频、图片、语音全都有
阿里Qwen3迎来一大波更新,涵盖多个模型。如Qwen3-Max在代码与智能体表现卓越;Qwen3-VL是强大视觉语言模型;Qwen3-Omni是全模态模型;还有图像编辑、同传、安全防护等模型及旅行规划师等应用。
自动生成n8n工作流!这个神级开源方案,绝了~
文章分享全自动构建n8n工作流的方案,核心是开源项目n8n - mcp,它是AI Agent的n8n外挂知识库,能让AI深度理解和使用n8n。文中介绍其安装、使用,还展示不同难度案例的生成效果。
从 Copilot 到 通用 Agent : 阿里在 AI Coding 上的应用和挑战
阿里巴巴代码平台负责人向邦宇在 QCon 大会分享阿里智能研发大模型应用与挑战。介绍探索成果,如代码补全、审查等功能;指出面临用户需求理解、领域知识整合等难题;还提及技术进步带来新机遇,促使从 Copilot 向 Agent 转变。
当AI从云端“下沉”,Arm如何赋能端侧
端侧AI发展近十年,已进入应用快速拓展期,成为推动消费电子革新重要力量,但面临视觉处理、内存平衡和应用迭代等挑战。Arm推出相关平台与技术,如SME2,提升AI性能与能效,还与厂商合作,持续创新赋能端侧。
又一个Genie 3来了!刚上线挤爆服务器,Mirage 2把世界模型玩成在线游戏
全球首款AI原生UGC游戏引擎Mirage迎来2.0版本。它能将图像转为可互动3D世界,还能用文本重塑。和Genie 3相比控制类别更丰富,虽有进展但仍有动作控制、视觉稳定等问题待解决。
无需训练,如何提升黑箱VLM?CARPRT用「类别感知」给出答案
近年来,视觉 - 语言模型(VLMs)改变图像理解范式,但零样本分类性能对 Prompt 敏感。墨尔本大学 TMLR 小组提出 CARPRT 方案,以“无训练、黑箱适配、类别专属权重”解决提示词语义适配不足问题,已被 ICLR 2026 接收。
神秘具身团队又放出一连串很炸的Demo视频…自进化模型,技术路线曝光
神秘具身团队放出一连串Demo视频,其内部代号“MVP”的模型让机器人似人般思考决策。视频展示机器人在不同场景下的表现,如躲避推搡、做家务、机器人协作、高效收纳等,体现对物理规则和人类习惯的理解与自进化能力。