「对象级理解」共找到 1688 篇相关文章
Qwen新开源,把AI生图里的文字SOTA拉爆了
通义模型家族新开源图像生成模型Qwen - Image,是通义千问系列首个图像生成基础模型。实测其对提示词理解到位,文字渲染高保真。它具备复杂文本渲染、一致性图像编辑能力,在多基准测试达SOTA。
在 AI 时代构建 MVP
文章围绕AI在构建最小可行产品(MVP)中的作用展开。它能在理解QARs、推动架构决策等多方面提供帮助,如提出被忽略的需求、缩小技术搜索范围等,但不能完全替代人类做决策。
杨立昆亲自指导开源世界大模型,为AI Agent打造超级大脑
今天凌晨,Meta开源世界大模型V - JEPA 2,它用超大规模数据集训练,能让AI Agent理解物理世界。图灵奖得主杨立昆参与开发并推荐。模型经多方面改进,还拓展用于机器人规划和视频问答,效果良好。
硬核拆解 Hermes-Agent:自学习 Skill 机制的架构设计与实现原理。
文章围绕Hermes - Agent展开,指出多数Agent缺乏自学习能力,而它试图跨越这一鸿沟,能自动“写手册”(Skill)。介绍其架构、安装配置,通过代码审计任务演示自学习过程,并解析Skill机制,为生产级Agent提供新思路。
刚刚,千问杀入汽车座舱!阿里不止做超级APP,更要做超级入口
阿里AI助手千问被接入红旗汽车智能座舱,这是通用AI助手首次以完整形态登陆车载场景。千问能完成复杂语义理解和任务规划,还将拓展至更多硬件,阿里要把它打造成AI时代超级入口。
AI胡说八道这事,终于有人管了?
AI大模型幻觉问题棘手,GPT - 5幻觉率降低。苏黎世联邦理工学院和MATS研究提出低成本、可扩展检测法,精准识别实体级幻觉,分类器超现有基准,还能识别逻辑错误,团队已公开数据集。
阿里、南开大学发布免训练,视频大模型创新压缩方法
视频模型序列化处理影响推理速度与扩展性,传统token压缩方法在视频理解中有问题。阿里通义实验室与南开联合发布LLaVA - Scissor,用SCC方法和两步时空压缩策略,实验显示其性能优于其他方法。
全球顶尖AI做物理,被人类按地摩擦?不懂推理大翻车,本科生碾压
港大等机构用3000道物理题测试顶尖大模型,如GPT - 4o、Claude 3.7 Sonnet等,结果模型准确率远低于人类专家。研究推出PHYX基准测试,揭示模型依赖知识、公式和模式匹配,缺乏真正物理理解。
Node.js 拟内置虚拟文件系统,AI 生成代码引争议
Node.js 技术指导委员会成员 Matteo Collina 提议在 Node.js 核心新增 `node:vfs` 模块引入原生级虚拟文件系统,引发关注。功能可解决常见工作流程难题,已获部分开发者支持,但因用 AI 开发引争议。
视频生成 vs 空间表征,世界模型该走哪条路?
随着生成模型和潜在表征技术发展,业界探讨世界模型技术路线。是像素级视频预测模拟未来场景可靠,还是潜在空间抽象表征高效?Goole DeepMind的Genie 3发布,再次引发讨论,分歧也从理论走向应用。