「地理空间问答」共找到 610 篇相关文章
AI搜索引擎,苹果决定自研!代号WKA
据彭博社记者爆料,苹果预计明年春季推代号“世界知识问答”的AI搜索引擎,与ChatGPT等竞争;当下倾向用谷歌模型支持Siri部分功能。此前曾考虑收购Perplexity,现风向转变。
去掉像素中介!上海交大让AI边看边想边画,用同一个“大脑”跨模态推理
上海交大等团队提出LatentUM架构,摒弃像素解码中介,在共享语义潜空间跨模态思考。它用MBAQ技术转化视觉特征,设计MoME架构,还能自我反思、规划路线、模拟世界演变,表现出色。
千万级标注成本归零!CVPR 2025清华团队成果:相机的“自运动”就是最好的老师
以往空间音频模型受限于采集条件和标注成本,清华和密西根大学团队在CVPR 2025给出新路径,利用相机自运动作监督信号,让模型从互联网视频学三维空间音频感知,成果入选会议Highlight。
只看图片就能学会压缩Token!浙大&阿里新框架多轮VQA压缩率90%,精度不掉|CVPR 2026
多轮视觉问答成LVLM推理效率“照妖镜”,现有压缩方法在多轮场景翻车。浙大宋明黎教授团队与阿里联合提出MetaCompress框架,可根据图像生成最优压缩映射,实验验证其效果优,能平衡压缩率与精度。
「动嘴办公」火起来了!TRAE SOLO让打工人张嘴就能干活
新智元报道,TRAE SOLO与Insta360联名推套装,实现「动嘴办公」。它能智能转录、修正语义、直调功能,可处理代码、文件等。还能过滤口语、理解语义,降噪拾音。4月底将上线实时问答互动。
AI时代,最老的设计哲学反而最有效
50年前的Unix哲学‘万物皆文件’和‘文件夹即应用’正以意想不到的方式回归。过去因‘人类可理解性’被推崇,如今因AI能操作而重获重要性,文件夹成‘智能空间’,AI成其操作系统。
港大开源视频版RAG,像聊天一样看完百小时纪录片。
港大HKUDS团队开源超长视频理解框架VideoRAG,突破传统模型时长限制,支持对数百小时视频精准检索和问答。还有桌面应用Vimo,使用简单高效。介绍了其切片索引、混合检索、生成回答的实现逻辑。
罗福莉C位亮相小米,离职DeepSeek后首次官宣
罗福莉今日官宣加入小米任MiMo团队负责人。此前就有她被雷军高薪挖到小米的传闻。她学术成果出色,曾在阿里达摩院、DeepSeek工作。小米MiMo剑指空间智能,与雷军的人、车、家全生态适配。
李飞飞发布Atlas,世界模型进入新时代
李飞飞创业公司 World Labs 发布新一代世界模型 Atlas,它是全模态模型,能处理四模态数据。其核心为空间上下文设计,评测成绩不错,应用场景丰富,公司发展节奏密集,产品路径有转向。
爆改!8.1 万 Star LobeHub ,终于让我彻底解放啦!!!!!
LobeHub是开源的Agent工作与生活空间,GitHub约8.1万Star。它将Agent作为工作基本单位,解决了多Agent管理难题,有创建、协作、调度等功能,还介绍了工作流和自托管方法。