360°视频生成」共找到 2699 篇相关文章

算法论文8

只看图片就能学会压缩Token!浙大&阿里新框架多轮VQA压缩率90%,精度不掉|CVPR 2026

多轮视觉问答成LVLM推理效率“照妖镜”,现有压缩方法在多轮场景翻车。浙大宋明黎教授团队与阿里联合提出MetaCompress框架,可根据图像生成最优压缩映射,实验验证其效果优,能平衡压缩率与精度。

量子位
产品应用8

「动嘴办公」火起来了!TRAE SOLO让打工人张嘴就能干活

新智元报道,TRAE SOLO与Insta360联名推套装,实现「动嘴办公」。它能智能转录、修正语义、直调功能,可处理代码、文件等。还能过滤口语、理解语义,降噪拾音。4月底将上线实时问答互动。

新智元
开源动态8

170次搜索+50次反思:用GLM-4.7盘点2025 Agent行业趋势,结果太震撼!

作者给智谱新开源的GLM - 4.7布置调研2025年Agent赛道企业的任务,结果令人震撼。该模型进化显著,能整理详细企业信息,还能生成高审美PPT。国内有不少特色AI落地企业。

探索AGI
算法论文8

一张照片,一个3D「你」:计算所等提出HumanLift,实现高保真数字人重建

中国科学院计算技术研究所等机构研究人员提出 HumanLift 技术,基于单张参考图像重建高斯网数字人全身。该技术融合三维视频扩散模型和人脸增强,仅需单张人体图片就能重建高逼真三维数字人。

机器之心
新闻资讯7

一夜之间OpenAI神秘模型“o3-alpha”刷爆时间线:远胜 Claude Sonnet

OpenAI神秘新模型“o3-alpha”正在测试,刷爆时间线。早期测试显示其性能超强,能一键生成游戏,前端编码能力远胜Sonnet、o3等。有猜测它是AHC模型或OpenAI将开源的模型。

AI寒武纪
新闻资讯7

这个扩散LLM太快了!没有「请稍后」,实测倍速于Gemini 2.5 Flash

AI初创公司Inception Labs推出首款专为聊天定制的商业级扩散LLM——Mercury。它速度超快、效率高,能实时响应对话。实测显示其速度优于Gemini 2.5 Flash等,不过生成质量有待提升。

机器之心
开源动态7

为AI打造的知识图谱服务器MemoryMesh

MemoryMesh是专为AI模型设计的知识图谱服务器,适用于多种结构化数据场景。它有动态模式驱动工具等特性,可自动生成管理工具,还配备记忆查看器,提供安装指南和提示词建议。

GitHubStore
算法论文8

视觉感知RAG × 多模态推理 × 强化学习 = VRAG-RL

数字化时代视觉信息愈发重要,传统RAG方法处理视觉信息面临挑战。阿里巴巴通义实验室的VRAG - RL将强化学习引入多模态智能体训练,革新检索生成范式,提升视觉语言模型多方面能力,代码已开源。

PaperAgent
开源动态7

不写、不看、不审查:这家安全公司决定不再让人类碰代码,还把这套模式开源了

2026年2月,安全公司StrongDM公开“软件黑灯工厂”式生产线成果,人类不直接写代码和审查,由Agent自动生成。该模式开源,虽有开发者指出问题,但获学界认可,不过面临成本高的现实问题。

InfoQ
产品应用8

Qwen3-LiveTranslate:视、听、说全模态同传大模型!

Qwen3-LiveTranslate-Flash 是基于大语言模型的多语言实时音视频同传模型,依托 Qwen3-Omni 能力与海量数据,有多语言和方言支持、视觉增强等亮点,性能超主流大模型。

通义千问Qwen