「空间原生」共找到 971 篇相关文章
视频生成 vs 空间表征,世界模型该走哪条路?
随着生成模型和潜在表征技术发展,业界探讨世界模型技术路线。是像素级视频预测模拟未来场景可靠,还是潜在空间抽象表征高效?Goole DeepMind的Genie 3发布,再次引发讨论,分歧也从理论走向应用。
告别「边画边说」:LatentMorph 开启视觉生成隐式潜空间推理新范式
现有的文生图模型缺乏动态思考与自我修正能力,香港科技大学团队提出LatentMorph框架,将隐式潜空间推理集成到T2I生成过程中,实验显示其显著提升基座模型性能,削减推理延时与Token消耗,实现人机认知对齐。
OpenAI发布GPT-5.4:首个原生接管电脑通用模型
OpenAI发布GPT-5.4及满血版GPT-5.4 Pro,主打专业生产力。它具备原生电脑操作能力,视觉感知、职场任务表现提升,幻觉问题被压制,代码能力强,工具调用机制优化,已在ChatGPT等全量上线,API定价上调。
全新范式—让开发不再有门槛:云赛空间开发者沙龙活动回顾
2025年10月27日,上海云赛空间举办开发者沙龙。微软MVP胡浩、张欣、徐庭等分享见解,演示AI降低开发门槛、实现人机共创等,最后还进行了圆桌讨论,探讨AI时代开发相关问题。
“AI原生”觉醒:企业数智化的弯道超车时刻|甲子光年
当下‘AI原生’成共识,但不少企业有数据难转化、有工具难成闭环。文章提出‘数据×工具×组织’三重进化框架,介绍数据智能化趋势、火山引擎Data Agent等,还为企业拥抱Data+AI给出建议。
原生Agent杀入画布!一站式搞定专业创作,全程可控、不抽卡
国内RunningHub平台推出原生AI智能体全能内容创作平台RHTV,它能一站式搞定专业创作,流程可控。实测显示,它能编排短剧、生成商用物料,还内置影视级工具,且依托庞大生态,能力无上限。
GPT-5.4「原生操控电脑」实测封神!OpenClaw天选模型来了
OpenAI发布GPT-5.4,首次实现原生电脑操控能力,几乎可操作电脑所有应用。它被认为是最适合跑OpenClaw的模型,在多方面表现出色,其发布标志AI从对话式到智能体的跨越。
2.4万亿参数原生全模态,文心5.0一手实测来了
文心5.0正式发布,主打原生全模态,支持全模态输入和输出。官方测试显示其多维度表现突出,在LMArena文本排行榜并列全球第二。实测其理解精细、能捕捉细节,技术上采用自回归统一结构和超大规模混合专家架构。
仅2G内存可跑,刚刚,谷歌开源Gemma 3n,端侧原生多模态!
谷歌全面发布Gemma 3n,将多模态AI功能带入边缘设备并在Hugging Face开源。它原生支持多模态输入输出,针对设备端优化,内存占用低,采用开创性架构,Gemma系列质量也不断突破。
让龙虾看懂屏幕!谷歌多模态新成果,文本图像视频音频进同一空间
谷歌发布首个原生多模态嵌入模型Gemini Embedding 2,将文本、图像、视频、音频和文档映射进同一嵌入空间,支持多模态混合输入,为AI Agent“看懂”世界提供关键基础,已展开公测。