「视听场景理解」共找到 2620 篇相关文章
再封神!OpenAI掀翻AI图像生成,极度逼真,立刻商用
网传OpenAI的GPT-image-2正在灰度测试,韩国网友测试后称其生成图像可‘立刻商用’。它深度融合GPT大语言模型,生成照片更逼真,强化了提示遵循和场景理解能力,让AI图像生成进入‘实用时代’。
创新中心深度支持:20支队伍、300位观众、7小时PK,国内首档AI竞技综艺收官
5月10日,国内首档AI竞技综艺“AI极客争霸赛·奇点市·脑洞嘉年华”在北京收官。20支参赛团队覆盖AI多垂直领域,带来各具特色的脑洞项目,最终《狗眼看世界吧》获冠军。活动由北京AIGC视听产业创新中心等支持。
Anthropic让AI先读员工手册再上岗:失控率从54%降到7%
Anthropic最新研究「模型规范中期训练」(MSM)显示,相同训练数据配不同行事原则,模型表现不同。MSM在预训练和对齐微调间加中间阶段,让模型读规范文档理解准则,在特定实验中,将Agent失控率从54%降到7%。
Google 发布首个全模态 Embedding 2 模型,文本图片音视频 PDF 统一到一个向量空间
Google发布Gemini Embedding 2模型,它是业界首个原生支持文本、图片、视频、音频和PDF五种模态的Embedding模型,可将这些数据映射到同一向量空间,在多模态RAG、跨模态搜索等场景有应用,还介绍了跑分、用法、竞品、价格等情况。
小红书,再造一个更有「声」命力的社区
2026年春节,小红书开放多种AI语音新玩法,如语音发布、评论、问一问等,增强社交趣味性。但AI语音落地面临音频理解、生成活人感和响应速度等问题。小红书有天然优势,技术团队自研模型达SOTA水平。
半年销量2000万+,宇凡微如何让AI模块“飞入寻常百姓家”?
芯师爷专访宇凡微品牌部总监张雨,探讨AI模块商业化前景。宇凡微展出多款AI模块,接入豆包大模型,有自研SAS系统等优势。其通过技术、市场等层面建护城河,践行“技术平权,快速量产”理念,未来向全场景方案升级。
下周聊:当搜索成为标配,AI 产品都在怎么用搜索?
AI搜索成chatbot标配,产品接入后有新场景也有新问题,用户使用习惯也有变化。创业者需考虑产品初期是否及如何接入搜索。博查为AI供技术服务,下周四邀相关人士线上聊AI产品搜索应用,可扫码报名。
AI Agents和Agentic AI有什么区别?
论文《AI Agents vs. Agentic AI》深入探讨AI Agent和Agentic AI的本质差异。AI Agents是集成大模型和外部工具的单体系统,适合简单任务;Agentic AI是多智能体协作新范式,适合复杂场景。还提及挑战、解决方案与未来方向。
Codex自我蒸馏玩法火了!OpenAI员工亲授:复制粘贴就能让AI消灭重复劳动
OpenAI员工Vaibhav Srivastav爆出Codex「自我蒸馏」秘籍,复制提示词就能让它找出重复工作并打包。提示词从初版迭代到2.0版,覆盖更多场景且能直接创建项目。此外还介绍了Codex新功能及Vaibhav的其他玩法。
走访100+机器人展台:拐点已至,具身智能进入千行百业|WAIC 2026
7月17日,2026世界人工智能大会在上海开幕。与往届不同,今年大会更多展示具身智能在真实场景的应用。硬件迭代、软件与数据突破,让泛化能力和任务执行成功率显著加强。现场还呈现模型四条技术路线、数据基建等趋势。