多场景支持」共找到 5913 篇相关文章

算法论文7

ICCV2025 | 视图生成新范式-利用自回归模型探索视图生成

本文介绍自回归生成视图图像方法 MVAR,能从先前视图提取引导信息增强一致性,拉近与基于扩散方法的图像质量差距。解决了模态条件控制和数据有限问题,展示出强指令遵从与视角一致性。

机器之心
开源动态7

支持持久化知识图谱!Agent协同的革命性框架

Agent - MCP 是为经验丰富的 AI 开发者设计的 Agent 协同框架,能解决传统 AI 开发难题。亮点有并行开发、持久化知识图谱和实时可视化协作,可让 Agent 高效协作,避免上下文丢失和任务冲突。

GitHubStore
开源动态7

华南理工开源小智AI硬件后端服务,支持MCP。

华南理工大学刘思源教授团队研发开源后端服务项目 xiaozhi-esp32-server,基于人机共生智能理论,为 xiaozhi-esp32 硬件提供支持,采用语言实现,支持 MCP 接入等功能,适配配置方案。

开源AI项目落地
算法论文8

Tool-Star:赋予大模型结合工具推理的能力

文章提出Tool - Star框架,旨在解决大模型工具协作推理难题。它从数据端到训练流程优化,让模型调用种工具,在复杂计算和知识型推理任务表现卓越,还探讨了未来模态及工具扩展方向。

PaperAgent
推荐文章8

游戏研发中的 AI 转型:网易 Agent 系统与知识工程实践

本文整理自网易游戏高级技术经理林香鑫分享,介绍大模型在游戏研发落地实践。团队用代码知识谱图、 agent RAG 召回等技术打造超级助手,在业务场景落地,推动内部 AI 生成代码覆盖率提升。

InfoQ
开源动态7

Uno Platform 6.6 发布:Android 启动性能最高提升 61%

Uno Platform 6.6发布,在五平台引入原生AOT发布、可选Vulkan渲染后端等。聚焦运行时性能,提升平台启动速度,还简化XAML编写,增强AI辅助、无障碍及语言支持等。

InfoQ
开源动态8

一张图片+ 一条音频,照片开口说话唱歌,角色、情绪控制都拿捏了。

腾讯混元联合腾讯音乐推出 HunyuanVideo - Avatar 模型,上传照片配音频就能生成动态视频。支持风格角色、情绪控制和角色对话,单角色模式已开源,技术有创新,在数据集表现优。

AI进修生
开源动态8

“甲方快乐模型”诞生,拿下平面设计新SOTA!条件一键生成,还能独立调整元素 | 复旦&字节

复旦大学和字节跳动团队联合提出CreatiDesign新模型,可实现高精度、模态、可编辑的AI图形设计生成。它解决了以往方法在处理图形设计时的难题,在维度评估基准上表现出色,还支持轮编辑。

量子位
算法论文8

12毫秒暴露自动驾驶致命缺陷,北航新研究实现场景感知的动态物理对抗攻击|TPAMI2025

近日部分L3级自动驾驶车型获批上路,但自动驾驶感知系统存在缺陷。北航等机构提出DynamicPAE框架,实现场景感知的动态物理对抗攻击,解决维度挑战,在场景表现优异,被TPAMI2025录用。

量子位
产品应用7

实时语音翻译

Sokuji 是跨平台桌面应用,用 OpenAI、Google Gemini 等 API 提供实时语音翻译。支持系统,有桌面版和浏览器插件,适配会议场景,还具备音频可视化、虚拟音频设备等特色功能。

GitHubStore