物理场景测试」共找到 3794 篇相关文章

产品应用7

Pixeltable:一张表搞定AI流水线

Pixeltable是统一声明式框架,能处理多模态AI流水线。它用表格接口替代传统复杂架构,有数据统一管理等核心能力,适用于多模态RAG等场景,内置支持主流AI服务,值得多模态AI项目一试。

AI工程化
算法论文7

HOIDiNi:一句话驱动虚拟人高精度操作物体

特拉维夫大学提出HOIDiNi,这是文本驱动的扩散框架,用于生成人体 - 物体交互动作。它引入扩散噪声优化,能兼顾真实感与物理正确性。不过它泛化能力待拓展、生成速度慢,未来需提升效率等。

带你学AI
算法论文8

看似无害的提问,也能偷走RAG系统的记忆——IKEA:隐蔽高效的数据提取攻击新范式

研究聚焦RAG系统,提出全新黑盒攻击方法IKEA。它不依赖异常指令,通过自然查询提取私有信息。经多数据集测试,其效率和成功率高,还证实提取知识实用,揭示RAG系统潜在脆弱性。

机器之心
开源动态8

开源屏幕感知AI助手,快捷键即调,随时看懂屏幕上的一切!

日常Windows桌面工作调用AI助手常打断专注流。GitHub新开源工具Everywhere,能自动感知屏幕内容,快捷键即调,支持多模型,有网络搜索和Markdown渲染功能,多种场景适用。

开源星探
算法论文8

NeurIPS Spotlight|运动遮挡都不怕,0先验、一段视频精准预测相机参数

论文一作李放等为解决传统方法在动态场景预测相机参数的难题,提出 ROS - Cam 方法,涵盖补丁式跟踪滤波器、异常值感知联合优化、双阶段训练策略,代码即将开源。

机器之心
开源动态8

中科院开源PPT Agent,一键自动生成PPT智能体

中科院软件所等联合开源PPT Agent,它能分析参考幻灯片,按人类流程分两阶段生成PPT,有自我修正功能,测试显示在多维度优于现有方法,极大节省用户时间精力。

AIGC开放社区
开源动态8

开源项目 | 用自然语言做视频剪辑,人人都能用的 AI 视频剪辑工具

FireRed - OpenStoryline是开源AI视频剪辑智能体,理念是‘你说话,它剪片’。工作流程为‘理解→执行→输出’。具备智能素材搜索、文案生成等多项能力,适用于多场景,介绍了安装方式、优缺点。

小华同学ai
算法论文8

打破视觉Token的算力诅咒,RedundancyLens如何为多模态大模型推理减负

多模态大模型的 Decoder - only 架构处理视觉 Token 有计算冗余。合合信息团队提出无需额外训练的动态计算削减方法,在不影响性能前提下降低推理成本,适用于多场景

PaperAgent
开源动态8

真牛,4千行代码,媲美OpenClaw,开源 nanobot 到底强在哪?

本文拆解GitHub热门开源项目HKUDS/nanobot,它是超轻量个人AI助理,核心功能约4000行代码,易读易扩展。支持多模型、多渠道,有定时任务和Docker用法,适用于多场景

小华同学ai
产品应用7

实时语音翻译

Sokuji 是跨平台桌面应用,用 OpenAI、Google Gemini 等 API 提供实时语音翻译。支持多系统,有桌面版和浏览器插件,适配会议场景,还具备音频可视化、虚拟音频设备等特色功能。

GitHubStore