2D交互场景」共找到 4020 篇相关文章

算法论文8

ICCV 2025 | 跨越视觉与语言边界,打开人机交互感知的新篇章:北大团队提出INP-CC模型重塑开放词汇HOI检测

北大团队提出 INP - CC 模型重塑开放词汇 HOI 检测。它提出交互感知提示生成和概念校准两项创新,结合输入图片特性构造提示集合,引入‘困难负样本采样’策略,在两大数据集上表现超 SOTA。

机器之心
算法论文7

无需外部数据!AI自问自答实现推理能力进化

卡内基梅隆大学团队提出SQLM框架,这是无需外部数据的自我提问模型,含提问者和解答者角色。通过强化学习最大化期望奖励,设计自监督奖励函数。实验显示其能提升Qwen2.5 - 3B - Instruct多任务准确率。

量子位
开源动态8

Gödel Rescheduler:适用于云原生系统的全局最优重调度框架

本文介绍字节跳动研发的Gödel Rescheduler重调度框架,它能解决传统调度资源分配和任务摆放问题。阐述传统重调度弊端,介绍新方案组件,列举应用场景及成果,还提及未来规划,目前已开源。

InfoQ
算法论文7

LLM加RL遭质疑:故意用错奖励,数学基准也显著提升,AI圈炸了

华盛顿大学等机构论文引爆AI界,其发现用虚假奖励训练Qwen2.5-Math-7B模型,也能提高MATH - 500成绩。虚假奖励对Qwen模型有效,但在其他模型上有限,凸显RLVR有效性与模型能力有关。

机器之心
新闻资讯7

GPT-5.6 Sol暴涨3倍,OpenAI最强视觉AI登顶!

第三方评测机构Roboflow测试显示,GPT-5.6 Sol在目标检测、计数等视觉任务上表现出色,尤其在文档版面识别和密集场景处理上进步明显,但认字能力有退步,且大尺寸图片检测框易飘移。

新智元
产品应用7

Cherry Studio 复盘:从 Chat 到 Agent,一款「套壳」开源产品如何推倒重来?

Cherry Studio最初是为用户在不同大模型间切换的聊天客户端,随行业从Chat转向Agent,它开启2.0版本重构,定位转向「个人Agent平台」,底层架构重写,要解决产品复杂性、完善协作等问题。

Founder Park
推荐文章8

Qoder Skills 完全指南:从零开始,让 AI 按你的标准执行

文章介绍Qoder Skills,它是强大AI定制方式,像菜谱让AI按标准执行。阐述本质、结构、原理,对比与其他工具差异,说明适用场景、安装方法,还有实战演示、编写规范、测试迭代及团队协作等内容。

阿里云开发者
新闻资讯7

RoboChallenge发布年度报告:评测标尺够权威吗?

当下具身智能行业存在缺乏真实场景验证、评测标准模糊等问题。2025年原力灵机与Hugging Face推出RoboChallenge评测平台,2026年1月更新榜单。AI科技评论从技术和核心设计角度对其进行深度拆解。

AI科技评论
产品应用8

Eino ADK:一文搞定 AI Agent 核心设计模式,从 0 到 1 搭建智能体系统

大语言模型发展下,Agent成AI落地主流,但传统开发有痛点。Eino ADK为Go开发者提供智能体开发框架,解决核心难题,还介绍了Agent功能、ADK模式、构建方法及多Agent协作场景等。

InfoQ
开源动态7

实测最新开源的DeepSeek-OCR后,我有些不一样的看法,有些话可能只有我敢说

实测最新开源的DeepSeek - OCR,它并非传统OCR,不适用于传统场景。其最大意义是解决大模型上下文长度问题,通过文字图片压缩解压提高处理速度。模型功能多样,是让AI看图思考的新思路。

开源AI项目落地