视听场景理解」共找到 2620 篇相关文章

开源动态8

腾讯混元开源游戏AI生成新工具!RTX 4090就能制作3A级动态内容

腾讯开源游戏视频生成框架Hunyuan - GameCraft,基于混元视频生成搭建,操作简单,输入单张场景图、文字描述和动作指令就能生成高清动态游戏视频,解决传统工具瓶颈,性能优于主流模型。

量子位
算法论文8

北航LiveRepoReflection: 扭转乾坤-仓库级代码反射

本文提出LiveRepoReflection基准,评估多文件仓库代码理解和生成能力,含1888个测试案例。创建RepoReflection - Instruct数据集训练RepoReflectionCoder,评估40多个LLMs,结果显示其能有效测模型反思修复能力。

PaperAgent
产品应用8

亿万打工人在用的WPS,未来可能要重塑你的工作流

WAIC上,金山办公发布WPS AI 3.0及原生Office办公智能体WPS灵犀。WPS知识库解决文档管理难题,WPS灵犀功能全面,能深入办公场景,还推动AI办公向Agentic Software演进。

量子位
推荐文章7

技术狂飙下的 AI Assistant,离真正的 Jarvis 还有几层窗户纸?

随着AI技术进入新阶段,LLM面临新天花板,市场呼唤从「会聊天」迈向「能行动」的下一代AI Assistant。文章从智能规划与调用等维度分析其发展挑战,介绍不同技术路径并分析优劣势。

机器之心
开源动态8

首个企业级智能体全开源!京东云将Agent门槛直接给打没了

京东云JoyAgent成为首个100%开源企业级智能体,完整能力全部开源,企业开发者可本地独立部署。它多智能体协同能力强、性能一流,还具多项技术创新,解决了企业AI落地难题。

量子位
算法论文8

一篇120页AI4Research(科学研究AI)最新系统性综述

为填补AI在科学研究应用缺乏全面综述的空白,提出AI4Research调查。其主流流程和分类分五个关键领域,各领域细分任务,凸显AI在研究中多样角色,还介绍多学科应用。

PaperAgent
推荐文章7

2025.7.4上午 | 视觉智能驱动的多模态对齐与推理的近期系列工作分享 - 复旦博士生王思尹

本次分享由复旦博士生王思尹围绕‘视觉智能驱动的多模态对齐与推理’展开,介绍多模态大模型探索研究,涉及跨模态组合语义理解、视觉参与推理及基于视觉建模世界完成行动等内容。

深度学习自然语言处理
算法论文8

The Batch:841 | 大语言模型正在纠正历史遗留的不公

美国北加州旧不动产契约含种族歧视条款,虽已非法但人工筛查耗时久。斯坦福和普林斯顿研究团队微调大语言模型识别圣克拉拉县契约中的歧视条款,模型可理解上下文,结果经律师确认,研究成果已开源。

DeeplearningAI
产品应用7

数据库厂商入局AI又有新思路,OceanBase选择“卖铲子”

国产数据库厂商 OceanBase 入局 AI 有新思路,近期动作频频。其云数据库业务 OB Cloud 实现 AI 能力开发部署并与多平台集成,已在多行业落地。副总裁尹博学谈其 AI 战略逻辑、面临挑战及未来趋势等。

InfoQ
开源动态8

首个面向科学任务、真实交互、自动评估的多模态智能体评测环境,ScienceBoard来了

ScienceBoard是首个面向科学任务、真实交互、自动评估的多模态智能体评测环境。它集成多领域科研软件,构建科研任务集合,评估智能体在科学任务上的表现,发现现有模型在科研工作流中远未成熟。

机器之心