语言能力」共找到 4050 篇相关文章

算法论文7

VaseVQA:考古领域实现专家级,诊断+补弱RL框架

在文化遗产与人工智能交叉领域,研究人员提出把大型多模态模型放于‘诊断—补弱—精细化评估’闭环训练,配套结构化评测基准,让模型在文化遗产领域接近专家级能力。介绍了技术步骤、数据基准及关键发现等。

新智元
新闻资讯7

智元办机器人挑战赛:清华&上海AILab夺冠,华南理工“单人成团”拿亚军

由智元机器人联合OpenDriveLab举办的AGIBOT World Challenge线下决赛在杭州IROS落幕。全球11支顶尖队伍在六大真实物理任务中角逐,清华联合上海AILab团队夺冠,华南理工、港大团队分获二、三名。智元还展示了产品线,精灵 - G2首次公开亮相。

量子位
开源动态8

Dexmal原力灵机开源Dexbotic,基于PyTorch的一站式VLA代码库

Dexmal原力灵机推出基于PyTorch的开源视觉-语言-动作模型(VLA)代码库Dexbotic,面向具身智能研究者。其架构含三大核心组件,有五大特征,还推出开源硬件,未来将持续投入生态建设。

机器之心
算法论文8

基础模型已颠覆科研,进入第五范式!港科大综述113篇论文 | NeurIPS'25

港科大论文指出,随着科学问题复杂度提升,传统科研范式显露出局限。基础模型(FMs)横空出世,具备通用性、规模与知识覆盖、推理与生成能力,可能引领科学进入第五范式,但也面临偏见、幻觉等问题。

新智元
新闻资讯7

Qwen要做机器人了:林俊旸官宣成立具身智能团队

阿里通义千问大模型负责人林俊旸官宣在Qwen内组建小型机器人、具身智能团队。此前阿里云领投具身智能企业,Qwen系列模型受具身智能公司青睐,此次动作呼应阿里云布局,正值科技巨头加码机器人领域。

机器之心
产品应用7

AI花17小时写了篇30页学术论文!自主选题,包含实验,还符合APA格式规范

Virtuous Machines AI系统花17小时、114美元,找288个真人做实验,写了篇30页认知心理学领域学术论文,从选题到成稿全自动化。其架构独特,不过也存在理论误解等小缺点。

量子位
算法论文8

NeurIPS 2025 Spotlight | FSDrive统一VLA和世界模型,推动自动驾驶迈向视觉推理

面向自动驾驶的多模态大模型存在问题,FSDrive提出“时空视觉CoT”,让模型“以图思考”,联合未来场景与感知结果进行可视化推理。该方法在不改动原有MLLM架构前提下激活图像生成能力,实验表现出色。

机器之心
开源动态8

一周10来个模型被开源,阿里Qwen杀疯了~

阿里通义千问这周开源众多模型,如Qwen3 - Omni、Qwen - Image - Edit等,涉及全模态、图像编辑、安全审核等多领域。各模型能力出色,如Qwen3 - Omni能处理多模态输入,Qwen3 - VL表现超部分闭源模型。

PaperAgent
开源动态8

LangExtract:用LLM 一键完成长文档信息抽取与可视化

在2025年大语言模型迅猛发展时,信息抽取成了NLP场景里的“硬骨头”。Google在7月30日开源的LangExtract利用多种LLM,实现“按指令抽取+源文对齐 + 一键可视化”的完整闭环,还给出使用步骤和进阶操作。

机器学习AI算法工程
产品应用7

AI 应用开发的破局之路:字节跳动 Eino 框架实践

在 InfoQ 举办的 QCon 全球软件开发大会上,字节跳动沈桐介绍 Eino 框架在组件抽象和业务编排的创新实践。该框架以大模型为基础,解决应用开发中节点、信息流转和沉淀框架的问题,还给出开发实例,展望了未来重点方向。

InfoQ