多粒度理解」共找到 4690 篇相关文章

开源动态8

模态长文本理解测评首发:46款模型无一攻克128K难关

香港科大等研究者联合提出MMLongBench,用于评估模态模型长文本理解能力。它覆盖5大类型任务的16个数据集,对46个模型测试显示,闭源和开源模型在长上下文任务均面临挑战,OCR和跨模态检索能力是瓶颈。

量子位
开源动态8

开源AI真人级互动老师,Agent+可视化画布,函数/思维导图实时作图!

本文介绍开源项目ChatTutor,它是可视化互动式AI老师,能边说边画。有数学画布、思维导图等功能,未来将支持代码、物理等画布,可用于解题、备课等,已上线chattutor.app。

开源星探
推荐文章7

写代码从来不是瓶颈

Pedro Tavares认为软件开发瓶颈并非写代码,而是代码审查、知识传递等“人类开销”。LLM让写代码变容易,但理解、测试代码成本更高,未解决根本问题,团队理解代码成本才是瓶颈。

宝玉AI
算法论文8

深入感知级别图像理解:UniPercept 统一图像美学、质量与结构纹理感知

模态大语言模型在语义级任务表现卓越,但在感知级图像理解有短板。上海人工智能实验室等机构联合发布 UniPercept,构建感知属性定义系统与基准测试集,训练强基准模型,在方面表现超现有顶尖模型,应用潜力大。

机器之心
新闻资讯8

o1 核心作者 Jason Wei:理解 2025 年 AI 进展的三种关键思路

前OpenAI核心研究员Jason Wei跳槽Meta后,在斯坦福大学AI Club演讲,提出理解2025年AI发展的三个核心思想:验证者定律、智能的锯齿状边缘和智能商品化。他认为AI将解决可验证任务,智能成本会趋近零,且各任务发展不均衡。

Founder Park
开源动态8

社区供稿 | VibeVoice实现90分钟、角色播客生成,拓展语音合成新边界

微软亚洲研究院提出全新语音生成模型 VibeVoice,采用 next - token diffusion 机制,能将文字脚本转为最长 90 分钟、最 4 人对话的高质量播客音频,在方面有显著优势,未来潜力大。

Hugging Face
算法论文7

AI如何看懂足球?上海交大团队打造Multi-Agent系统,全面解析“美丽足球”!

现有足球AI研究存在不足,上海交大团队打造Multi - Agent系统。他们构建SoccerWiki知识库、SoccerBench评测基准和SoccerAgent智能体系统,该系统工具协作,实验中碾压GPT - 4,数据和代码将开源。

深度学习自然语言处理
开源动态8

告别 Selenium 痛点!全新升级版 Selenium 自动化框架,斩获10.2K标星!

Selenium 编写 Web 自动化脚本痛点,SeleniumBase 深度封装 Selenium,内置智能等待等功能,解决诸问题。它功能强大,安装使用简单,适用于场景,像“智能助手”让自动化测试变简单。

开源星探
算法论文7

人大-清华-腾讯发布:音频 - 视觉模态任务统一框架

人大、清华和腾讯合作发布Crab论文,目标是实现模态场景理解任务的高效一统。它针对音频 - 视觉理解模型难点提出解决方案,构建数据集、设计LoRA结构、统一架构,训练分预训练和指令调整两阶段。

CourseAI
推荐文章8

手工软件工程师的时代已经结束!一位连续创业CTO的判断

连续创业者、Tessi.ai CTO Ben Greene 在访谈中指出,生成式 AI 改变软件工程形态,手工软件工程师时代过去。工程师应转向理解问题、设计系统,具备系统思维、业务理解和与人协作能力,学会“AI 编排”。

InfoQ