「视听场景理解」共找到 2613 篇相关文章
告别 Selenium 痛点!全新升级版 Selenium 自动化框架,斩获10.2K标星!
Selenium 编写 Web 自动化脚本痛点多,SeleniumBase 深度封装 Selenium,内置智能等待等功能,解决诸多问题。它功能强大,安装使用简单,适用于多场景,像“智能助手”让自动化测试变简单。
VQA高分是在看图,还是在记答案?ReKey只更新决定答案的那一小块
视觉问答模型准确率提升,但高分可能源于记忆。浙江大学等团队提出 ReKey,保留真实场景,只更新决定答案的视觉线索,使评测面向未见过内容,且多数环节可自动完成。
刚刚,阿里Qwen3.8-Max来了!冲进全球第一梯队,模型表现直逼Claude
阿里巴巴突袭发布新一代基座大模型Qwen3.8 - Max,它总参数量达2.4万亿,在多场景表现出色,在权威榜单冲进全球第一梯队,性能直逼Claude,且价格实惠,实测反馈良好。
黄仁勋最后一刻登上访华飞机,英伟达中国市场再添变量
黄仁勋最后一刻登上特朗普访华专机,英伟达AI芯片重回谈判桌。此前英伟达受出口管制,中国业务停滞,三年管制促使国产AI芯片发展,英伟达回来难获全场景主导地位。
没等VC下场,机器人厂商先投了一家具身数据基础设施公司
2026年以来具身智能热度高,智域基石切入数据基础设施赛道完成融资。其核心管理团队背景多元,设计了五段式数据处理管线,更看重To B场景,目标是成平台型基础设施。
CapCut Mate:开源剪映自动化神器,让AI替你剪视频!
CapCut Mate是开源免费的剪映草稿自动化助手,让开发者通过API控制剪映核心功能,效率提升超100倍。它功能丰富,覆盖剪辑全流程,适用于多场景,还提供三种使用方式。
分享一个 OpenClaw 装机必备 Skills 库
腾讯推出代装龙虾公益活动引关注,OpenClaw创始人也转发。GitHub上的awesome - openclaw - skills项目爆火,收录超五千个OpenClaw装机必备Skill,覆盖多场景,还呈现AI Agent发展趋势。
2025 WAIC落幕,深谋科技异军突起,以技术与落地破局具身智能赛道
2025 WAIC落幕,深谋科技作为精英合作伙伴首次亮相,未随波逐流,而是切入脑控、动态视觉伺服和康养场景三大底层能力领域,开拓创新赛道。其产品已商用部署,吸引众多媒体关注。
开源版MetaQuery来了!OpenUni用1.1B参数媲美BLIP3-o-8B,数据代码完全开源
南洋理工大学 S-Lab 和商汤科技团队推出开源版 MetaQuery——OpenUni,仅 1.1B 参数达 8B 模型性能,代码、权重、数据全开源。它架构极简、参数高效,还继承了多模态理解能力。
多模态推理新基准!最强Gemini 2.5 Pro仅得60分,复旦港中文上海AILab等出品
现有多模态大模型benchmark对逻辑推理理解不足,复旦大学等单位提出MME - Reasoning评估其推理能力。对30 + 模型评测,最优得分仅60%左右,反映出模型多方面推理短板。