「多模型编排」共找到 9690 篇相关文章
北大团队让AI学会考古!全球首个古希腊陶罐3D视觉问答数据集发布,还配了专用模型
北大团队推出全球首个面向古希腊陶罐的3D视觉问答数据集VaseVQA - 3D,配套专用视觉语言模型VaseVLM。传统模型面对文化遗产复杂对象有不足,新数据集和模型让AI迈向‘文化考古Agent’,未来将拓展到更多领域。
Le Chat全方面对标ChatGPT,欧洲AI新贵穷追不舍
欧洲AI初创公司Mistral AI接连发布多个开源模型,还升级Le Chat,引入深度研究、语音等新功能,全方面对标ChatGPT。其语音识别模型Voxtral号称“全球最佳”,多方面超越竞品。
南大团队直击大模型高分神话:人类90分,最强模型仅49分
南京大学傅朝友团队在Google Gemini评测团队邀约下推出视频理解新基准Video - MME - v2。它有创新的分层能力体系与组级非线性评分,经超3300人工时标注。评测显示模型与人类差距大,还揭示传统Acc指标虚高、‘Thinking’并非总增益等现象。
新手入门 | 搭建 AI 模型开发环境
文章为新手提供AI模型开发环境搭建方法,涵盖安装显卡驱动、CUDA、cuDNN、Miniconda、PyTorch、Transformers等,还介绍用Modelscope下载加载模型、PyCharm配置及解决常见问题。
0.027B手机AI模型,估值2亿美金,三个清华学霸如何获得国际大学生创新大赛冠军
10月15日,清华万格智能团队“基于类脑架构的下一代通用模型与智能体生态”获中国国际大学生创新大赛(2025)冠军。团队由三个清华本科生创立,此前已完成融资,估值达2亿美元。其智人HRM模型有诸多优势,还研发出顶尖气候预测专家模型。
龙虾“黑入”卡帕西家的智能家居系统:本来需要控制六个软件,现在用WhatsApp就能操控
特斯拉前AI总监卡帕西做客播客,分享诸多AI观点。如编程成个人能力问题,可让AI写代码;用龙虾打理智能家居,整合多软件;还谈及autoresearch、模型能力断层、模型分化、开源闭源格局等内容。
独家解读|2025年AI五大趋势与底层数据革命
2025 年 AI 发展重心转移,高质量数据成新基石。本文解读五大技术趋势,如多语种 TTS 与全双工交互、多模态大模型等,还介绍了各趋势的数据需求及数据堂提供的相应数据服务方案。
10B超越Gemini-2.5-Pro!阶跃星辰端侧多模态天花板开源
阶跃星辰多模态智能团队开源STEP3-VL-10B多模态模型,仅100亿参数却性能惊人。它采用了独特的架构、训练策略与推理机制,在多任务上表现出色,为小模型发展提供新思路。
Anthropic最新研究:Claude存在神秘J空间,与人类心智高度相似
Anthropic研究团队在Claude中发现类似人类大脑工作机制的J空间,它存在于模型神经激活中,能让模型默默思考。失去J空间Claude在多步骤推理任务表现变差,还可暴露模型意图,团队已创建演示工具JLens。
小红书团队开源dots.ocr:文档解析新王者,性能比肩Gemini!
文档解析领域处理多语言复杂文档需高效能力,传统OCR工具存在不足。小红书HiLab开源多语言文档解析模型dots.ocr,基于1.7B参数视觉语言模型,性能达SOTA,单页PDF处理快,公式识别媲美大模型。