「长上下文大语言模型」共找到 8239 篇相关文章
音频全能王炸!小米MiMo-Audio开源,力压Gemini/GPT-4o!
小米团队开源通用音频大模型MiMo-Audio,集多种功能于一身,支持7国语言零样本克隆和中英混合合成。首包延迟低,效果自然稳定。在多个基准测试中表现优于Gemini-2.5-Flash和GPT-4o-Audio。
最强MCP开源:Windows-MCP
Windows MCP 是轻量级开源项目,能让 AI Agents 与 Windows 无缝集成。它弥合大语言模型与 Windows 差距,可执行文件导航等任务,有诸多关键特性,还给出在 Gemini CLI 和 Claude Desktop 的配置方法。
比NotebookLM更好的「开源播客」,可根据多模态内容生成30分钟以上播客音频。
Podcastfy是开源Python工具,能把文本、图片等多模态内容,借生成式AI转化为播客。它支持自定义,适配多种语言和文本转语音模型,能生成2 - 5分钟或30分钟以上的播客,使用体验比NotebookLM好。
ICLR 2026 Oral | Revela:用语言建模重新定义稠密检索器训练
在检索增强生成系统中,稠密检索器是核心组件,但传统训练方法有局限。德国达姆施塔特工业大学蔡丰宇团队提出Revela,将检索器训练目标统一到语言建模框架,优势明显,实验效果佳。
蚂蚁集团发布KAG-Thinker,多跳问答慢思考,医疗领域拿下87分
在LLM问答领域,多跳问题存在局限性。蚂蚁集团发布KAG - Thinker,它是基于KAG框架的模型,能解决复杂问题的逻辑连贯性和上下文一致性。还介绍了其工作原理、示例、医疗应用及稳定性表现。
AI打通第一/第三人称视觉,跨视角视觉理解新SOTA|ICCV 2025 Highlight
INSAIT、复旦大学等联合提出ObjectRelator框架,让AI精准匹配不同视角下同一物体,实现跨视角统一表征与理解。它在Ego转Exo和Exo转Ego任务上超基线模型,已被ICCV 2025接收,代码开源。
Jina Reranker v3: 全新“列式”重排器,0.6B参数刷新文档检索SOTA
Jina AI推出第三代重排器Jina Reranker v3,在多语言检索基准上刷新SOTA。它参数仅6亿,有“last but not late”交互机制,能一次性处理查询和文档。还提供动态量化格式,方便不同硬件部署。
开源音视频同步SOTA基座:极简的单流架构,2秒出片
AI视频生成迈入音视频同步新纪元,闭源巨头已展实力,而上海创智学院与Sand.ai联合发布的开源音视频生成基础模型daVinci - MagiHuman,以极简单流架构,2秒就能在1张H100显卡上生成精准音视频同步画面。
全民养虾,百虾大战,但2026年了,99%的企业用AI还是没赚到钱。
2026年,99%企业用AI未盈利。如今模型性能差距小,壁垒在context。Data不等于Context,企业需挂钩业务结果、构建反馈闭环与专属上下文系统。特赞GEA是这样的企业级智能体系统。
DeepSeek在Agent上做了件大事!
昨天DeepSeek发布V3.2正式版,强化Agent能力并融入思考推理,其在Agent评测达开源模型最高水平。文中分析Agent成开源‘心病’的痛点,介绍DeepSeek相关解决策略及成果,还给出使用示例。