「多代理场景」共找到 5488 篇相关文章
金山与华科发布多模态模型MonkeyOCR v1.5:文档解析能力超越PaddleOCR-VL,复杂表格解析首次突破90%
2025年6月以来多模态文档解析成前沿课题。MonkeyOCR v1.5是全新框架,在OmniDocBench v1.5等基准上全面突破,复杂表格等场景提升9.7%,采用两阶段解析管道和复杂表格处理方案。
小红书提出社交大模型RedOne 2.0:兼听、敏行
在SNS内容爆炸式增长的当下,传统SFT训练方法有局限。小红书NLP团队推出RedOne 2.0社交大模型,采用以RL为核心的三阶段渐进式训练方法,实验显示其性能优异,还能转化商业价值。
小红书提出DeepEyesV2,从“看图思考”到“工具协同”,探索多模态智能新维度
小红书推出多模态模型DeepEyesV2,它延续视觉推理优势,实现代码执行、网页搜索和图像操作的全工具协同。通过多工具协同推理解决复杂问题,采用两阶段训练策略,准确率远超开源模型。
识别1600+种人类语言,支持少样本扩展到5400+种语言,Meta自动语音识别模型开源
Meta AI发布Omnilingual ASR自动语音识别模型并开源。它能转录超1600种语言,含500多种首次被AI理解记录的语言,还可通过少样本扩展到5400多种,改变了多语言ASR构建范式。
NeurIPS 25开新坑:145万个图文对,覆盖八种主流水下理解任务
华中科技大学团队推出首个水下多模态大模型NAUTILUS,支持8种水下场景理解任务,还开源145万图文对的NautData数据集。模型通过VFE模块解决水下图像问题,性能超越现有模型,恶劣环境表现更佳。
jiSGLang集成ktransformers:2TB内存运行Kimi K2 Thinking模型
对于内存多但GPU资源有限的用户,SGLang集成ktransformers的CPU内核,支持直接运行Kimi K2 Thinking模型。它无需等量化,还能微调,虽性能与GPU方案有差距,但给用户新选择。
当搜索遇见 AIGC:京东零售的“千人千面”素材生成实践
在 AIGC 浪潮下,视觉生成技术重构电商生态。京东零售李岩介绍“千人千面”商品素材生成技术链路,包括关键模型及实现框架,还发布焕新版京点点平台并预告新能力,推动电商个性化变革。
美团新独立APP,点不了菜只能点AI
美团新开源LongCat-Flash-Omni模型,支持多模态,在全模态基准测试达开源SOTA水准,推理快且全模态能力强。实测交互体验丝滑,其迭代逻辑清晰。该模型成功源于架构创新,美团靠软硬件结合实现虚实连接。
刚刚,Kimi开源新架构,开始押注线性注意力
智能体时代推理计算需求成瓶颈,线性注意力可降复杂度但表达有限。月之暗面开源 Kimi Linear 新架构,结合线性与全注意力,性能和硬件效率出色,引发对线性与全注意力发展方向的思考。
股价翻倍的英特尔,ICU门口的“芯片工厂”
英特尔近两月获多方资金,股价涨幅超116%。但代工业务问题多,如18A产能不足、技术指标不出色、持续亏损等。其要想追上台积电,需合理规划先进节点投资及收缩成熟制程扩张。