「原生记忆能力」共找到 3946 篇相关文章
美团提出首个语音交互GUI智能体,端到端语音训练能力优于传统文本训练
美团和浙大联合推出GUIRoboTron - Speech,这是首个能利用语音指令和屏幕截图端到端决策的自主GUI智能体。它解决了文本依赖问题,团队经多步骤研发,其性能评估表现佳,还给出招聘信息。
看似无害的提问,也能偷走RAG系统的记忆——IKEA:隐蔽高效的数据提取攻击新范式
研究聚焦RAG系统,提出全新黑盒攻击方法IKEA。它不依赖异常指令,通过自然查询提取私有信息。经多数据集测试,其效率和成功率高,还证实提取知识实用,揭示RAG系统潜在脆弱性。
ChatGPT那一套要过时了?翁荔实测创业首个模型,回合制AI被“原生实时交互”秒了
Thinking Machines推出交互模型TML - Interaction - Small,可实时接收多模态输入并响应,性能超现有实时系统。该模型未开放,计划先有限预览再广泛发布,若开放将为企业带来巨大价值。
王兴兴亲测后点赞!这家AI公司提前半年把“龙虾”能力带上车,还管住了Token黑洞
宇树科技王兴兴体验宝马新世代 i3 智能座舱后称赞,其核心技术来自斑马智能“元神 AI”。斑马智能发布“元神 AI 汽车机器人大脑”等,对“元神 AI”升级,明确交流和办事方向,还管控 Token 等挑战。
最强多模态模型也拿不到30分?DeepImageSearch定义相册搜索新范式,开启个人视觉记忆的深度搜索时代
人大窦志成教授团队联合OPPO研究院提出DeepImageSearch图像检索新范式,将其从“逐张语义匹配”推向“语料库级上下文推理”。团队构建评测基准DISBench,用ImageSeeker框架评测主流模型,结果显示最强模型单次完美解决查询比例不超三成。
社区供稿丨以小博大!Nanbeige4-3B重磅开源:硬刚Qwen3,挑战小模型能力新高度
近年来大语言模型发展陷入‘参数军备竞赛’,成本高昂。Boss直聘南北阁实验室发布Nanbeige4 - 3B,仅30亿参数,在预训练和后训练阶段采用多种创新技术,在多方面媲美甚至超越大模型。
牛!小米开源「音频语言模型」,超1亿小时预训练时间,音频理解和输出能力是真顶!
小米推出开源音频语言模型MiMo - Audio,有超1亿小时预训练时间。它能理解音频,70亿参数模型在多基准测试达SOTA,音频理解超Gemini - 2.5 - Flash,复杂推理优于GPT - 4o - Audio,还支持多模态任务。
对话百度文库:不做大模型能直接做的事,能力积累换来竞争壁垒|AI产品Time
百度文库从文档检索平台转型为一站式AI内容获取和创作平台,付费用户超4000万,AI MAU近亿,智能PPT访问量全球第一。访谈中,负责人分享产品理念、优势及运营经验,如不走大模型能直接做的事,从用户需求出发开发功能等。
手术刀式去噪突破LLM能力上限,从头预训练模型下游任务平均提高7.2% | 中科院&阿里
中科院计算所与阿里Qwen等团队联合提出RefineX框架,通过程序化编辑任务实现预训练数据精炼。它将专家指导结果蒸馏为删除程序,训练优化模型。用其净化数据训练模型,下游任务平均提高7.2%。
金山与华科发布多模态模型MonkeyOCR v1.5:文档解析能力超越PaddleOCR-VL,复杂表格解析首次突破90%
2025年6月以来多模态文档解析成前沿课题。MonkeyOCR v1.5是全新框架,在OmniDocBench v1.5等基准上全面突破,复杂表格等场景提升9.7%,采用两阶段解析管道和复杂表格处理方案。