「开源知识库」共找到 3048 篇相关文章
ICLR 2026惊现SAM 3,分割一切的下一步:让模型理解「概念」
9月12日,匿名论文‘SAM 3: SEGMENT ANYTHING WITH CONCEPTS’登陆ICLR 2026,外界猜测出自Meta。SAM 3定义了可提示概念分割任务,性能比之前系统提升至少2倍,在多基准测试获SOTA成绩,但也有人质疑是旧概念包装。
西湖大学打造了一个AI科学家,突破人类SOTA,还能自己发论文
西湖大学文本智能实验室推出能自主探索的AI科学家DeepScientist,两周完成人类三年科研量。它在三个前沿AI任务刷新SOTA纪录,还能写论文。文中介绍其科研历史、工作方式、成果及面临的伦理问题。
你敢信?GPT-5的电脑操作水平只比人类低2%了
Agent S3刷新了计算机使用智能体(CUA)在「OSWorld」基准测试的记录,性能达69.9%,接近人类水平。它引入bBoN实现并行扩展,还精简框架、引入原生代码智能体,已开源并发布论文。
让AI学会潜意识推理,Sapient发布类脑模型HRM
新加坡初创公司Sapient Intelligence发布仅2700万参数的分层推理模型HRM,在多项高难度推理任务上超越大模型。它绕过大模型推理困境,借鉴大脑机制,训练效率高,开源后GitHub星标突破10.3k。
红杉美国:未来一年,这五个 AI 赛道我们重点关注
红杉资本分享未来 AI 投资判断,认为 AI 革命堪比工业革命,蕴含 10 万亿美元机遇。未来 12 - 18 个月,将重点关注持久化记忆、通信协议、AI 语音、AI 安全和开源 AI 五大主题,这些也是创业好赛道。
面向长时语音与声音克隆的全模态开源万能聊天机器人MGM-Omni
文章介绍了全模态开源聊天机器人MGM - Omni,它基于MiniGemini,支持多模态输入输出,具备长语音理解、生成、流式生成、零样本语音克隆等特性,还给出安装、使用方法,展示评估结果。
刚刚,大模型装上「鹰眼」!首创高刷视频理解,谷歌Gemini 2.5完败
面壁智能开源MiniCPM-V 4.5多模态端侧模型,8B参数越级反超72B巨无霸,在多领域达SOTA。它首创高刷视频理解,性能强、效率高、适合端侧部署,还实现多技术创新,是开源端侧多模态AI的革命。
最新智能体自动操作手机电脑,10个榜单开源SOTA全拿下|通义实验室
通义实验室推出Mobile - Agent - v3智能体框架,在多核心榜单获开源最佳。它能完成复杂任务,在多智能体框架中灵活切换角色。团队搭建云环境基建,从多维度构建数据,用强化学习和多智能体协作提升其性能。
Perplexiy声称想要天价收购Chrome的背后算盘
估值180亿的AI初创公司Perplexiy要花345亿收购Chrome,宣称保持代码开源、不更改默认搜索引擎等。其或想借谷歌反垄断麻烦套利,OpenAI也有收购意向,反映科技行业热衷接管旧基建现状。
用最简单的大模型技术打造一个迁云专家有多难?
文章探讨在云迁移领域用大模型技术“复制”专家80%核心能力。分析标准化方案不足及简单RAG局限,介绍“LX0.1”AI专家助手构建,还提及分层评测、人机协同等优化,最后展望AI在云迁移的未来方向。