「无数据训练」共找到 4422 篇相关文章
告别大模型“失忆”!人大开源MemSifter:轻量代理先思考再回忆,搞定长时记忆
当前大语言模型在长周期任务中,长时持久记忆管理陷入“精度不够”和“成本太高”的两难困境。中国人民大学团队提出MemSifter框架,将记忆检索工作外包给轻量级代理模型,在8个权威测试中超越现有方案,且已开源。
Anthropic 最新的研究:AI 并未造成失业?
2026年3月5日,Anthropic发布经济研究文章,指出无明显证据证明AI已造成大规模失业。研究提出‘观测的暴露度’衡量维度,发现AI实际使用远低于理论能力,其替代工作进展比预期慢。
OpenAI深夜祭出GPT-5.4,暴击Claude!原生操控电脑,打工人悬了
OpenAI发布GPT - 5.4,全面反击Gemini 3.1 Pro和Claude Opus 4.6。它是首个有「原生电脑使用」能力的通用模型,各维度无短板,成绩炸裂,定价也创新高。
AI竞争正酣,靠什么取胜?8个要点,一篇讲清楚
全球AI竞赛进入下半场,赛道转向‘谁更能干活’。我国有工业体系、应用场景和市场优势,取胜关键是‘通专融合’。文中提炼上海人工智能实验室周伯文长文8个要点,给出应对之策。
Token消耗暴降80%,Cloudflare让服务器原生支持Markdown:OpenClaw要笑醒了
Cloudflare发布Markdown for Agents功能,让Web服务器可向AI Agent投喂Markdown数据,抛弃臃肿HTML,Token消耗降80%,还引入内容信号机制,有手动挡工具,功能处Beta阶段,可免费启用。
速度提升,能力却暴跌?扩散模型做智能体的残酷真相
南洋理工大学陶大程教授团队联合发布评测报告,揭示扩散语言模型在智能体能力上有系统性缺陷,落后自回归模型。还分析其失败原因,提出评测框架,明确能力边界并给出研究建议。
《多模态大语言模型技术发展报告》正式发布 | 中科算网算泥社区
2月5日,中科算网算泥社区发布《多模态大语言模型技术发展报告》。报告回顾多模态大模型发展历程,剖析核心技术创新,展示应用实践,分析挑战与机遇,为各界提供参考,推动多模态AI技术发展。
具身机器人抢着砸钱上春晚,投资人回应了
具身智能机器人打响春晚赞助大战,宇树科技、魔法原子、追觅科技等参与。纪源资本管理合伙人符绩勋认为头部公司需高曝光,能获更多商业机会、政府和资本支持。他还分享了对行业估值、出海等问题看法。
刚刚,DeepSeek又探索新架构了,开源OCR 2
DeepSeek更新DeepSeek - OCR 2,引入DeepEncoder V2架构,实现视觉编码范式转变。模型和技术报告齐开源,在多项测试中表现出色,降低重复率,为全模态编码提供路径,但在报纸类文档识别有不足。
拒绝计算“一视同仁”!Elastic Attention:让大模型学会“看人下菜碟”
现代大语言模型用全注意力机制计算复杂度高,现有混合注意力策略是静态的。为此提出Elastic Attention,引入轻量级Attention Router,具备动态路由等亮点,在主流模型测试中效果好。