「非Transformer架构」共找到 2527 篇相关文章
大语言模型为何会“说谎”?6000字深度长文揭秘AI意识的萌芽
2023年12月至2024年5月,Anthropic发布三篇论文,证明大语言模型会“说谎”,揭示了堪比人类心理的四层心智架构,可能是人工智能意识的起点。论文还分析了AI“说谎”原因,展示其意识萌芽,引发对赋予AI意识后果的思考。
DeepSeek开源,Agent能力大升级,剧透2026!
DeepSeek昨晚更新并开源V3.2正式版及长思考增强版V3.2-Speciale,亮点是Agent能力进化。一年来它未增模型规模,靠架构优化等提升性能、降低成本,坚持自我路线很稳,V3.2继续提升能力。
WRC整理床铺机器人背后模型曝光!端到端双系统全身智能VLA,仅凭少量微调就能get任务
星海图在2025WRC展示G0模型,可让机器人自主完成铺床任务。其发布端到端双系统全身智能VLA模型G0,结合真机数据集与架构,还构建开放数据集,评测结果优于π0模型,即将开源。
顶尖模型离“科学家”还差得远?AI4S亟待迈向2.0时代
《Nature》研究指出,过度依赖现有深度学习模型或阻碍创新。上海 AI 实验室周伯文提出,应推动科学智能从 AI4S 迈向 AGI4S,还介绍“智者”SAGE 架构、“书生”模型及平台等探索成果,并邀同行共拓蓝图。
中国AI芯片大突围,DeepSeek V3.1引爆算力革命
DeepSeek V3.1发布,是中国AI技术自主性的战略突围。它有6850亿参数,采用UE8M0 FP8适配国产芯片,具混合推理架构、Agent能力等。其发布或重塑AI产业格局,推动国产芯片发展。
大概念模型:AI 推理的新范式
大概念模型(LCM)是自然语言处理新范式,侧重结构化推理和理解,与 LLM 不同。它依赖结构化知识,可模拟专家思维,解决当前 AI 缺陷,文章还介绍其架构、应用、局限,探讨与 LLM 结合的未来发展。
95%的人还在手动提取数据,用这个工具秒变结构化
文章介绍Google开源的LangExtract,它基于大语言模型,能将非结构化文本转为结构化数据。有精准溯源、少样本定义等6大优势,可3步完成安装配置,还介绍基础使用、长文档处理、多模型支持及实战案例等内容。
不用额外缓存!英伟达开源大模型记忆压缩方案,128K上下文提速2.7倍
英伟达联合多机构推出TTT - E2E方法,在长文本处理上提速显著且性能不打折。它基于标准Transformer,将长文本建模转为「持续学习」任务,核心是上下文压缩,避免额外缓存,代码和论文已开源。
AI coding 智能体设计
文章从分析Gemini - CLI源代码入手,解读AI coding工具智能体设计。涵盖用户提示词预处理、工具注册与调用、架构设计、预置提示词等内容,还对比了Gemini - CLI和Claude Code可扩展性设计,介绍规约驱动开发模式。
1B参数,0.21秒识别,0.3%错字率:混元OCR拿下7项SOTA
腾讯开源模型 HunyuanOCR 在权威榜单 OmniDocBench 上霸榜,虽仅 1B 参数,却在 7 项任务击败众多大模型。它解决传统 OCR 流水线及通用大模型痛点,通过独特架构和训练方法实现高效准确识别。