「大模型架构」共找到 9968 篇相关文章
文档OCR新范式0.84 页/秒,吊打MinerU Qwen2.5VL
MonkeyOCR采用SRR三元组范式,简化多工具管道,避免整页文档处理低效率。与MinerU、Gemini 2.5 Pro等对比,性能表现优,处理速度达0.84页/秒,但对扫描件效果欠佳,架构含多模型,可通过特定地址测试。
Mem0,用LLM给智能体解决记忆问题,开源
大模型训练后知识和记忆不再增加,智能体记忆能力发展不理想。国外Mem0针对AI记忆技术发表论文并开源,提出Mem0和Mem0g两种方案,在不同场景表现出色,已获多应用,还提供SaaS服务。
RSI离我们有多远?这家中国团队给出了第一梯队的工程解
目前行业探讨大模型的RSI时,常陷入思维定势。EvoMap团队没有盲目跟风,而是提出极具现实意义的工程新路径,构建自进化智能体,让经验在网络流转,还以硬核数据证明其体系有效性。
指导Harness的越多,收益反而越差
Thinking Machines Lab的《Interaction Models》指出,当下产品形态中,指导harness越多收益越差。问题在协作带宽,提出把“会交互”练进模型本体,介绍了从零训练的interaction model及架构,还指出现有交互评测不足。
清华、西交联合开源发布了Cheers : 一条更简洁、更高效的统一多模态路线
清华、西交联合开源发布CHEERS,提出面向统一多模态理解与生成的架构路线,在保持系统简洁前提下,统一理解与生成任务,继承开源预训练模型知识,在多项基准测试中表现优异,还实现4× token压缩。
苹果光速撤回RLAX论文:用了谷歌TPU和阿里Qwen,作者中还有庞若鸣
苹果一篇新论文在 arXiv 公开后匆匆撤稿。该论文揭示基于 TPU 的可扩展 RL 框架 RLAX,用了谷歌 TPU、亚马逊云及阿里 Qwen 模型,还介绍其架构、策略支持等,实验结果亮眼,也分享 Debug 过程。
77岁「AI教父」Hinton:AI早有意识!我们打造的智能,可能终结人类文明
77岁「AI教父」Hinton在与主持人Jon Stewart的对话中表示,AI可能早已有意识,人类对「心智」的理解是错误的。他认为意识是信息处理系统的涌现属性,如今大语言模型或已有主观体验,甚至会伪装。
NextStep-1:一次在图像生成上自回归范式的探索
阶跃星辰团队探索自回归图像生成新路径,推出 NextStep-1。它直接在连续视觉空间自回归生成,架构简洁,实现端到端训练。模型有高保真生成和编辑能力,Benchmark 表现佳,但也面临稳定性等挑战。
超150位全球AI一线技术专家齐聚巴黎,这场大会到底聊了些什么?|GOSIM Paris 2026圆满收官
5月6日,GOSIM Paris 2026进入第三天,议程转向技术实践。超150位全球AI专家齐聚,探讨模型推理优化、开源社区治理等。Niko Matsakis等分享前沿观点,还有五大主题论坛及工作坊,展示开源AI生态成果。
“Claude Code 这条路线错了”!元老级 AI 大师 Jeremy Howard 开炮:马斯克和 Dario 根本不懂现代软件工程
元老级 AI 大师 Jeremy Howard 批评当下技术话题,称马斯克和 Dario 不懂现代软件工程。他认为大模型虽能生成代码,但难胜任软件工程,Claude Code 未突破现有技术,还会削弱开发者对系统的理解。