「稳定性提升」共找到 3008 篇相关文章
跨会话不再「失忆」:openJiuwen社区开源 AutoGenetic Memory,让Agent记忆自主生长
华为openJiuwen社区开源AutoGenetic Memory,让Agent记忆自主生长。它有分层记忆体系、Auto Dreaming等设计,能提升记忆准确率,降低Token消耗,让记忆从被动存储变为可治理、共享和自我演化的核心资产。
浙大提出Translution:统一Self-attention和Convolution,ViT、GPT架构迎来新一轮性能突破
近日,浙大与新加坡国立大学提出新型深度神经网络基础操作Translution,融合Self - Attention与Convolution优势,实现二者统一。基于它构建的网络在ViT和GPT架构下性能提升,但对算力要求更高。
ImageNet分数越高,生成反而越糊?iREPA给出解释
Adobe Research论文指出,视觉模型在ImageNet分类准确率高,生成效果未必好,全局语义强易压扁空间结构。iREPA修改REPA训练流程,削弱全局干扰,提升了生成质量。
Hugging Face 发布 FineTranslations:一个万亿级的多语言平行文本数据集
Hugging Face 发布 FineTranslations,这是含超 1 万亿 Token 的多语言数据集,用于提升机器翻译质量。它源于 FineWeb2,用 Gemma3 27B 翻译创建,数据生成流程可复现公开,还能用在其他任务。
AutoDev 预上下文引擎:预生成代码语义化信息,构建 AI 编程的知识基座
文章介绍 AutoDev 预上下文引擎,指出向量化代码检索性价比低,提出用预生成上下文提升 RAG 效果。Context Worker 能深度解析代码,支持多语言,使用简单,还可结合 MCP 服务获取上下文知识。
SRO赋能Qwen-2.5-VL推理性能飙升16.8%
文本领域推理模型成就大,但多模态大型语言模型推理能力扩展遇阻,如冷启动初始化不足等。提出SRO三阶段训练框架,经测试,ReVisual - R1平均性能提升16.8%。
Sebastian Raschka 新书《从头开始推理》抢先看,揭秘推理模型基础
著名AI技术博主Sebastian Raschka新书《Reasoning From Scratch》第一章介绍LLM中推理含义、训练阶段、模式匹配与逻辑推理区别,还讲述提升推理能力方法及从头构建推理模型的重要性等内容。
Uber Hive 联邦架构:1.6 万数据集、10PB 数据去中心化,支撑大规模分析零停机
Uber重新设计Hive数据仓库,将超16000个数据集、超10PB数据去中心化部署,解决可扩展性等挑战。采用基于指针方案迁移,系统含四大组件降低运营风险,还减少存储开销,提升生态弹性。
继火爆全网的MCP后,Anthropic 推出全新整合功能,Claude再添连接利器
继MCP后,Anthropic推出全新Integrations功能,使Claude能与各种工具和应用无缝连接,提升协作能力,其研究能力也得到增强,新功能在部分计划测试,将惠及更多用户,助力高效完成任务。
Mamba核心作者新作:取代DeepSeek在用的注意力机制,专为推理打造
Mamba核心作者Tri Dao团队提出GTA和GLA两种专为推理定制的注意力机制,在减少KV缓存用量、保持模型质量的同时,显著提升解码速度,优化长上下文推理能力。