「架构问题」共找到 4683 篇相关文章
Hermes Agent抄袭中国团队代码实锤!被锤后回应:你删号
AI圈现教科书级开源抄袭事件,GitHub狂揽8.5万Star的Hermes Agent被指架构级抄袭中国团队EvoMap的Evolver引擎。EvoMap公开技术对比报告,实锤两者架构高度同构,而Hermes团队回应令人失望。
ICCV 2025|训练太复杂?对图片语义、布局要求太高?图像morphing终于一步到位
图像处理中‘图像morphing’常见又有创意,但以往技术有训练复杂等问题。南洋理工大学等团队提出FreeMorph方法,无需训练实现图像变形,通过改进注意力机制解决特征丢失和过渡不连贯问题,实验效果佳。
基于闪电注意力机制,创新高效开源大模型
传统Transformer架构处理长文本和复杂推理任务有效率瓶颈,多数领先模型仍依赖传统注意力设计。MiniMax开源基于闪电注意力机制的专家混合模型Minimax,从架构、创新模块、训练框架等多方面优化,表现突出。
AI真的能读懂人心吗?阿里通义最新研究成果揭示答案
文章聚焦多模态推理问题,如全局上下文理解不足和推理捷径问题。介绍阿里通义HumanOmniV2改进方案,涵盖全局上下文理解等方面,还详述冷启动、两阶段强化学习训练方案及数据集下载和训练方法。
北大伯克利联手“拷问”大模型:最强Agent也才40分!新基准专治“不听话”的AI分析师
北大与伯克利团队推出IDA - Bench新基准,模拟真实数据分析场景,解决现有基准无法评估大模型在动态交互中可靠性的问题。测试显示,顶尖大模型成功率最高仅40%,不同模型还暴露多种问题。
ICML 2026 | 拒绝盲目猜token,阿里x浙大将投机解码带入弹性预算时代
随着大模型参数规模扩大,推理成本成核心瓶颈。投机解码在高并发下有问题,阿里与浙大学者提出 ECHO,将投机树构造建模为预算调度问题,通过稀疏门控和弹性预算调度提升系统收益。
想挣全球用户的钱,比想象中得更复杂 | AI产品海外收款避坑指南
AI 产品出海,支付不只是接 SDK 这么简单,关乎产品收入增长。不同市场支付差异大,选错或忽视风控,会导致支付成功率低等问题。文章围绕全球变现、支付风控、避坑指南等问题,给出实践建议。
论文解读:一个运算符能导出所有基本函数
波兰雅盖隆大学Odrzywołek发现二元算子EML,结合常数1能生成科学计算器所有标准功能。EML算子简化运算符集合、将离散问题转化为连续优化问题,但存在数值稳定性、表达式非唯一等局限。
美团之后,京东也开始自研大模型了
京东发布JoyAI - LLM Flash模型,激活参数小、推理快。它采用混合专家架构等技术,在基础架构、数据加工、强化学习等方面表现出色,还通过多Token预测等技术加速推理,为商业场景落地扫清障碍。
比人类专家快2倍,斯坦福联合英伟达发布TTT-Discover:用「测试时强化学习」攻克科学难题
斯坦福与英伟达等机构联合提出 TTT - Discover 方法,让 LLM 在测试时强化学习。它在多任务上成绩出色,如在数学、GPU 内核等领域超越人类和其他 AI,计算成本低,或为持续学习打开新空间。