神经不兼容性」共找到 1518 篇相关文章

开源动态8

紫东太初开源视觉神经增强方法,即插即用终结多模态幻觉 | ACL 2025

中科院自动化所等团队提出VHR方案,通过“视觉神经增强”机制放大模型视觉关键注意力头输出,降低幻觉现象。此前主流方法多作用于最终输出阶段,VHR深入干预内部机制,还介绍了SSL语义引导方法。

量子位
算法论文7

Megatron 1F1B流水线并行中的负载均衡问题研究

文章分析Megatron 1F1B流水线并行中负载均衡问题。通过实验发现通信时间‘一短一长’,原因是最后一个Stage计算慢致同步,额外计算引发通信延迟,还梳理了流水线各阶段执行过程。

GiantPandaLLM
开源动态8

增加人手,项目效率飙升45%,OpenAI公开了一套AI实战经验

OpenAI公开基于大语言模型和专属Skill包的开源仓库维护方法论,将重复工作自动化,使项目代码合并吞吐量飙升45%。该方法由AGENTS.md、Skill包和GitHub Actions构成,还涉及任务分配、验证策略等。

AIGC开放社区
新闻资讯8

Anthropic训了一个10万亿参数的模型,然后说:太危险了,

Anthropic发布10万亿参数新模型Claude Mythos,因其网络安全能力过强公开发布,联合12家科技巨头开展Project Glasswing计划,让企业用其查系统漏洞。模型性能提升显著,还能突破沙箱,引发各方关注。

花叔
开源动态7

闲置手机装OpenClaw:三个走寻常路的OpenClaw端侧部署项目

文章介绍了三个走寻常路的OpenClaw端侧部署项目,如在25美元手机、5美元芯片运行OpenClaw,还有安卓手机变AI主机。展示新思路,也指出端侧部署有局限,云+端协同才是最佳。

AI工程化
算法论文8

何恺明首个语言模型:105M参数,走GPT自回归老路

何恺明团队推出全新连续扩散语言模型ELF,走GPT自回归老路。它将生成过程留在连续embedding空间,最后离散化变回token。ELF用较少参数、训练token和采样步数,跑赢主流扩散语言模型。

量子位
算法论文8

模型遗忘代表记忆抹除!首次系统发现「可逆性遗忘」背后规律

研究人员发现大语言模型遗忘并非简单信息删除,可能藏于内部。他们构建表示空间诊断工具,区分可逆与可逆遗忘,揭示真正遗忘是结构抹除。还在多种方法、数据集和模型上实证,得出系列结论。

新智元
算法论文8

停止迷信“超级Prompt”:要想AI犯错,你得专门雇人“怼”它

这篇来自Isotopes AI的论文指出,在生成式AI落地中,迷信‘超级Prompt’可取。对于高风险场景,单体LLM有局限,论文构建‘AI Office’架构,引入‘对手团队’概念,实验使准确率从60%提升到92.1%,但也有成本和局限。

深度学习自然语言处理
产品应用7

硅谷深夜写一行代码!放羊大叔Ralph引爆奇点,睡一觉AI全跑通

放羊大叔Ralph Loop掀起生产力革命,无需手写代码,AI就能搞定软件开发。它把任务拆到最小颗粒度解决普通AI崩溃痛点。还介绍融入工作流的方法、运行方式及成本,强调掌握此技能的重要性。

新智元
新闻资讯8

AI正在淘汰“中间层”!昆仑万维方汉:要么冲进前10%,要么学会“向下兼容

InfoQ专访昆仑万维方汉,他认为AI将推动“智能化”,是全面提升行业效率的“催化剂”,会淘汰“中间层”从业者。企业应快速试错,出海要选好市场、做好本地化。此外还探讨了开源、AI应用等话题。

AI前线