「概念理解」共找到 1094 篇相关文章
谷歌太壕了!编程Agent大招至简:开源且免费,百万上下文、多模态、MCP全支持
谷歌开源免费的编程Agent Gemini CLI,提供业界最高免费限额,能在终端访问Gemini。其能力多样,涵盖代码理解等,支持百万上下文、多模态和MCP,开源协议为Apache 2.0,还给出安装和使用指引。
继AlphaFold之后,DeepMind再放“大招”:AlphaGenome直击疾病根源
谷歌DeepMind推出AI模型AlphaGenome,可预测DNA序列微小变化对基因调控的影响,已向非商业研究领域开放。它能处理长序列、输出高分辨率结果,有四大优势,在多领域有研究潜力,但也存在局限。
更多thinking≠更好结果,精准thinking可砍掉一半长度
当前大模型如GPT - 4、DeepSeek推理又长又啰嗦,论文发现其在简单题目上过度推理。作者提出‘无效思考’概念,还给出解决原则,用LC - R1方法训练,效果显著,揭示精准思考才是王道。
大模型到底是怎么「思考」的?第一篇系统性综述SAE的文章来了
在大语言模型时代,人们需要“能解释”的LLM。SAE技术崛起,作者团队发布首篇SAE综述,梳理其技术、演化和挑战。介绍了SAE概念、优势,涵盖其技术框架、可解释性分析等多方面内容。
揭秘千卡 GPU 集群如何高效训练多模态大模型:vivo AI 团队实战经验分享|AICon
在 InfoQ 举办的 AICon 大会上,vivo AI 架构师王兆雄分享多模态大模型训练经验。介绍了 LLaVA 和 DiT 模型训练挑战,从数据处理、模型计算等方面提出优化策略,还展望 AI Infra 未来发展方向。
ICML'25 | 告别手动SFT!一句话得到你的专属大模型LoRA
传统微调方法开销大、部署难,Text-to-LoRA (T2L) 框架应运而生。它基于自然语言指令对 Transformer 模型即时适配,有三种架构变体,采用两种训练方法,实验显示其在多维度表现有效。
从零开始200行python代码实现LLM
文章从传统思路实现诗词生成器入手,介绍了词汇表、Bigram模型等概念,接着用Python和PyTorch实现了真正的Bigram模型,阐述模型、训练等内容,最后回顾成果,下一篇将基于此实现完整GPT。
AI再破2000年前「上古卷轴」!古希腊著作原文首次重见天日
2025年,维苏威挑战赛有历史性突破,研究人员首次非侵入性读取仍卷着的赫库兰尼姆古卷标题。该成果获60000美元首标题奖,解读内容或重塑学界对相关作品结构的理解。
人生周报v022:十层认知
文章围绕育儿量化指标、写提示词的难点、培训出路、AI生成PPT的局限、MCP协议误区等多个话题展开讨论,还推荐了物理科普书《解析物理的十层之旅》。
黄仁勋提前锁定20年OpenAI芯片收入!第一轮150万GPU卖2000亿美元
英伟达推出‘LPS’概念,联合投资机构出5000亿美元建数据中心,为客户担保。首个项目为在美为OpenAI建150万GPU数据中心,20年或带来巨额芯片收入。黄仁勋也对相关风险做了澄清。