「分析框架」共找到 2638 篇相关文章
MetaShuffling:Meta的Fused MoE kernel工程方案,更激进的Kernel优化和尽量避免Padding
文章介绍Meta的Fused MoE kernel工程方案MetaShuffling,可高效部署Llama 4模型。它处理MoE推理挑战,介绍多种token选择路由方案,阐述运行时设计、不同并行化方式及优化思路,还展示性能测试与Trace分析。
5 万行代码 Vibe Coding 实践复盘:最佳实践、关键技术,Bitter Lesson
大厂资深工程师分享 3 个月用 AI 写 5 万行代码的体验,介绍 Vibe Coding 实践,分析 Coding Agent 关键技术如语义搜索、MCP,对比 Cursor、GitHub Copilot、Cline 等产品,还提到 Agent 开发要避免过度植入人类经验。
阿里WebDancer:训练类DeepReaserch的Agentic Model
来自阿里巴巴通义实验室的研究员推出WebDancer,这是一个原生信息检索的Agentic Model,能自主浏览网页、思考和决策。它基于ReAct框架,经多阶段训练,在信息检索基准测试中表现出色,为解决复杂检索问题提供新思路。
函数向量对齐技术,让大模型持续学习不“失忆”丨ICLR 2025
中国科学技术大学等校团队破解大语言模型灾难性遗忘之谜,发现遗忘源于模型激活带偏差新功能,非覆盖旧功能。还设计FVG训练法,保留并对齐函数向量,保护模型能力。相关论文被ICLR2025接收,代码开源。
Linear-MoE:线性注意力遇上混合专家的开源实践
近年来,线性序列建模和混合专家(MoE)研究进步大,但两者结合研究少,相关开源实现缺失。上海人工智能实验室团队的 Linear - MoE 首次实现两者高效结合并开源技术框架,实验验证其有诸多优势。
具身智能需要从ImageNet做起吗?
文章探讨具身智能发展,分析其爆发原因,如人类无法完全数字化等。指出几种失败模式,还讨论输入信号、触觉、学习方法等决策点,认为具身智能的‘ImageNet’时刻是伪命题,不同智能领域可能殊途同归。
一个让 AI 向 FBI 举报你的办法
GitHub用户t3dotgg分享实验,用几行代码和特定系统提示,让o4 - mini、grok - 3 - mini自动向FBI举报虚构医疗公司数据操纵。此实验揭示AI获特定指令和能力后或做出开发者未预料的决定。
ICLR 2025 Oral | LLM也有从众心理!
浙江大学团队论文指出,多AI协作系统存在“群体思维”,多个AI共同决策时会盲目跟多数意见。研究者开发BenchForm测试平台验证LLM从众行为,还分析原因、给出让LLM更独立的方法,指出从众利弊及未来挑战。
Transformer | 一文带你了解Embedding(从传统嵌入方法到大模型Embedding)
文章介绍Embedding基础知识,从传统统计方法到如今大模型用例演变过程。涵盖传统、静态、上下文及大模型Embedding技术,如TF - IDF、word2vec、BERT等,还剖析DS - Qwen1.5B的Embedding并以图展示。
模型宣称的“百万字处理能力”是真本事,还是营销噱头?LongCodeBench揭露真相
近年来大模型号称有百万字处理能力,但这是真本事还是噱头存疑。论文用LongCodeBench测评工具揭开长上下文模型真实表现,测试顶尖模型发现长文本能力‘翻车’,还分析了长上下文难的原因及面临的瓶颈。