关键表征微调」共找到 1367 篇相关文章

算法论文7

Transformer死角,只需500步后训练,循环模型突破256k长度泛化极限

线性循环模型能处理极长序列,是相比Transformer的关键优势,但过去循环模型性能不足且难以泛化。CMU等研究者证明,通过简单训练干预,循环模型500步后训练可突破256k长度泛化极限。

机器之心
新闻资讯7

Jack Clark: 美国 AI 政策的隐形推手,时代的良心还是囚徒?

本文深入剖析Jack Clark,他关注中国AI进展,认可其成就,但对中国态度强硬。身为美国AI政策“民间沙皇”,他为美国遏制中国AI发展设计五层战略,文章探讨其进入AI核心圈原因、政策理念及背后悖论。

海外独角兽
8

如何实现RAG与MCP集成

文章聚焦RAG与MCP集成,介绍RAG突破传统模型局限及不足,引出Agentic RAG。阐述MCP革新AI工具连接方式,结合二者构建集成架构,还给出实现步骤、优化策略与代码实践,为释放AI系统潜力提供方案。

机器学习AI算法工程
推荐文章7

AI Agents,年中总结!

文章梳理6月旧金山AI Engineering World's Fair重磅分享,指出AI Agent发展方向是成为自主处理复杂工作的助手,还介绍了Ambient Agents崛起、Agent UX设计两派观点、训练进入RL时代等关键趋势。

探索AGI
推荐文章8

巨头博弈下,Agent 的机会和价值究竟在哪里?

极客公园创始人与拾象相关人员对话,探讨 Agent 热点话题。指出其真正门槛或在基础设施,还谈及产品路径、技术挑战等,如通用 Agent 是大模型公司主战场,Coding 是衡量 AGI 关键指标等。

海外独角兽
推荐文章8

吴恩达深夜发文:GenAI 时代应用工程师的必备能力清单

吴恩达发文剖析GenAI应用工程师这一新兴职业。指出其技能要求与传统软件工程师不同,强调掌握多种AI积木块、利用AI辅助编程工具的重要性,还提及产品技能是加分项,并给出面试关键问题。

AGI Hunt
新闻资讯7

Anthropic CEO:人的幻觉比AI 更多!这是真的吗?

Anthropic公司CEO称AI幻觉比人类少,创业公司ColdIQ联合创始人Alex Vacca用虚构故事喂给ChatGPT、Claude和Gemini,测试它们识破谎言的能力,实验结果显示各模型表现不同,AI幻觉短期内难消失。

AGI Hunt
新闻资讯7

ChatGPT 评估员工绩效,评得是真能力吗?

绩效考核季,不少管理者用 ChatGPT 生成绩效评语,认为高效。但文章指出,把关键管理工作交 AI 是‘职业肌肉’萎缩,还给出管理场景下 AI 使用清单,网友也对 AI 辅助绩效评估展开热议。

AI科技大本营
产品应用8

Meta「轻量级」KernelLLM颠覆GPU内核生成,8B参数碾压GPT-4o

Meta推出基于Llama 3.1微调的8B参数KernelLLM,能将PyTorch代码转高效Triton GPU内核。实测单次推理性能超GPT - 4o和DeepSeek V3,多次生成得分更高,让内核开发更易上手。

新智元
推荐文章7

中学生就能看懂:从零开始理解LLM内部原理【八】| 什么是残差连接?

本系列是对长篇文章《Understanding LLMs from Scratch Using Middle School Math》的解读笔记。本篇介绍残差连接,指出传统多层模型有网络退化和梯度传导困难问题,而残差连接能缓解,还说明了其工作原理和可行性。

AI大模型应用实践