「语言能力」共找到 4041 篇相关文章
生成式视角重塑监督学习!标签不只是答案,更是学习指南 | ICML 2025
上海交大等机构团队在ICML 2025提出预测一致性学习(PCL),通过扩散过程消减标签信息,引入噪声标签,将标签学习分解为渐进式任务,实现标签信息复用。在多模态任务实验中,PCL表现优于传统监督学习。
砍掉70%内存!陈丹琦团队破解LLM长文本瓶颈
大型语言模型处理长文本时,KV缓存占用内存巨大。陈丹琦团队提出KV足迹作评估标尺,推出分块驱逐与PruLong训练技术,在128K长文本任务中最高降低70%内存,性能损失仅10%。
大模型到底是怎么「思考」的?第一篇系统性综述SAE的文章来了
在大语言模型时代,人们需要“能解释”的LLM。SAE技术崛起,作者团队发布首篇SAE综述,梳理其技术、演化和挑战。介绍了SAE概念、优势,涵盖其技术框架、可解释性分析等多方面内容。
o3-pro答高难题文字游戏引围观,OpenAI前员工讽刺苹果:这都不叫推理那什么叫推理
OpenAI“最新最强版”推理模型o3 - pro引发关注。首位全职提示工程师给它设难题,它推理后答对。OpenAI前员工借此讽刺苹果。各大评测榜单显示其表现与官方有差异,苹果&SpaceX前工程师分享使用心得,肯定其表现。
The Batch:831 | 机器翻译正在实践中发挥作用
人工智能为语言学习应用巨头 Duolingo 带来生产力提升,借助生成式 AI 构建 148 门课程,总量翻倍。其 AI 辅助课程构建法能快速转化多语种版本,还在评估多模型,不过此举也引发批评。
高考数学全卷重赛!一道题难倒所有大模型,新选手Gemini夺冠,豆包DeepSeek并列第二
因网友质疑上次测评不严谨,此次用六款大模型挑战含解答题的全套高考数学题。结果Gemini 2.5 Pro夺冠,Doubao和DeepSeek R1并列第二。解答题是失分重灾区,图像题难倒多模态大模型。
TypeScript“杀疯了”!60% 到 70%YC 创企用它构建 AI Agent,超越 Python 有戏了?
近日,Mastra AI 创始人称约 60 - 70% 的 YC X25 Agent 公司用 TypeScript 构建 AI Agent。该语言在 AI 应用开发优势明显,OpenAI 等也加大支持,但业内认为目前 Python 主导地位难被取代。
当 AI 能写代码修 bug,高考报计算机专业是“火坑”还是“新机遇” |深度对话 6 位专家
在 AI 浪潮下,编程范式变革,开发岗位结构改变。本文采访 6 位专家探讨高考生报计算机专业是否值得,还分析适合人群、专业核心技能重要性变化等,为考生提供多维度参考。
训练MoE足足提速70%!华为只用了3招
Scaling Law下,MoE成扩展模型能力法宝,但训练难题凸显。华为构建Adaptive Pipe & EDPB优化方案,还打造DeployMind仿真平台,解决了MoE训练中通信等待、负载不均等问题,使训练吞吐提升72.6%。
阿里开源自主搜索AI Agent,搜论文、网站资讯无所不能
今天凌晨,阿里开源创新自主搜索AI Agent——WebAgent,具备端到端自主信息检索与多步推理能力。还介绍了WebDancer框架从数据构建到训练优化各阶段,助其完成复杂信息检索任务。