「长上下文问题」共找到 4112 篇相关文章
月烧35万元token、逼得Claude官方连夜限速!被全网吐槽的中国“榜一大哥”,已经靠 AI 年入千万了
X 用户“刘小排”认领月耗 5 万美元 Claude Code token。他靠 AI 年入近千万,用 AI 开发产品,还分享找需求、做产品等经验。他认为 AI 是长期机会,能放大个人能力。
ACL 2025杰出论文!用能力显著向量让大模型下游任务性能预测更精准
上海人工智能实验室与复旦大学联合研究成果《Capability Salience Vector》获ACL 2025杰出论文奖。提出能力显著向量(CSV)解决验证损失与下游任务能力脱节问题,实验验证其提升了下游任务表现可预测性。
多突触神经元模型问世,国内团队打造类脑计算新引擎,登上《自然·通讯》
当前人工智能高能耗问题凸显,脉冲神经网络被认为更具生物合理性、能效更高,但缺乏平衡计算效率和生物合理性的脉冲神经元模型。国防科技大学与中科院团队合作提出 MSF 脉冲神经元模型,相关研究发表于《自然・通讯》。
无需训练的LLM对齐方法综述
大型语言模型应用引发担忧,传统微调方法有短板,免训练对齐(TF Alignment)应运而生。本文是首篇系统综述TF对齐技术的论文,提出三阶段分类框架,实验显示TF方法优势明显,还指明未来研究方向。
AI 时代操作系统的三重叙事:技术重构、国产化突围与生态共建
《AI 进化论:智算时代操作系统的破局之路》首期,周明辉、马涛围绕 AI 对操作系统的影响等核心命题展开对话。指出 AI 让操作系统面临挑战,技术演进分两条路径,还谈到安全、国产化、生态共建等问题。
30余家单位确认加入,国内首部AI数据标注标准欢迎参与起草!
数据标注对AI产业重要,但行业合规问题突出。国内首部AI数据标注合规标准《面向人工智能的数据标注合规指南》已完成修订稿,正征集起草人/单位,聚焦5大关键合规议题,邀各方共解难题。
研究者警告:强化学习暗藏「策略悬崖」危机,AI对齐的根本性挑战浮现
强化学习是大模型推理与对齐的核心方法,但常带来模型行为脆弱等问题。上海人工智能实验室徐兴成博士论文揭示‘策略悬崖’挑战,分析其成因,解释多种对齐失败现象,并提出对AI研究的启示。
递归神经网络的复兴:Mixture-of-Recursions
Google DeepMind研究者设计的语言模型,能判断关键单词并进行深度递归计算,通过轻量级“路由器”节省计算资源,在同等训练成本下表现显著优于传统模型,文中还提及其他解决动态算力分配问题的思路。
AI Video Is Eating The World,创作者、创业者的机会在哪?
AI视频生成虽仍有技术问题,但已重塑短视频创作生态,衍生出新的内容商业化模式。a16z合伙人分享创作经验、变现方式与创业机会,还提到爆款公式、成本挑战及不同平台内容特点。
基于闪电注意力机制,创新高效开源大模型
传统Transformer架构处理长文本和复杂推理任务有效率瓶颈,多数领先模型仍依赖传统注意力设计。MiniMax开源基于闪电注意力机制的专家混合模型Minimax,从架构、创新模块、训练框架等多方面优化,表现突出。