「时长控制」共找到 1599 篇相关文章
拒绝计算“一视同仁”!Elastic Attention:让大模型学会“看人下菜碟”
现代大语言模型用全注意力机制计算复杂度高,现有混合注意力策略是静态的。为此提出Elastic Attention,引入轻量级Attention Router,具备动态路由等亮点,在主流模型测试中效果好。
Claude Cowork唱罢,开源Clawdbot登场!
本文介绍开源专属个人AI助手Clawdbot项目,已33.7k Star。阐述其功能,如整理文件、处理邮件等;对比与Claude Cowork异同;还探讨个人AI助手生态系统架构,认为它代表未来AI应用落地方向。
定位大模型「作弊」神经回路!新研究首次揭示:虚假奖励如何精准激活第18-20层记忆
此前学术界发现大模型用虚假奖励训练也能提升准确率,背后微观机制是黑盒。南科大等团队深度拆解,定位到关键记忆节点,发现‘困惑度悖论’,还能操控记忆,成果对评估、检测和去污染有意义。
真·开外挂!MIT新研究:架构0改动,让大模型解锁千万级上下文
MIT CSAIL团队提出递归语言模型RLM,不改动模型架构,让GPT - 5、Qwen - 3等模型具备千万级token超长文本处理能力。它将上下文处理“外包”,实验显示其处理规模超前沿模型,复杂任务优势显著,多数场景性价比高。
Gemini 3预训练负责人警告:模型战已从算法转向工程化!合成数据成代际跃迁核心,谷歌碾压OpenAI、Meta的秘密武器曝光
2025年底大模型“年终决战”,Gemini 3强势突围。其预训练负责人Sebastian Borgeaud指出,谷歌转向“做系统”,AI进入“数据有限”阶段,合成数据等构成未来进化路径,还分享了预训练热点与挑战。
Cursor AI 上下文管理的秘诀
Cursor发表《Dynamic context discovery》文章,讲述上下文管理秘密,提出“动态上下文发现”模式,分享五个优化手段,如长输出变文件、聊天历史变档案等,还阐述了为何用“文件”及相关思考。
大模型幻觉的源头找到了!清华团队锁定大模型宁愿说谎也要讨好人类的神经元
清华大学研究团队深度解剖大语言模型微观机制,确认幻觉关联神经元存在,揭示其与过度服从行为相关。通过干预神经元激活状态可增减模型幻觉行为,为开发可靠 AI 系统提供靶点。
火上浇油!Grok在悉尼光明节枪击案上大规模造谣
马斯克的Grok在悉尼光明节枪击案中大规模「翻车」,将救人英雄误认、混淆枪击与气旋等,暴露生成式AI处理实时信息的「幻觉」缺陷,凸显其无价值观、难辨虚实的软肋。
RL是「点金石」还是「挖掘机」?CMU 用可控实验给出答案
卡耐基梅隆大学研究者构建基于GSM - Infinite的可控合成数据框架,分析预训练、中期训练和RL对模型推理泛化能力的影响,调和了RL有效性的不同观点,为改进训练策略提供基础。
前端裁员黑科技!PinMe把部署从运维清单划掉,DevOps团队专注业务
PinMe是「一条命令就能部署前端」的命令行工具,在GitHub获约1k Star。它能将静态站点上传到IPFS,写入ENS子域名的contenthash,通过网关访问,无需自搭服务器和配置传统DNS,适合Web3前端部署。