「输入压缩」共找到 436 篇相关文章
OpenAI推出云端编程智能体Codex,进一步推动软件工程领域变革
OpenAI昨夜发布研究预览版Codex,一款集成在ChatGPT中的高级编码智能助理。它基于codex - 1模型,支持多种编程语言,有深度代码分析等核心功能,还有codex - mini - latest API版本,或重构软件开发行业。
0.25秒识破未见攻击,这套检测方法没看过任何越狱样本 | EMNLP'26
大视觉语言模型带来隐蔽攻击面,现有检测器难平衡。中国人民大学与阿里巴巴集团联合提出Learning to Detect(LoD),不依赖攻击样本和手工规则,从模型内部激活学安全模式,实验效果好且代码开源。
Claude Code没有“魔法”
资深工程师 Daisy Hollman 在演讲介绍了 Claude Code 插件设计与上下文工程原语,以及 Anthropic 内部多 Agent 工作流。指出定制模型可放大能力,上下文窗口是关键,还探讨多种插件抽象与工作流扩展方式。
谷歌放的这波免费AI额度,大到很多人以为是假的
谷歌在Google AI Studio上调整Gemini API免费层规则,额度达每分钟100万token,无额外申请门槛。覆盖Gemini 2.5全系列模型,支持多模态输入。开发者反应两极,有人看好,也有人质疑。
将注意力旋转 90 度!今天,Kimi 的「注意力残差」火了
Kimi团队发布技术报告Attention Residuals,用依赖输入的注意力机制取代标准深度递归,解决传统残差连接的信息稀释和隐藏状态爆炸问题。实验显示其有计算优势,下游任务表现佳。
谷歌新模型登顶Nature,人类基因密码被解码
谷歌推出全新AI工具AlphaGenome,能精准预测人类DNA序列变异对调控基因生物过程的影响。它满足多项条件,在26个变异效应benchmark中25个达SOTA,还通过多个案例和实验验证了其性能。
一个全新的世界模型,终于让AI视频进入了“无限流”时代。
AI视频公司PixVerse推出实时世界生成模型PixVerse R1,用户可输入Prompt修改视频进程,无干涉时视频会自行延续。该模型为世界模型补上实时视频生成方向,实测体验乐趣十足。
美团开源全模态,比肩顶级闭源模型,开源新SOTA
美团LongCat团队发布5600亿参数开源全模态模型LongCat - Flash - Omni,它有端到端全模态架构,能实现毫秒级实时音频 - 视觉交互。该模型训练采用渐进式策略,工程上有高效技术支撑,在多基准测试表现出色。
给Claude Code加个音效提醒
文章指出Claude Code缺少提醒功能,作者用Claude Code自带的hooks功能和macOS系统的afplay工具,实现音效提醒。需要确认时播放塞尔达传说BGM,完成时播放超级马里奥BGM,还介绍配置方法。
SimpAgent (ICCV2025 Highlight):上下⽂简化重塑GUI智能体,更少计算,更强性能
在多模态大模型加持下,纯视觉GUI智能体成通用操作智能体重要方向,但面临元素与历史上下文问题。哈工深和华为提出SimpAgent,从上下文简化建模入手,实现更快更强性能,工作被ICCV 2025录用。