「可解释性研究」共找到 5473 篇相关文章
不止修bug:Agentic Coding评测走向复杂feature交付新阶段
中国科学院自动化研究所联合华为提出 FeatureBench,构建端到端基础设施并开源。它从单元测试出发构造评测任务,引入多种机制保障任务可执行、可验证,能有效区分模型能力,还提供易用的评测流程。
有手就行,教你从0到1快速手搓搭建个GUI Agent
随着通用大模型发展,搭建GUI Agent难度降低。文章介绍如何用通用大模型API,从0到1搭建PC GUI Agent,包括原理、代码实现等,该Agent能跨应用操作,未来可强化功能。
DeepSeek开源大模型记忆模块!梁文锋署名新论文,下一代稀疏模型提前剧透
DeepSeek最新论文给Transformer加上“条件记忆”,补上原生知识查找机制。梁文锋署名,与北大团队合作。提出全新范式及Engram模块,解决传统N - gram问题,研究稀疏性分配,验证推理能力提升,兼顾工程优化。
AI 美妆 ARR 一年增 14 倍达 5500 万美金;另一 Newsletter 阅读 App 融了 600 万美金
海外创业者做的 Newsletter 聚合阅读 App Perch 融 600 万美金,可聚合内容,有语音朗读和 AI 摘要功能,还有类似 X 的推荐机制。同时,AI 美妆产品一年 ARR 增 14 倍达 5500 万美金。
创新中心 | 2025首届“幻镜”AI视听测评季成果在京发布,探索AI视听领域建立科学测评体系
2025年10月28日,“人工智能赋能精品创作沙龙”暨首届“幻镜”AI视听测评季成果发布会在京举办,活动旨在为AI视听领域建科学测评体系。会上公布测评结果、优秀作品片单,发布研究分析报告。
把任何文档变成Claude的新技能,这个开源工具火了。
Claude新出Skills,类似插件让其有自定义可调用功能。开源工具Skill Seekers能把网站文档转换成可使用技能。介绍了Skills特点及Skill Seekers功能原理、特点等,效率提升显著。
250份文档就能给大模型植入后门:不分参数规模
Claude母公司Anthropic联合英国AISI和图灵研究所研究发现,仅250份恶意文档就能给不同规模大模型植入“后门”漏洞,打破了以往对大模型数据中毒的认知,给厂商提了个醒。
230个大模型在婴幼儿认知题上集体翻车!揭秘多模态大模型的核心知识缺陷
ICML 2025研究揭示多模态大模型在基础认知能力上表现不佳。研究者建测评题库CoreCognition测试230个主流模型,发现其存在核心知识缺陷,扩规模难补短板,还需补齐核心知识。
出自小米的模块化图像编辑改造:让 AI 学会「搭积木」
小米研究团队发布 Lego-Edit 图片编辑框架,将复杂编辑任务拆成工具集和调度系统,工具集模型各司其职,调度系统指挥操作。采用渐进式训练,性能优、扩展性好,体现协同智能优势。
号称视频编辑领域的开源nano banana来了,用文字就能改视频
DecartAI开源Lucy Edit模型,号称视频领域开源Nano Banana,能理解自然语言指令改视频。如输入指令可精准换服装等,渲染快,有身份保持和动态适配亮点,有多个版本,应用场景广。