「训练评估体系」共找到 3202 篇相关文章
OpenAI公告正经解释:为什么GPT-5.5爱说“哥布林”
OpenAI官网发公告回应GPT-5.5爱说“哥布林”问题。原来是对“书呆子”人格训练时,无意中对使用生物比喻的模型给予高奖励,导致“哥布林”表述扩散。之后移除相关奖励和过滤数据来解决。
视频生成1.3B碾压14B、图像生成直逼GPT-4o!港科&快手开源测试时扩展新范式
香港科技大学联合快手可灵团队推出 EvoSearch 方法,支持图像和视频生成。该方法无需训练和梯度更新,能提升模型生成质量,展现了 test - time scaling 补充 training - time scaling 的潜力,目前论文和代码已开源。
RPA要没了
Codex更新Record & Replay功能,虽与RPA表面都是录制操作、重复执行,但底层逻辑不同。RPA是指令式,有诸多缺陷;Codex是目标式,是RPA替代品,还构建了企业自动化体系。
给 AI 建「流水线」,九章云极看清了什么?
AI产业竞争重心转变,当前缺智能生产度量基础设施。九章云极6月17日发布“AI工厂”战略及智算云3.0,构建从算力到智能的工程体系,试图填补空白,让智能生产可计量。
Karpathy Vibe Coding整新活:Agent版「GitHub」问世
最近,Karpathy 玩 Vibe Coding 上瘾,上周末开源项目让 AI Agent 自主实验,10 多小时前又开源「agenthub」,这是 Agent - first 协作平台,可理解为极简版 GitHub,还能用于构建自治学术体系。
Code Review 将死于 2026 年
Latent Space 客座文章称人类写代码死于 2025 年,Code Review 将死于 2026 年。高 AI 采用率团队产出暴涨但审查拖后腿,AI 审代码也不可靠。作者提出范式转变及五层信任体系。
AI精准编辑门槛大降:开源框架提升编辑一致性,即插即用
近日,中山大学、香港中文大学等团队发布研究成果ProEdit。它通过对注意力机制和初始噪声潜在分布处理,实现高精度图像与视频编辑,无需训练、即插即用,解决编辑效果与一致性平衡难题。
彻底改写Transformer!「能量驱动架构」横空出世,通用推理时代要来了?
UIUC、斯坦福与哈佛联合提出全新「能量驱动Transformer(EBT)」架构,打破「前馈即推理」旧范式,以能量最小化模拟人类思维,训练更高效、推理更精准,在多方面超越传统Transformer。
UofT、UBC、MIT和复旦等联合发布:扩散模型驱动的异常检测与生成全面综述
多伦多大学、麻省理工学院等高校研究者合作完成长文综述,聚焦扩散模型在异常检测与生成领域的应用,梳理图像、视频等异常检测任务进展,提供分类体系,展望未来趋势。
RAG创新了,MCompassRAG装上了语义指南针
RAG系统存在chunk切分难题,现有方案有额外成本。MCompassRAG不切细、不rerank,给粗chunk加主题元数据当指南针,训练推理分离,实验显示信息效率提升、延迟降低。