「过程评估」共找到 1016 篇相关文章
开源DeepSeek R1增强版:推理效率快200%,创新AoE架构
德国TNG公司开源DeepSeek R1增强版DeepSeek - TNG - R1T2 - Chimera,基于三大模型混合开发,采用创新AoE架构,推理效率比R1 - 0528快200%,成本大减,在主流测试中性能更好。还介绍了AoE架构构建子模型方法。
AI自我训练?OpenAI研究员Jason Wei泼冷水:它的三大瓶颈你根本想不到
OpenAI研究员Jason Wei认为AI自我完善是未来趋势,但不会‘瞬间爆发’,而是漫长过程。他从三方面阐述,包括自我完善非一蹴而就、不同领域完善难度有差异、科学进步受真实世界实验限制。
Nature报道:谷歌新模型1秒读懂DNA变异!首次统一基因组全任务,性能碾压现有模型
谷歌DeepMind团队推出生物模型AlphaGenome,能从1兆碱基DNA序列中预测数千种功能基因组特征,评估变异效应。它统一多任务,性能超现有模型,是生物领域里程碑,将助力理解疾病。
万字长文!大模型(LLM)推理优化技术总结(非常详细)
文章聚焦大模型推理优化技术,介绍推理过程分预填充与解码阶段,还阐述模型并行、注意力机制优化、模型优化及服务技术等,如多查询注意力减少内存,FlashAttention 优化计算顺序。
Agent全自动搭建代码运行环境,实时更新解决评测过拟合/数据污染问题|微软
长期以来主流代码修复评测基准SWE - bench问题多,制约AI模型能力展现。微软发布SWE - bench - Live,引入新Issue,实现环境自动化构建与更新,打破传统局限,还揭示传统基准过拟合问题。
“多模态方法无法实现AGI”
文章指出一些人认为多模态方法能实现AGI,但作者觉得此策略会失败。真正的AGI要理解物理世界,而LLMs只是记忆规则。此外,规模最大化方法用于AGI有数据稀缺问题,多模态建模也存在诸多问题。
蚂蚁武威:下一代「推理」模型范式大猜想
文章围绕下一代「推理」模型范式展开,蚂蚁技术研究院武威提出不同观点,认为长思维链推理未必最优,未来推理模型或更低维稳定,还探讨推理定义、重要性及解法猜想,如结合快慢思考等。
深入原子世界,他在寻找材料失效的原因
文章介绍了美国宾夕法尼亚州立大学副教授杨洋的材料研究。他利用先进电子显微技术,研究材料在极端环境下微观过程,如空位、虫洞腐蚀和短程有序,旨在理解材料失效机制,推动材料设计优化。
能让DeepSeek自进化的Harness!LlamaFactory作者开源新工具:0.2元自动造Agent
LlamaFactory作者郑耀威团队开源的PenguinHarness,是全球首个支持多Agent自进化的Harness,能自动构建、评测和改进Agent。它成本低、速度快,适配众多模型,还有严格契约保障安全。已在生产场景应用,效果显著。
Claude设计师被工程师卷到掉队,反手造出百万用户工具
Anthropic产品设计师Nate Parrott复盘Claude Design诞生过程。起初他在工作中被工程师拉开差距,利用业余时间捣鼓出这一工具。它以HTML为突破口,融入品牌系统,从副项目转正,定位前期视觉沟通。