「推理质量评估」共找到 3126 篇相关文章
深夜炸场!Claude Sonnet 4.5上线,自主编程30小时,网友实测:一次调用重构代码库,新增3000行代码却运行失败
Anthropic推出Claude Sonnet 4.5,号称‘世界上最好的编码模型’,持续运行时长、推理等能力提升,‘幻觉’等问题改进,Claude Code也有更新,开发者实测有惊喜也有问题,新一轮AI‘内卷’开启。
天下武功,唯快不破:LLM高效架构最新最全面综述
大型语言模型虽成就辉煌,但训练成本高、推理延迟大,核心问题源于Transformer架构。这篇综述论文首次系统性梳理高效LLM架构创新方案,分类七大类方法,延伸至跨模态应用,为研究者提供‘效率蓝图’。
AI搜索引擎领域大哥Perplexity AI 三层重排序系统与核心排名因素揭秘,必看!
国外研究人员分析揭示Perplexity AI部分排名规则和因素。其有三层重排序系统,人工配置权威域名,热门话题与YouTube相关。还总结8个核心排名因素,并给出SEO优化策略,体现搜索重质量趋势。
Jina 第4版:多模态向量检索,统一适配,挑战3大任务
Jina第4版基于Qwen2.5 - VL模型扩展,支持单向量和多向量输出。它经对比学习和任务特化训练,推理时可按需选LoRA适配器,能利用多模态处理能力优化不同任务性能。
开源版Suno来了:本地跑AI音乐生成,免费、无限、完全属于你
ACE - Step UI开源项目改变AI音乐生成现状,提供本地方案。它是完整音乐工作站,虽生成质量与Suno有差距,但在费用、隐私等方面优势明显,预示AI音乐生成开源生态崛起。
Google这个1.5w star 项目牛皮,99%准确率!
Google安全团队开源AI文件类型检测工具Magika,抛弃固定规则匹配,用深度学习精准识别文件真实类型。它内置轻量模型,单CPU毫秒级推理,支持200+格式,准确率约99%,已大规模落地。
Rust版本的DeepSeek-OCR来了,告别python原版的繁琐配置
网友用Rust重写DeepSeek - OCR推理栈,解决原版Python依赖复杂问题。此版本无Python依赖,可离线运行,兼容OpenAI API,还支持苹果芯片Metal加速,介绍了技术实现、使用方法和场景。
腾讯混元开源AI绘画新框架:24维度对齐人类意图,让AI读懂复杂指令
腾讯混元团队开源PromptEnhancer框架,通过“思维链提示重写”提升AI绘画文本 - 图像对齐精度,复杂场景准确率提升17%以上。还开源高质量基准测试数据集,为研究提供支撑。
Vibe Coding两年盘点:Windsurf已死、Cursor估值百亿,AI Coding的下一步怎么走?
文章回顾2023年初到2025年中AI Coding发展,涉及Cursor、Codeium等产品轨迹。指出极端‘坏用户’使商业模式崩塌,需平衡‘交付质量’与‘token成本’,还提及‘Knowledge Suggestion’功能及目标用户选择。
人类选手苦战10小时获得世界编程冠军,OpenAI获得亚军,但这可能是最后一次了
在AtCoder启发式编程世界杯总决赛,人类选手Psyho苦战10小时击败OpenAI的AHC模型夺冠。赛事专注优化问题,比赛过程跌宕起伏,也证明了AHC具备持续性推理等关键能力。