「过程评估」共找到 1016 篇相关文章
所有大模型,都学物理学:北大物理系一篇研究,震撼了AI圈
北大等机构团队跨界用物理学最小作用量原理,提出新颖方法估计 LLM 生成方向性,揭示其背后‘物理定律’。发现 LLM 生成有细致平衡现象,还能用物理指标给大模型画像,让 AI 研究提升到‘物理科学’高度。
AI研发新范式:基于技术方案全链路生成代码
文章指出过往代码补全方式存在局限,腾讯广告审核团队探索新AI开发范式。介绍业界AWS、Lovable范式,阐述审核团队实践范式,含定义、技术选型、过程标准化等,还提及进展、困难与未来展望。
在 Cache-DiT 框架下实现原生 Serving功能
Cache-DiT 是唯品会开源的 PyTorch 原生 DiT 推理加速引擎,此前聚焦离线推理。现实现完整 Serving 功能,支持单卡与分布式推理模式。文章介绍其实现过程、借鉴 SGLang 的设计,还总结踩坑及使用方法。
代码采纳率如何提升至50%?AI 自动编写单元测试实践总结
文章围绕借助Aone Copilot Agent提升AI代码采纳率至50%展开,介绍项目背景、实践方案、执行过程等,阐述Prompt规则生成方法,分析核心价值与效果,总结经验教训,展望未来技术演进和团队能力建设方向。
「世界理解」维度看AI视频生成:Veo3和Sora2水平如何?新基准来了
近年来,T2V模型进展显著,Sora2爆火引发对其是否为‘世界模型’的探讨。传统基准无法系统衡量模型对事件因果等的理解,中山大学等团队提出新评测框架VideoVerse,评测主流模型并发现开源与闭源模型差距及各模型缺陷。
Karpathy盛赞DeepSeek-OCR“淘汰”tokenizer!实测如何用Claude Code 让新模型跑在N卡上
DeepSeek发布新模型DeepSeek - OCR,有诸多技术贡献,获Karpathy等盛赞。它或让文本token输入方式被淘汰。开发者Simon用Claude Code让其在N卡上运行成功,分享了详细过程与经验。
协同加速,多机器人协作不再「慢半拍」!软硬一体化框架ReCA破解具身智能落地效率瓶颈
佐治亚理工学院等团队推出集成加速框架 ReCA,针对多机协作具身系统,从算法、系统、硬件跨层协同优化,经评估,实现 5 - 10 倍速度提升且成功率升 4.3%,为具身智能落地奠基。
GPT正面对决Claude!OpenAI竟没全赢,AI安全「极限大测」真相曝光
OpenAI和Anthropic罕见合作,测试双方模型在幻觉等四大安全方面的表现。这场合作是AI安全的里程碑,百万用户每天的互动推动安全边界扩展。文中详细对比了GPT和Claude模型在各安全测试中的表现。
狂肝一周,测评十余款 PPT AI 生成产品的真实反馈
评估 Agent 产品能力复杂,以 PPT 生成为例,有 Agent 和模板化两种流派。作者选前者投票测评、后者全方位测试。给出方案,还推荐不同需求适用产品,附总榜单和细致体验描述。
一年成爆款,狂斩 49.1k Star、200 万下载:Cline 不是开源 Cursor,却更胜一筹?!
AI编程助手看似热门,实则多数亏本运营。Cline选择开源,允许用户自由组合LLM编程,个人免费,企业服务收费。它一年成明星产品,获49.1k Star、近200万下载,其创始人分享了产品理念、发展等多方面思考。