饿了么」共找到 5731 篇相关文章

开源动态7

用于评估AI Web渗透测试能力的工具:XBow Bechmark,比靶机更好

文章介绍用于评估AI Web渗透测试能力的XBow Benchmark,它已在github开源。该基准含104个Web安全挑战,涵盖多种漏洞,设计确保可重复性和状态持久性,其评估能力获广泛认可,还介绍开源内容等。

AI与安全
新闻资讯7

Cursor只排第6!136国用户实测25款AI编码工具,第一名73%胜率,还是个新面孔

Design Arena评测平台用对抗式评测方法,让用户对AI模型生成的设计作品投票,评估其设计美学表现。文章总结上榜的编码工具,如new.website胜率约73%排第一,还对比不同类型模型的排名情况。

AI进修生
算法论文8

1.5B推理模型新SOTA,RL训练新解法打破「简单题过拟合、难题学不动」的魔咒

QuestA通过在训练中注入解题提示,实现两项成果:在1.5B模型上实现Pass@1的SOTA性能,还提升Pass@k性能。它解决RL训练中简单与困难任务的权衡问题,为开发强推理模型打开大门。

机器之心
开源动态8

智谱终于发布GLM-4.5技术报告,从预训练到后训练,细节大公开

上个月底智谱开源 GLM-4.5 及轻量版,成绩亮眼引热议。现其技术报告发布,详述预训练到后训练细节,还介绍开源 RL 框架 slime,展示模型架构、训练阶段等,评估在多任务上的表现。

机器之心
7

别让故障复盘流于形式:用AI挖掘每一次“跌倒”的价值

文章指出传统故障复盘存在诸多问题,借助AI能力可解决专业性和深度问题。介绍智能复盘Agent,包括其核心使命、目标用户、核心价值和解决方案,还阐述核心技术架构、实现方式及评测机制等,最后给出实战案例。

阿里云开发者
推荐文章7

618想换电脑跑AI?先听我一句劝。

文章围绕618换电脑跑AI展开,分析本地跑AI的情况,包括不同模型对算力和显存的要求,指出本地跑的好处是隐私安全、无限免费,还推荐不同预算的笔记本,为想换电脑学AI的人提供参考。

数字生命卡兹克
算法论文8

PPO-Clip的「盲点」被补齐?快手提出熵比裁剪方法,从局部约束到全局稳定的关键一跃

快手科技语言大模型团队提出熵比裁剪(ERC)方法,应对强化学习中信任域偏离问题。该方法从全局视角稳定策略分布,在多个数学推理基准实验中提升模型性能,还与多种方法对比验证泛化能力。

机器之心
产品应用8

新模型亦是新 Agent,Kimi-Researcher 超大量一手实测!

2025 年被称为“Agent 元年”,月之暗面发布端到端强化学习训练的新一代 Agent 模型 Kimi - Researcher,其基座是自研新模型。文章对其进行大量实测,与 OpenAI 等对比,并探讨 Deep Research 的重要性及 Kimi 的不足。

特工宇宙
推荐文章7

从 Langchain 到 Spring AI,我们究竟需要怎样一个企业级 AI 开发基础设施?

文章指出AI Agent应用开发方式演变快,企业构建AI Agent体系面临挑战。介绍AI Agent应用架构变化及趋势,如AI应用平台低代码效应、框架与平台双轨并行等,还总结四类AI Agent框架及企业级框架平台核心考量。

phodal
新闻资讯7

Kotoko AI 乔海鑫:C.Al 的故事已经结束,我们用 OC 链接 05后

本文是对Kotoko AI创始人乔海鑫的访谈。他认为OC市场潜力大,Gacha Life验证其市场需求。Bside是融合UGC与游戏化玩法的OC社交互动平台,6月将在Steam新品节上线Demo,7月开启Early Access。乔海鑫还探讨OC商业化、AI应用等问题。

Founder Park