开源动态7
小红书发布评测:AI Agent 移动端开发能力低
InfoQ
AI 摘要
小红书等发布 SWE-Bench Mobile 评测 AI Agent。结果显示,其移动端开发能力上限低,架构设计比模型重要,简单提示策略佳,目前只能作‘copilots’,需人工监督。
阅读原文 · InfoQ
小红书发布 SWE-Bench Mobile:当 AI Agent 面对亿级用户 App 代码库,最高通过率仅12%?
小红书联合多科研机构发布 SWE-Bench Mobile,它是首个还原‘端到端’开发流程的基准,以小红书 App 实际任务为核心。评测显示,AI Agent 在移动端开发能力上限低,架构设计比模型本身重要,简单提示策略效果更好。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
产品应用7
Anthropic发布Claude 5.1,最强能力限少数机构用
9月1日,Anthropic发布Claude Fable 5.1和Claude Mythos 5.1,二者用相同底层模型,区别在安全限制和开放范围。Fable面向订阅用户和企业,Mythos仅向少数审核机构开放,此次还尝试新的开放方式。
AIGC开放社区
新闻资讯8
DeepSeek高毛利,冲刺5000亿估值A股上市
据外媒报道,DeepSeek今年前七个月营收约4.75亿,较2025年全年增长近10倍,净亏损收窄,综合毛利率44.6%,API业务毛利率达82.9%。它正磋商500亿二轮融资,筹备明年沪上市,靠优化基建降本,低价策略吸客。
AI前线
产品应用7
Google发布“法律版Gemini”进军法律界
8月25日,Google Cloud发布Gemini Enterprise for Legal面向律所和企业法务团队开放预览。它想解决让模型进入律所现有工作系统,不打乱权限等规则的问题,通过MCP连接系统并继承权限,还组织各方合作。
AIGC开放社区
产品应用8
SemaPLC:让AI编程在PLC开发可交付
上海交通大学联合Sema研究团队推出SemaPLC,将AI Agent与PLC工程工具链连接,让自然语言需求转化为可编译、验证、仿真的控制程序。它是面向全流程的智能工作台,实验效果优于业界方案。
量子位