SWE-Bench Mobile」共找到 177 篇相关文章

开源动态7

LangChain 推出开源异步编码智能体 Open SWE

LangChain发布开源异步编码智能体Open SWE,可在云端处理复杂开发任务,能集成到开发者工作流。它连接GitHub仓库,在沙箱运行,强调人在回路控制,多智能体架构保障代码质量,早期反应褒贬不一。

InfoQ
新闻资讯8

比肩OpenAI Simple Codex,中国团队闯入Terminal-Bench全球第二!

Anthropic和OpenAI推出新模型后,基础大模型较量进入实战比拼。中国团队Feeling AI的CodeBrain - 1在Terminal - Bench 2.0榜单排全球第二,它聚焦代码编写运行,还能动态调整计划策略,展现出高含金量。

机器之心
算法论文8

73%人类认同率!Video-Bench实现视频质量精准打分

上海交大等团队提出视频评估框架Video - Bench,让多模态大模型‘像人一样评判视频’。它构建双维度评估框架,引入链式查询和少样本评分技术,与人类判断73%高相关,为视频生成模型优化提供标尺。

深度学习自然语言处理
开源动态8

大模型开网店,谁是经营高手?E-Commerce Bench开源揭秘

为评估模型长程经营能力,联合淘天集团发布E-Commerce Bench,以10万本金、365天经营网店来评测。从多维度评估18个模型,结果差异大,还发现单一指标会掩盖模型表现,评估基准潜力大。

千问大模型
开源动态8

大模型首次直接理解代码图:不用Agent自动修bug,登顶SWE-Bench开源模型榜单

蚂蚁开源新模型CGM,首创将仓库代码图模态融入大模型,不依赖闭源模型和复杂Agent,仅需4步就能快速定位、生成补丁。它在多个测试基准中领先,技术论文等均已开源。

量子位
开源动态8

UniPat AI开源SWE-Vision:五百行代码打造SOTA视觉智能体!

多模态大模型代码能力进步大,但基础视觉任务常失误。UniPat AI开源SWE-Vision框架,让模型用Python代码处理视觉判断。它极简设计,在五个视觉基准测试达最优,提升前沿模型视觉表现。

机器之心
开源动态7

AutoDev 架构升级:多端编程 Agent(CLI/Desktop/Mobile),欢迎一起参与演进

作者介绍 AutoDev 架构升级情况,新架构基于 KMP + Compose 重构,构建多端编程 Agent,含 CLI、Desktop、Mobile 等版本。还引入 CodeGraph 节省成本,用 Compose 重塑界面,欢迎各方参与演进。

phodal
开源动态8

12小时登顶OpenAI MLE-bench!上海AI Lab开源算法进化框架MLEvolve

上海AI实验室开源算法进化框架MLEvolve,12小时登顶OpenAI MLE - bench榜单第一。它是自进化机器学习系统,在75道Kaggle竞赛题上奖牌率达61.33%,为AI自主算法设计提供新方案。

量子位
算法论文8

美团LongCat扎扎实实做了件难事:LLM数学新天花板AMO-Bench

美团LongCat团队联合高校推出AMO - Bench,用50道原创奥赛级难题评估LLM数学能力。它解决现有基准测试痛点,经四重把关构建,测试显示顶级模型表现不佳,也揭示模型提升空间大。

PaperAgent
算法论文7

姚顺雨入职腾讯50天后,发布了首篇署名论文:CL-Bench

2月3日姚顺雨加入腾讯50天后发布首篇署名论文《CL-bench: A Benchmark for Context Learning》。该论文做了新的benchmark,测试显示前沿模型平均分仅17.2%,指出模型在上下文学习尤其是归纳能力上的短板。

花叔