Paper2Code」共找到 2744 篇相关文章

产品应用7

出了两道真题考 GLM-5.2,Opus 4.8 和GPT 5.5 陪跑

作者对GLM - 5.2、Opus 4.8和GPT 5.5进行两项测试。一是审计Skill体系,GLM - 5.2覆盖skill数多、找出冲突多,还挖出bug;二是做世界杯夺冠推演器网站,Opus表现出色,GLM - 5.2省token,Codex有巧思但结构有缺陷。

AI产品黄叔
产品应用7

深入体验 A2A SDK:一步步教你构建“服务化”的 Agent 系统

文章基于A2A最新Python - SDK,介绍将LangGraph的Agent通过A2A协议对外暴露并服务的方法,涵盖核心架构、概念、交互流程,以及A2A Server端、Client端实现和测试总结,还提及A2A优势。

AI大模型应用实践
产品应用7

AI Coding 产品的陷阱:有 PMF 但还没有做到 BMPF

AI Coding 产品增长迅速,如 Lovable 预计年底 ARR 达 2.5 亿美金。但也暴露出盈利难题,多数产品利润为负。解决办法要么自建模型,但成本高;要么等大模型成本下降,却不太可行。AI Coding 产品或未实现 BMPF。

投资实习所
开源动态8

500万视频数据集+全新评测框架!北大开源主体一致性视频生成领域新基建OpenS2V-Nexus,生成视频 「像」 又 「自然」

北大团队推出开源套件OpenS2V - Nexus,含全球首个S2V细粒度评测基准OpenS2V - Eval和500万条高质量人物文本视频三元组数据集OpenS2V - 5M,还评测18个S2V模型,揭示主流模型能力差距。

机器之心
产品应用8

Claude Code 推出 /loop 无限循环,一台电脑即可化身无数小龙虾

Claude Code发布v2.1.71,推出`/loop`功能,可让Claude在后台循环执行任务。它能将Claude Code从问答工具变为自主运转的Agent,配合CLAUDE.md和Git hook可构建自主Agent系统,还能同时跑多个实例。

AGI Hunt
新闻资讯7

Anthropic承认了!Claude Code木马门被抓包,明天回滚

Anthropic被曝在Claude Code中暗藏隐形代码,从2.1.91版本起,通过隐写术秘密传输信息。Claude Code负责人称是实验,明天回滚。同时,其下一代模型Fable 5或引入实名验证等机制。

新智元
开源动态8

让模型“看视频写网页”,GPT-5仅得36.35分!上海AI Lab联合发布首个video2code基准

上海人工智能实验室等机构提出IWR - Bench评测基准,从“image - to - code”迈向“video - to - code”,对28个主流模型测试,最佳模型GPT - 5仅36.35分,指出当前模型短板,为研究指明方向。

量子位
开源动态8

OpenClaw 背后核心框架 Pi:好的 Coding Agent 应该让用户来决定需要什么

OpenClaw 背后核心框架 Pi 是极简框架,系统提示词和工具定义不到 1000 tokens。开发者 Mario 认为好的 coding agent 应让用户决定需求。Pi 不支持 MCP 等,在 Terminal Bench 2.0 排名靠前,GitHub 星数超 24000。

Founder Park
产品应用8

谷歌Gemini 2.5全线爆发!勇战「濒死恐慌」,却被丝血宝可梦吓到当场宕机

谷歌旗舰Gemini 2.5全家桶三款模型昨夜上线,包括正式版2.5 Pro、2.5 Flash及预览版2.5 Flash - Lite。技术报告显示其性能提升显著,还在玩宝可梦时惊现类人恐慌,推理性能下降。

新智元
新闻资讯7

知情人士:DeepSeek正在组建Harness团队,对标Claude Code|甲子光年

据知情人士,DeepSeek正组建Harness团队,对标Claude Code,开放产品经理和研发工程师岗位。其强调Harness,是要让产品成模型进化一部分;补Code Harness,是因竞争转向工作流入口。

甲子光年