「Paper2Code」共找到 2746 篇相关文章
DeepSeek V3.2爆火,Agentic性能暴涨40%解密
文章解密了DeepSeek V3.2 Agentic性能暴涨40%的原因,即采用交错思维链机制。还对比了其与早期ReAct范式,介绍其效果、原理,以及MiniMax为落地该机制做的工作,最后提到多家模型达成技术共识。
终于有了一个用龙虾而不是 Claude Code 的理由
作者作为有十年多代码经验的人,原本习惯用Claude Code等白盒工具。但在文档处理、多人协作等场景中,飞书OpenClaw优势明显,可一键部署多智能体,与飞书生态打通,还能自动修复异常。
Nanbeige4.2-3B:探索通用Agent小模型
在模型越做越大的当下,推理成本成了影响Agent大规模使用的关键因素。南北阁实验室推出Nanbeige4.2 - 3B,在架构、数据构造和训练pipeline层面做了系统工作,评测表现良好,还探索本地个人助手等应用。
cursor 2.0实测:cursor的摆烂之作
作者实测Cursor 2.0后大失所望。它交互粗糙,多智能体虽有多个回答但选方案操作不明;因Claude涨价推出智能分发和自研Composer,后者除快无优势且需魔法;内置浏览器交互麻烦,窗口管理离谱,语音模式基本不可用。
AMD跑GLM 5.2,成本只要英伟达一半
推理优化公司Wafer公布数据,用AMD的MI355X芯片跑GLM 5.2,单节点吞吐达2626 tok/s,单流吞吐213 tok/s,成本不到英伟达B200的一半。该公司详述部署过程,还提及AMD软件生态的变化及英伟达面临的挑战。
Qwen2.5VL又多一个娱乐场景,看电影讲故事
文章聚焦Qwen2.5VL新娱乐场景“看图讲故事”。介绍视觉叙事目标、挑战,讲述基于StoryReasoning数据集微调Qwen Storyteller模型的解决思路,含核心技术,还给出实战代码及相关链接。
整整21个月,豆包大模型正式进入2.0时代!
时隔21个月,豆包大模型2.0正式推出。它在多模态理解、企业级Agent、推理和代码能力上有提升,在多个基准测评中达业界最优。实测显示其在编程、数学问题处理上性能出色,性价比也具优势。
简单快速的用 Claude Code 帮你创建 PPT 生成 Skills
Claude Code热度高,其Skills可辅助构建简单Agent。作者以创建Nano Banana PPT生成Skills为例,教大家安装、使用及创建Skills,还提及Skills迭代和局限性等内容。
刚刚,Gemini 2.5 Pro升级,成编程模型新王
Google DeepMind发布Gemini 2.5 Pro (I/O edition),编程能力大幅提升,在编程排行榜超Claude 3.7 Sonnet。用户用一个提示词或草图+描述就能构建应用,谷歌大佬站台,网友实测效果佳。
Andrej Karpathy爆料:自己家被Claude Code入侵了
Andrej Karpathy做实验让Claude Code入侵自家Lutron智能家居系统,成功接管全屋设备。此前网友用其控制烤箱等,引发连锁反应。但这也暴露物联网设备安全问题,还带来新威胁。