「代码推理」共找到 3528 篇相关文章
你觉得 Kimi K3 又慢又贵是吧,我来告诉你为什么
作者用 Kimi K3 为墨问的 CatReader 增加发现页,实操中它多数时候快且抗用,不过周五晚变慢,收尾工作交给了 GLM 5.2。对用户觉得 K3 又慢又贵的问题进行分析,还区分了 Kimi App 和 Kimi Code 使用场景。
都在卷「让大模型多循环几遍」,这个7B模型LoopCoder v2说:多循环 1 次就够了
一项新研究表明,7B小模型LoopCoder v2在正常计算外多循环一次,就能在SWE - bench Verified基准上大幅提分。继续增加循环次数,性能反而下降。研究还算了‘收益 - 成本’账,给出选择循环次数的诊断方法。
卡帕西李飞飞辛顿都投了的Transformer专用芯片,签下10亿美元大单
Etched是只做Transformer专用芯片的创业公司,获卡帕西、李飞飞、辛顿投资。它宣布流片成功,筹集8亿美元,获10亿美元客户大单,还推出一整套面向前沿模型推理的集群系统。
Claude有「编制」了!Anthropic发的
6月23日,Anthropic发布Claude Tag,它是常驻Slack频道的AI团队成员,有自己的身份、账号和审计轨迹。其核心是权限架构,采用智能体身份,按用量计费,已对企业版和团队版客户开放beta。
刚刚,OpenClaw和Cursor杀入手机!Agent从此塞进口袋
OpenClaw和Cursor同日发布原生App,OpenClaw上架全血原生App,可无缝交互,解锁设备底层能力;Cursor发布iOS应用公开测试版,可让开发者在手机上指挥代码开发,重塑人类工作方式。
《2026 OpenClaw 类自主智能体发展白皮书》正式发布 | 中科算网算泥社区
5月20日,中科算网算泥社区发布《2026 OpenClaw类自主智能体发展白皮书》,阐述从“对话式AI”到“代理式AI”的转变。介绍OpenClaw类自主智能体定义、技术剖面、关键能力及系统架构,为从业者提供参考。
全网实测Gemini Omni!一句话改视频,草图变大片
谷歌在Google I/O大会推出Gemini Omni,它结合推理与生成能力,在多方面有重大飞跃,能生成逼真视频等。它打破命名体系,训练目标不同,有涌现能力,谷歌还为其设置限制。
Cloudflare 构建了面向 LLM 的高性能基础设施
Cloudflare发布全新基础设施,可在全球边缘网络运行大型AI大语言模型。它将模型输入处理与输出生成拆分,自研Infire推理引擎,还推出Unweight模型压缩系统,分享提示词缓存优化方案。
上海AI Lab新研究:SFT能泛化,只要满足这三个条件
上海人工智能实验室等团队研究指出,“SFT泛化能力差”定论有局限。SFT泛化能力受优化过程、数据质量与结构、模型基础能力共同制约,研究还揭示其训练中的现象及副作用。
DMLR 2026 | RPI Shaowu Pan(潘韶武)团队 Nithin Somasekharan等:CFDLLMBench——首个面向计算流体力学的大语言模型综合基准评测
文章介绍针对CFD领域的综合LLM评测基准CFDLLMBench,构建三层递进挑战体系。实验揭示主流LLM在‘知道’与‘做到’间有差距,多智能体框架可提升成功率,代码与数据集已开源。