代码框架」共找到 3102 篇相关文章

开源动态8

GLM-5真够顶的:超24小时自己跑代码,700次工具调用、800次切上下文!

GLM - 5正式发布,把开源AI带入长任务时代。它超24小时自己跑代码,完成GBA模拟器,能力稳定。评测结果佳,在主流测试中编程能力与Claude Opus 4.5对齐,引发网友欢呼。实测还展现多种应用能力。

量子位
新闻资讯7

AI 写代码太快,人类测试跟不上了,Meta 用新方法把 bug 检出率提升 4 倍

Meta 用即时(JiT)测试方法提升软件质量,该方法在代码评审期间动态生成测试,在 AI 辅助开发环境中将缺陷检测能力提升约 4 倍,源于代理式工作流兴起及传统测试套件的局限。

AI前线
新闻资讯7

一个Bug改通宵!用AI写超50%代码,只有32%资深开发者敢这么干

Fastly对美国开发者做AI生产力调研,发现高级开发者用AI交付代码量是初学者2.5倍,也揭示AI编码隐形成本。高级开发者更信任AI,而初级开发者因经验不足更谨慎,同时调研还涉及绿色编码认知。

新智元
算法论文8

在AI社会抓「内鬼」?上海AI Lab推出首个多智能体极端事件解释框架

2023年起多智能体系统成人类社会数字镜像,但复杂系统会自发涌现极端事件。上海AI Lab等团队推出解释框架,用沙普利值拆解风险,发现极端事件五大演化规律,还能提前防控风险。

机器之心
开源动态7

如何“驯服”你的Agent?这可能是你见过最优雅与可控的Agent框架 | 深度体验

文章聚焦对话式Agent,指出LLM不确定性是企业应用Agent的障碍。介绍Parlant框架,它用ABM方法控制交互,能降低LLM负担、处理边缘场景。还通过构建10086客服助手展示其使用,最后与LangGraph对比。

AI大模型应用实践
开源动态8

首个故事可视化综合评估框架来了!80个故事单元53种类别,20种技术方案全面对比

随着AIGC技术进步,故事可视化引发关注。阶跃星辰携手上科大、西湖大学提出ViStoryBench可视化评估框架,通过构建多元化数据集、建立多维度评估指标,对超20种技术方案评测,为行业发展提供评估工具。

量子位
新闻资讯7

Anthropic宣布练出神话级模型:Claude Mythos,代码和黑客能力吊打opus4.6,不向公众开放!

Anthropic宣布Project Glasswing计划,因训练出超强模型Claude Mythos Preview。该模型代码和推理能力超opus 4.6,扫描主流软件发现数千零日漏洞。此模型不向公众开放,计划先在Claude Opus验证安全机制。

AI寒武纪
产品应用8

扔掉人工公式:快手EMER框架,用“会比较、自进化”的模型重构短视频推荐排序

过去十年,推荐排序多依赖人工设计公式,但此模式遇瓶颈。快手策略算法团队提出 EMER 框架,用“会比较、能进化的 AI 模型”重构短视频推荐排序,在快手主 App 和极速版效果显著,还为行业提供解决方案。

机器之心
产品应用8

仅需一行代码AI智商飙升成本反降!Claude推出军师模式:最强模型opus只做幕后大脑

Anthropic在Claude平台实装军师策略,让Opus模型后台当军师,轻量级模型当执行者。仅改一行代码就能实现,成本低且能提升智商,已开启Beta测试,还给出使用步骤。

AI寒武纪
新闻资讯7

Moltbook“造假”刷屏,Clawdbot创始人犀利批判Agent:缺了人纯烧token、只出烂代码,没“审美”

Moltbook 爆火后被指造假,其源于 Agent 开源项目 Clawdbot。OpenClaw 创始人 Peter Steinberger 认可该网站,还分享使用经验,批判“Agent 陷阱”,认为缺人参与纯烧 token、出烂代码,强调人引导 AI 开发的重要性。

AI前线