代码评测」共找到 2212 篇相关文章

算法论文8

让GUI Agent不再「边做边忘」:快手、浙大提出MemGUI-Agent,攻克长程GUI任务

手机GUI Agent在长程任务中易遗忘关键信息,浙江大学APRIL实验室和快手主站技术部提出MemGUI - Agent,核心是ConAct,将上下文管理变为Agent动作,还开源MemGUI - 3K数据集,模型在评测基准取得佳绩。

量子位
新闻资讯7

OpenAI 全面拥抱 Agentic-First,实测有点扎心

OpenAI发布GPT - 5.6系列,Sol定位长周期Agent,训练目标转向Agentic - First。但目前难以用上Sol,且其评测数据因计数规则差异大,还出现变身话痨、少说话和干完活难兼顾的问题。

CourseAI
产品应用7

Claude Opus 4.7 上手实测:花7倍价格买输出,值不值?

作者实测Claude Opus 4.7,其定价约为GPT - 4.5的6 - 7.5倍。它有全新架构、强化Agent能力等升级,在代码生成、推理分析等多场景表现出色,是否值高价取决于使用场景。

小华同学ai
开源动态8

DeepSeek出品,必是精品!DeepSeek-OCR 2发布:让LLM像人一样读懂复杂文档,效果超Gemini 3 Pro

DeepSeek推出DeepSeek-OCR 2,提出“视觉因果流”,以全新视觉编码器赋予模型因果推理能力。它在文档解析基准表现超Gemini 3 Pro,代码和模型权重已开源,为2D推理和原生多模态探索铺路。

AI寒武纪
产品应用7

替代n8n,用TypeScript写工作流

文章指出n8n、Zapier拖放式工作流调试难、自定义受限,介绍Bubble Lab工具,其用TypeScript实现,代码可自由修改,执行信息透明,还支持导入n8n工作流文件再开发,有一定优势。

AI工程化
产品应用8

OpenAI 内部揭秘:我们如何使用 Codex

文章揭秘 OpenAI 内部使用 Codex 的情况,介绍其在理解代码、重构迁移、性能优化等多方面的应用场景,还给出最佳实践,如用‘提问模式’开始、组织好提示等,展现了 Codex 强大的开发辅助能力。

宝玉AI
算法论文8

大模型解数学题是真懂还是 “死记硬背”?|首个反例驱动的数学推理基准揭穿 “刷题式假象”!

随着大语言模型在数学领域应用渐广,其是否真具备数学推理能力成焦点。清华等团队提出反例推理评测基准COUNTERMATH,测试20+主流模型,结果不佳,而小样本微调能显著提升模型能力。

深度学习自然语言处理
推荐文章7

AI 基础知识从 0.6 到 0.7—— 彻底拆解深度神经网络训练的五大核心步骤

文章以 PyTorch 手写数字识别代码为引,深入剖析深度神经网络训练的五大核心步骤,涵盖前向传播、计算损失、反向传播、更新参数和循环训练,还介绍激活函数、Dropout 等概念及正则化、优化器等技术。

阿里云开发者
算法论文8

如何判断AI视频真假?综述动态、可溯源、可解释的检测体系 | ACL26

AI视频生成技术发展快,现有检测方法难满足需求。新综述提出‘事实保真度验证’目标,梳理四层检测框架,涵盖底层线索、时空一致性等,强调多层证据耦合与可解释性,还分析评测指标与数据集。

新智元
开源动态7

DeepSeek悄悄更新:Mega MoE、FP4 Indexer来了

昨天下午,DeepSeek 更新了 DeepGEMM 代码库,带来新东西 Mega MoE。它将 MoE 计算流程整合,让数据通信和计算同时发生,提高 GPU 利用率。还尝试组合精度、搞 FP4 indexer 等,是基础设施层重构尝试。

机器之心