子任务级可验证性」共找到 2792 篇相关文章

产品应用8

把 MiniMax M2.7 扔进真实业务里:它替我省了 BI 和程序员的钱

作者测试 MiniMax M2.7,用含复杂数据的 Excel 测试其办公能力,让其开发管理系统验证工程能力,还测试 MaxClaw 多步骤 Agent。结果显示它表现出色,但处理复杂事件仍待优化。

InfoQ
算法论文7

做RAG这一年,最后悔的就是上知识图谱

基于知识图谱的检索增强生成在问答任务中存在三元组索引丢失上下文语义问题,作者提出MDER - DR双阶段框架,在标准测试和特定数据集上性能提升最高66%,还具备多方面优势。

PaperAgent
新闻资讯7

OpenAI新模型Day0就被嫌弃!排名拉垮,不如一月底发布的国产模型

OpenAI推出GPT - 5.4 mini和nano模型,主打快速经济,针对编程等优化。但评测中GPT - 5.4 mini排名不佳,不如国产Kimi 2.5,且价格对比有争议。不过与自家旧版比有提升,网友测试有亮点。

量子位
产品应用7

The Batch:924|GPT-5.4:性能更高,价格也更高

OpenAI更新旗舰模型GPT-5.4,有Thinking和Pro两个版本,扩展工具使用能力,多基准测试达当前先进水平,但定价高。虽在部分任务表现超Claude,挑战Gemini地位,不过成本也更高。

DeeplearningAI
开源动态8

UniPat AI开源SWE-Vision:五百行代码打造SOTA视觉智能体!

多模态大模型代码能力进步大,但基础视觉任务常失误。UniPat AI开源SWE-Vision框架,让模型用Python代码处理视觉判断。它极简设计,在五个视觉基准测试达最优,提升前沿模型视觉表现。

机器之心
推荐文章8

拒绝Vibe Coding!大神揭秘8套AI编程模式

Datasette创始人Simon Willison公开指南,教专业开发者用Claude Code等AI编程工具提效,总结8大实战模式重构程序员工作方式。还提出认知债务概念,Hacker News对此有不同观点。

新智元
新闻资讯7

突然爆火!近千人大排长龙安装!有人宣称短短数日已赚26万元!昆明市场有人报价300元;官方发声:警惕安全风险

OpenClaw是一款开源AI智能体,能接管电脑完成多种任务,但安装复杂。这催生“代装AI”生意,有人数日赚26万,腾讯免费安装引千人排队。不过,其部分实例存安全风险,官方提醒防范。

昆明走进自然户外
推荐文章7

GAN之父Ian Goodfellow病后归来,剑指高效世界模型

GAN之父Ian Goodfellow等提出,利用符号化表示和游戏虚拟世界数据,或为构建动作条件多模态世界模型最佳路径,该模型可支持长时序任务预测与规划,还探讨构建原因、数据来源等。

机器之心
算法论文8

清华刘洋团队论文:揭示为何 70B 的医疗模型,反而不如 8B 会问诊丨ILCR 2026

在医疗AI领域,模型静态评测与临床问诊能力存在断层。清华刘洋团队提出DOCTOR - R1,将临床问诊建模为POMDP,用强化学习训练。实验验证了其有效性,对医疗AI发展有深远启示。

AI科技评论
开源动态8

开源模型终于有了自己的 Opus 时刻

智谱深夜发布的新一代旗舰模型 GLM - 5,此前以匿名模型 Pony Alpha 被开发者热测。2026 年编程大模型风向转变,GLM - 5 参数提升,测试成绩优异,实测能完成复杂工程任务,适配国产算力平台。

AGI Hunt