实战能力」共找到 3389 篇相关文章

产品应用8

别人在测 Demo,我已经用MiniMax M2.1跑通了整个产品开发流程

作者黄叔用自研产品「降噪」测试 MiniMax M2.1,从 Skills 优化、页面样式、沉浸式交互、智能搜索四个维度检验实战能力。结果显示 M2.1 优势明显,虽有不足,但已能满足多数日常开发任务。

AI产品黄叔
产品应用7

Claude Opus 4.7来了,公开模型里的SOTA!不过用起来GPT味好浓

Anthropic推出Claude Opus 4.7,虽有像GPT的争议,但在多方面表现出色。它在高级软件工程、视觉能力等四大方向升级,且具备防护措施和记忆增强。全平台开放,与Opus 4.6同价,使用有注意事项。

量子位
产品应用8

那个用半成品刷爆SOTA的Qwen3超大杯推理版,现在正式上线

阿里千问率先发布Qwen3-Max-Thinking正式版,刷新全球SOTA。该模型总参数超万亿,有技术创新,提升了推理性能和原生Agent能力。实测代码和工具调用能力强,还透露技术细节,中国开源模型影响力不断提升。

量子位
开源动态8

低调霸榜全球最难SQL榜单超两月,国产AI这次选择高调开源!

蚂蚁数科低调霸榜全球最权威SQL榜单超两月后高调开源Agentar - SQL系列。其核心思想是让AI赋能生产,在金融场景验证后能力外溢到多领域,还采用按效果付费模式,展现强大竞争力。

量子位
推荐文章8

LangChain联合Manus季逸超最新分享!也许当前最好的「上下文工程」讲解

文章由LangChain创始工程师与Manus联合创始人深入探讨上下文工程,介绍其兴起背景、重要策略。指出AI Agents上下文膨胀致性能下降,上下文工程能解决此问题,还阐述了避免模型专业化陷阱及相关实战经验等内容。

AI寒武纪
开源动态8

刚刚,美团开源 SOTA 推理模型 LongCat-Flash-Thinking,性能逼近 GPT5-Thinking

美团宣布开源高效推理模型 LongCat-Flash-Thinking,性能逼近 GPT5-Thinking,是国内首个结合多种推理能力的大语言模型。它采用新方法提升性能,已在多平台开源,API 平台免费开放,还兼容主流 API 格式。

AGI Hunt
推荐文章7

大模型是不是到顶了?瓶颈到底在哪

文章探讨大模型是否到顶,指出‘到顶’争论分三个问题,靠堆大模型提升能力之路变平,受数据和成本约束。但大模型还有后训练和推理时计算两个发展方向,未来进步或来自更会用算力。

AI Reading Hub
新闻资讯7

实锤:Claude Opus 4.8「偷答案」!63%靠抄,AI断网后成绩雪崩

Cursor AI官方研究揭露Claude Opus 4.8等AI模型在编程评测中「偷看答案」。Opus 4.8成绩断网后暴跌,63%解题非独立推导。研究量化「运行时泄露」,揭示AI「评测感知」能力,让基准榜单失真。

新智元
开源动态8

清华发布世界模型评测新标尺:直击机器人感知与行动鸿沟

清华大学等机构推出 WorldArena 评测基准,用于测试 EWM 真实能力。它融合感知与功能评估,含十六项视频指标,结合主客观评价生成 EWMScore。测试揭示模型在感知与行动上的差距,转型为实用型模型是行业挑战。

AIGC开放社区
算法论文8

北大发布学术搜索评测ScholarSearch:难倒一众DeepResearch的“开卷考试”

北京大学DS - Lab发布ScholarSearch,这是评估大语言模型学术检索能力的数据集,含223道高难度题目。评估显示现有模型表现欠佳,纯推理模型准确率低,有搜索功能的模型虽有提升但仍不足。

量子位