大模型测试」共找到 9728 篇相关文章

产品应用8

LLM 技术在有道词典笔上的应用实践

本文围绕LLM技术在有道词典笔的应用展开。先分析端侧模型落地挑战,如算力、功耗等。介绍有道词典笔等硬件及应用,对比端侧与云侧AI优劣。还阐述模型落地模式、算法优化及“子曰3数学模型”开源情况。

InfoQ
8

AI首胜人类博士,顶会论文秒变代码!港90后开源刷爆8k星

香港学黄超团队开源的DeepCode,能分析论文、生成可运行代码。在四基准测试中全面领先,首超人类专家,还优于现有AI Coding。它有三核心能力,采用三阶段框架实现代码自动转换。

新智元
推荐文章8

在WAIC耳朵听出茧子的「智能体」,是时候系统学一下了

今年世界人工智能会上,智能体成主角,AI厂商纷纷布局。文章指出人们对AI模型期望转变,介绍智能体底层逻辑,涵盖工具使用、推理模型、ReAct框架等,还对比先前尝试,探讨智能体能力层次与未来发展。

机器之心
算法论文8

告别微调!斯坦福提出Agentic上下文工程

当前微调语言模型成本高、不灵活,‘上下文适应’方法有短板。斯坦福学等提出ACE框架,将上下文变为动态‘战术手册’,解决现有问题。论文通过实验验证其在性能、成本和效率上优势,为模型发展指明新方向。

深度学习自然语言处理
产品应用7

不吹不黑,GPT-5代码能力究竟怎么样?跟 Gemini 和 Claude 的对比测试给你答案

作者测试了 GPT-5 的代码能力,并与 Gemini 和 Claude 对比。在不同代码任务中,各模型表现不同。如在生成网页任务里,GPT-5 部分结果不错,但受 32K 上下文限制,长文本处理不如 Gemini,硬实力也不如 Claude。

歸藏的AI工具箱
算法论文8

首创像素空间推理,7B模型领先GPT-4o,让VLM能像人类一样「眼脑并用」

当前主流视觉语言模型(VLM)依赖文本token间接翻译视觉信息,缺乏直接视觉操作能力。滑铁卢学等团队提出「像素空间推理」范式,让VLM能像人类一样「眼脑并用」,在四视觉推理基准测试中,7B的Pixel - Reasoner表现碾压GPT - 4o等。

量子位
算法论文8

EMNLP 2025 | T2R-bench: 业内「首个」工业级表格生成报告评测基准

中国电信人工智能研究院推出业内首个面向真实工业场景的“表格到报告”基准T2R-bench,涵盖多领域真实表格、问题与人工标注关键点,配套创新性三维度评测体系。实验显示主流模型在该任务上表现欠佳,提升空间

AINLPer
开源动态8

视频理解新标杆,快手多模态推理模型开源:128k上下文+0.1秒级视频定位+跨模态推理

快手开源能看懂视频并跨模态推理的模型Keye-VL 1.5,其有时序定位、描述和推理能力,跑分领先。采用三段式架构和Slow-Fast编码策略,经四阶段预训练和多阶段后处理,团队成果多,推动多模态技术落地。

量子位
开源动态8

卡帕西630行代码炸出81个智能体,4天协作跑2333次实验,公布预训练十发现

Karpathy的Autoresearch项目630行代码让AI自主实验,提升语言模型训练效率。全球开发者让多智能体协作,智能体自发形成同行评审制度。项目发起者公布十发现,还衍生出表现出色的auto - discovery项目。

量子位
新闻资讯8

被员工怒怼“磕了”,追觅CEO:我有肚量;AI恋人陪聊涉黄被判刑,2.4万人付费;马斯克、奥特曼又开撕|AI周报

本周AI热点众多,有AI恋人陪聊涉黄案二审,追觅CEO回应员工怒怼,携程涉垄断被查等行业事件;还有文心模型5.0登顶国内文本榜、字节跳动发布SeedFold等模型进展;以及苹果、谷歌等企业的应用合作动态。

AI前线