测试用例生成」共找到 3716 篇相关文章

算法论文8

Scaling Law再现Agent领域!阿里提出训练新范式:在预训练和后训练之间还需一个Agentic CPT

近年来,大型语言模型向智能体系统进化。但当前主流方法构建智能体不佳,阿里通义实验室团队论文提出智能体持续预训练(Agentic CPT)新范式,开发AgentFounder模型,在多基准测试表现卓越。

深度学习自然语言处理
算法论文8

大模型幻觉检测新方法:实时高亮不确定内容

来自苏黎世联邦理工学院等机构团队,开发流式幻觉检测器,能在生成过程中即时标记幻觉实体。核心是识别具体“实体”是否虚构,实验表现出色,团队已将数据集和代码开源,有局限但应用前景好。

AI工程化
推荐文章7

从 Langchain 到 Spring AI,我们究竟需要怎么样一个企业级 AI 开发基础设施?

文章指出AI Agent应用开发方式演变快,企业构建AI Agent体系面临挑战。介绍了AI Agent应用架构变化及趋势,如AI应用平台低代码效应、框架与平台双轨并行等,还总结了四类AI Agent框架及企业级框架平台核心考量。

phodal
算法论文8

扎克伯格的豪赌初见成效?Meta新方法让LLM长上下文处理提速30倍

Meta Superintelligence Labs提出REFRAG高效解码框架,解决LLM长上下文输入效率瓶颈。它通过四步流程优化解码,让首个token生成时间加速达30.8倍,扩展上下文,且精度不降反升,不过价值待实际检验。

机器之心
新闻资讯7

GPT-5:前端开发者的“选择自己的冒险路线”

OpenAI 称 GPT - 5 在前端编码出色,内部测试 70% 时间胜 OpenAI o3,获 Vercel 支持。但部分开发者看法不一,有人体验变差,也有人认为它表现一般,还探讨了其让开发者绕开 React 的可能。

AI前线
开源动态8

“边说边思考”,Mini-Omni-Reasoner 开创实时语音推理新范式

Mini - Omni - Reasoner将推理能力引入大型语音模型,开创“边说边思考”范式,实现实时语音推理与交互。推出Spoken - Math - Problems - 3M数据集,经四阶段生成流程构建。训练采用分阶段策略,性能超基础模型。

GitHubStore
新闻资讯8

谷歌Nature震撼发文,Gemini教练暴打专家!医学双料冠军,秒出睡眠报告

谷歌DeepMind把Gemini版大模型PH - LLM调教成「AI健康私教」,将可穿戴设备数据转化为睡眠健身建议,准确率超人类医生。它经两阶段训练,在多项测试中表现优异,或开启预防医学未来。

新智元
产品应用7

打破幻觉!Qwen最新OCR让印章、表格、公式识别准确率飙升45%

基于推理增强框架的视觉语言模型处理OCR任务有成果,但存在生成幻觉问题,特定领域不如专家模型。DianJin - OCR - R1通过推理与工具交互,按‘思考 - 调用工具 - 重新思考’流程提升OCR性能,减少幻觉。

CourseAI
推荐文章7

当代码遇上大模型:智能编程助手的架构设计与工程实践

在 InfoQ 举办的 QCon 全球软件开发大会上,字节跳动段潇涵介绍如何基于大语言模型构建智能编程助手。他分享实践经验,剖析研发痛点,介绍技术架构,还探讨未来发展方向,如认知增强、工具整合等。

InfoQ
算法论文8

ACL 2025杰出论文!用能力显著向量让大模型下游任务性能预测更精准

上海人工智能实验室与复旦大学联合研究成果《Capability Salience Vector》获ACL 2025杰出论文奖。提出能力显著向量(CSV)解决验证损失与下游任务能力脱节问题,实验验证其提升了下游任务表现可预测性。

OpenMMLab