「推理质量评估」共找到 3139 篇相关文章
数智赋能:建筑地产行业的转型突围与未来筑造
建筑地产行业在全球经济中至关重要,当下数字化转型成关键。华为凭借对‘好产品’的理解及数字化实践,与多家企业合作推动转型。数智化在设计、运营等端发挥作用,助力行业实现效率与质量双飞跃。
云栖大会阿里掀桌子了!Qwen3-Max、VL、Omini、Agent ... 统统发布!
云栖大会上,阿里云智能首席技术官介绍千问多款新模型发布及一款升级。如万亿参数的Qwen3 - Max,代码和Agent能力强;还有Qwen3 - Coder - Plus、Qwen3 - VL、Qwen3 - Omni、Qwen3 - LiveTranslate等模型各有亮点。
里程碑!逻辑智能发布全球首个完全开源语音大模型框架LLaSO,语音AI迎来新纪元
逻辑智能发布全球首个完全开源语音大模型框架LLaSO,它像“全家桶”,提供高质量数据、统一评测基准和强大基础模型。语音大模型发展遇瓶颈,LLaSO框架及参考模型LLaSO - Base有望打破僵局。
语音分离最全综述来了!清华等团队深度分析200+文章,系统解析「鸡尾酒会问题」研究
清华等多校及字节跳动研究者全面调研语音分离领域,撰写综述论文,分析200余篇代表性论文。从问题定义、学习范式、模型架构等多维度展开,还探讨评估指标、数据集等,指出未来挑战与探索方向。
第一名方案公开,代码智能体安全竞赛,普渡大学拿下90%攻击成功率
亚马逊举办代码智能体安全比赛,普渡大学团队 PurCL 作红队以超 90% 攻击成功率夺冠。他们耗时八月、花百万美元开发全过程红队系统并开源,还发现当前 AI 安全研究在复杂领域对齐有挑战。
LangChain 推出开源异步编码智能体 Open SWE
LangChain发布开源异步编码智能体Open SWE,可在云端处理复杂开发任务,能集成到开发者工作流。它连接GitHub仓库,在沙箱运行,强调人在回路控制,多智能体架构保障代码质量,早期反应褒贬不一。
快手Klear-Reasoner登顶8B模型榜首,GPPO算法双效强化稳定性与探索能力!
快手Klear团队推出Klear-Reasoner模型,基于Qwen3 - 8B - Base打造,在多基准测试达同规模SOTA。其核心GPPO算法能强化稳定性与探索能力,团队还对训练流程多环节深入分析,给出优化策略。
DeepSeek有点含蓄了,实测V3.1有进步,编程等个别场景硬刚GPT-5
DeepSeek悄悄更新V3.1,官方仅提及上下文长度拓展至128K。实测其代码能力与前端审美提升,逻辑推理也有进步,在编程等个别场景能硬刚GPT - 5,但处理复杂任务还有距离,更新不大却有进步且降价。
逆天改命!OpenAI 开源模型的安全底裤被 Meta 研究员给扒掉了……
Cornell大学兼Meta研究员jack morris成功将OpenAI最新开源的推理专用模型GPT-OSS逆向还原成基础模型,绕过对齐和安全措施,还暴露其训练用大量版权材料问题,此成果引发社区激烈讨论。
微软发布5大AI Agent模式:一键解锁AI员工,打造智能体工厂
今天凌晨微软官网发布5种常用Agent模式助用户开发自动化AI员工。智能体比传统自动化工具更具优势,能推理协作等。各模式都有应用案例,且Azure AI Foundry支持多Agent模式开发。