推理框架」共找到 3364 篇相关文章

算法论文8

让LLM互相“审稿”:简单的LLM Collaboration/Ensemble方法实现7%性能提升

文章提出LLM-PeerReview方法,受学术同行评审启发,含评分、推理、选择模块。采用‘翻转三元评分技术’减少偏差,实验显示该方法超单一LLM及LLM Ensemble基线,性能提升显著。

AI前线
产品应用8

准确率提升至 90%,阿里商旅基于 AgentScope 构建多智能体差旅助手最佳实践

阿里商旅依托阿里巴巴生态,旗下AliGo差旅助手可实现业务闭环。早期单智能体模式有瓶颈,后基于AgentScope构建多智能体系统,从技术选型、架构设计等多方面优化,事项收集准确率提至90%+,还解决诸多问题并获奖。

阿里云开发者
算法论文8

登顶Hugging Face论文热榜,LLM重写数据准备的游戏规则

企业数据团队面临数据准备难题,传统方法依赖人工规则,有诸多局限。上海交通大学等机构研究团队综述指出,LLM正推动数据准备从“规则驱动”向“语义驱动”转变,还给出技术选型、评估基准及工程指南。

机器之心
新闻资讯7

Docker 通过 Cagent 提供 AI 代理确定性测试

AI 代理系统普及,工程团队面临测试概率性输出的挑战。Docker 的 Cagent 是一种 AI 代理确定性测试方法,采用 proxy - and - cassette 模型,虽处早期,但揭示了 AI 代理测试的不同方向。

InfoQ
新闻资讯7

《时代》2025重塑世界的五大AI进展

本文讲述2025年AI重大进展。中国Deepseek R1开源模型冲击全球格局,AI具备思考能力,特朗普政府推“星际之门计划”,AI公司支出逼近1万亿美元,同时AI与人类关系更复杂,引发风险思考。

AIGC开放社区
新闻资讯8

Gemini 3 Flash 发布,多、快、好、省,Coding 能力不输大哥Gemini 3 Pro

Google DeepMind 发布 Gemini 3 Flash,成本极低。它在多项测试表现出色,速度快、效率高,代码能力超 Gemini 3 Pro,获企业客户好评,今日起向全球开发者和普通用户推送。

AGI Hunt
7

这下Altman急了,OpenAI紧急启动「红色警报」

ChatGPT三周年后,Altman宣布OpenAI进入红色警报状态,调集资源改进ChatGPT。此前谷歌曾因ChatGPT威胁发布红色警报,如今谷歌等对手快速追赶,OpenAI多产品后续乏力,还面临增长与融资压力。

机器之心
算法论文8

Stanford、Meta和Google等发现LLM存在五大天花板,再扩算力已无用

论文《On the Fundamental Limits of LLMs at Scale》指出,LLM性能提升有理论天花板,扩展中会遇幻觉、上下文压缩等五大根本限制,源于计算、信息与学习理论,未来应转向‘有限优化’。

深度学习自然语言处理
产品应用8

官方文档翻译:Nano Banana Pro 终极开发指南

本文是 Nano Banana Pro 开发指南,介绍其通过‘思考能力’、实时搜索和 4K 画质构建应用。涵盖在 Google AI Studio 试玩、环境搭建等内容,还给出使用最佳实践与提示词技巧。

宝玉AI
开源动态8

高智商 ≠ 高财商?50天实盘测试:LMArena 高分王者也可能是「韭菜」

伊利诺伊大学厄巴纳 - 香槟分校团队开发 LiveTradeBench,让大模型在真实金融市场交易,检验其能力。它全面开源,有实时数据、组合决策等创新,50 天实测揭示模型财商差距。

机器之心