「多场景隔离」共找到 5316 篇相关文章
红杉中国推出 Agent 基准测试「xbench」,双轨评估体系,关注 AI 真实场景的效用
红杉中国开放AI和Agent基准测试工具「xbench」,采用双轨评估体系,构建多维度测评数据集。首期发布两个核心评估集并排名,提出垂类Agent评测方法论。该工具旨在解决现有评估问题,关注AI真实场景效用。
揭秘开源Agentic‑Doc真能支撑120 W+ 查询?医疗/金融/法务都在用,确实是有这么 6~~~
LandingAI的Agentic Document Extraction是领先OCR且具视觉结构化能力的Python SDK,可处理复杂文档。它功能丰富,架构合理,支持多格式输出。在多行业有应用,性能提升显著,与同类项目相比优势明显。
刚刚,国产GPU赛道又跑出一个 2700 亿估值独角兽!“中国AMD”沐曦股份完成 IPO,开盘大涨超 500%
2025年12月沐曦登陆科创板,股价达679元/股,估值破2700亿。其定位全栈GPU提供商,产品覆盖多领域。2022 - 2024年营收三年复合增长率超4000%,但累计净亏损超30亿。核心团队多来自AMD。
4K Star的多人 Agent 协作平台 Multica!Agent即队友,可像同事一样被指派、被追踪!
当前多 Agent 协同缺乏统一管理和经验沉淀,GitHub 开源的 Multica 平台解决了这一问题。它把编码 Agent 变成队友,自动化处理任务,支持多 Agent 后端,有多种功能特性,提供云服务和自托管两种使用方式。
准确率提升至 90%,阿里商旅基于 AgentScope 构建多智能体差旅助手最佳实践
阿里商旅依托阿里巴巴生态,旗下AliGo差旅助手可实现业务闭环。早期单智能体模式有瓶颈,后基于AgentScope构建多智能体系统,从技术选型、架构设计等多方面优化,事项收集准确率提至90%+,还解决诸多问题并获奖。
大模型如何准确读懂图表?微软亚研院教它“看、动手、推理”
多模态大模型处理结构化图像有误差放大、推理难等问题。微软亚洲研究院等提出PixelCraft,以高保真图像处理与非线性多智能体推理为支柱,提升结构化图像理解性能,在多基准上有增益。
OpenAI Codex桌面版深夜突袭!一人指挥Agent军团,程序员彻底告别996
OpenAI推出编码杀器Codex桌面App,可指挥多Agent并行协作。它能多任务并行切换,创建调用Skills,设置自动化流程,从写代码进化到解决问题,还具备双人格模式,默认安全,有望重塑开发者与代码交互逻辑。
升级版Qwen3开源模型深夜来袭,超越Kimi-K2、DeepSeek-V3
深夜阿里千问推出 Qwen3-235B-A22B-Instruct-2507-FP8 版本。新模型通用能力显著提升,在多测评中表现出色,超 Kimi-K2 等模型。还增强多语言知识覆盖等性能,已在魔搭和 HuggingFace 开源。
社交Agent: 通过RL学习自适应Thinking,根据场景在“秒回”和“深思”间灵活切换
现有聊天机器人在人情世故场景表现不佳,论文指出大模型思维‘一根筋’。研究团队设计4种思维模式,用AMPO强化学习算法动态切换。在模拟社交任务中,AMPO表现超GPT - 4,省时高效。
腾讯混元开源 4 个小尺寸模型,主打 Agent 和长文
8月4日腾讯混元开源四款小尺寸模型,参数为0.5B、1.8B、4B、7B,消费级显卡可运行。模型推理快、性价比高,在多领域表现出色,亮点是Agent和长文能力,已在腾讯多业务应用。