「多工具推理」共找到 6877 篇相关文章
“传统设计流程已死”!IDE成Claude设计负责人新宠:Anthropic人人写代码,最不怕Bug
Claude设计负责人Jenny Wen在访谈中表示,AI冲击下传统设计流程已过时,设计师工作重心改变,IDE成新工具。她分享AI工具栈,点明三类有竞争力设计师,还谈及设计管理、产品发布等观点。
刚刚,Cursor又分享了数百Agent并发协作的最佳实践
Cursor分享数百Agent并发协作最佳实践,讲述单个Agent局限,介绍从多方面探索协同方法,如规划者与执行者分工,还展示多个实验成果,总结模型选择等经验,指出多智能体协同仍待优化。
优理奇机器人完成两轮合计3亿元天使++++轮及天使+++++轮融资,“算法-硬件-场景”三位一体加速具身智能应用落地
优理奇机器人近日完成两轮合计3亿元融资,是半年内第五轮。其坚持“场景驱动”,产品在运动会获奖,量产交付订单超千台。构建完整技术栈,推出标准化机械臂产品,创始人看好具身智能统一发展。
快手Klear-Reasoner登顶8B模型榜首,GPPO算法双效强化稳定性与探索能力!
快手Klear团队推出Klear-Reasoner模型,基于Qwen3 - 8B - Base打造,在多基准测试达同规模SOTA。其核心GPPO算法能强化稳定性与探索能力,团队还对训练流程多环节深入分析,给出优化策略。
付费Mathpix公式识别不香了~不要钱舒服!
复杂科学文献中公式识别问题重要,但现有模型有局限。DocTron - Formula通过简单微调在多场景达先进水平,还引入CSFormula数据集。它基于Qwen2.5 - VL微调,在多个数据集上效果佳。
全国首部AI大模型私有化部署标准,公开征集起草单位和个人!
由中国电子商会归口,智合标准中心组织起草的《人工智能大模型私有化部署技术实施与评价指南》团体标准立项,正征集起草单位和个人。该标准可解决企业部署难题,由多元主体联合起草,参与有重要价值。
1B参数,0.21秒识别,0.3%错字率:混元OCR拿下7项SOTA
腾讯开源模型 HunyuanOCR 在权威榜单 OmniDocBench 上霸榜,虽仅 1B 参数,却在 7 项任务击败众多大模型。它解决传统 OCR 流水线及通用大模型痛点,通过独特架构和训练方法实现高效准确识别。
斩获7.4K标星!NotebookLM的终极开源平替,私有化多模态播客一键生成!
Google的Notebook LM虽能上传资料一键生成播客总结,但有数据隐私等问题。近期GitHub上的Open Notebook获7.4K标星,它复制并超越前者功能,强调数据主权,有多项亮点且部署灵活。
红杉中国推出 Agent 基准测试「xbench」,双轨评估体系,关注 AI 真实场景的效用
红杉中国开放AI和Agent基准测试工具「xbench」,采用双轨评估体系,构建多维度测评数据集。首期发布两个核心评估集并排名,提出垂类Agent评测方法论。该工具旨在解决现有评估问题,关注AI真实场景效用。
ICLR 2025 Oral | LLM也有从众心理!
浙江大学团队论文指出,多AI协作系统存在“群体思维”,多个AI共同决策时会盲目跟多数意见。研究者开发BenchForm测试平台验证LLM从众行为,还分析原因、给出让LLM更独立的方法,指出从众利弊及未来挑战。