测试时强化学习」共找到 3013 篇相关文章

推荐文章8

从混沌到可控:企业应用中AI Agent不确定性控制的 10 种策略

大语言模型输出的不确定性限制了AI智能体在企业场景的应用,本文总结控制生成式AI Agent不确定性的常见策略,涉及技术、应用设计、管理与治理层面,还推荐了相关作品。

AI大模型应用实践
产品应用7

刚刚,DeepSeek-V3.1「终极版」重磅发布!最大提升超36%,V4/R2还远吗?

DeepSeek最新模型DeepSeek-V3.1-Terminus发布,解决了此前输出随机带「极」字、中英文混杂等问题,在多个基准测试中成绩提升,最大提升超36%,Agent能力也有进步,还引发网友对V4/R2的期待。

新智元
开源动态8

三大核心创新公开,快手开源多模态Keye-VL 1.5拿下视频理解SOTA,8B力压GPT-4o!

快手开源多模态Keye-VL 1.5,为8B视频理解最强模型,公开3大核心创新技术。它靠Slow-Fast视频编码等,在20+基准屠榜。在多类基准测试和内部测评中表现优异,将业务经验沉淀到开源社区。

PaperAgent
7

软件行业“快时尚化”背后的经济学 | AGIX PM Notes

本周市场对软件看法悲观,OpenAI CEO 警告软件或进入‘快时尚时代’。但软件行业会升维,一是从‘死’变‘活’,具备元学习能力;二是定价更极致。还介绍了本周市场总结及多起 AI 相关企业动态。

海外独角兽
新闻资讯7

5Y News|赜灵生物完成近4亿元B+轮融资

近日,赜灵生物宣布完成近4亿元B+轮融资,由启明创投领投。资金用于推进创新药临床研究和拓展新管线,强化三大核心技术平台。公司已有核心产品进入关键临床阶段,创始人称2025年将加速海外布局。

五源资本 5Y Capital
产品应用7

昇腾910B大模型实测:开源框架能不能打?真相全放这了

文章对昇腾 910B 大模型进行实测,对比 vLLM Ascend 与 MindIE 在实际推理场景中的性能差异。通过 GPUStack 平台测试多种模型,结果显示两者在不同部署场景各有优势,vLLM 适合单卡小模型,MindIE 适合大模型多卡部署。

探索AGI
Product Application7

文档OCR新范式0.84 页/秒,吊打MinerU Qwen2.5VL

MonkeyOCR采用SRR三元组范式,简化多工具管道,避免整页文档处理低效率。与MinerU、Gemini 2.5 Pro等对比,性能表现优,处理速度达0.84页/秒,但对扫描件效果欠佳,架构含多模型,可通过特定地址测试

CourseAI
开源动态8

小红书hi lab首次开源文本大模型,训练资源不到Qwen2.5 72B 的四分之一

6月6日,小红书hi lab团队首次开源文本大模型dots.llm1,采用MIT许可证。该模型激活参数量140亿,总参数量1420亿,上下文长度32K。训练资源不到Qwen2.5 72B的四分之一,在多个测评中表现出色。

AI前线
推荐文章7

多邻国的「AI-first」到底是什么?|AGIX投什么

本文深度访谈多邻国联合创始人及CTO Severin Hacker,探讨其“AI-first”策略。多邻国自成立就确立该理念,AI提升内容创作效率、实现新功能,在运营多方面应用,还分享早期教训、产品策略和团队文化等。

海外独角兽
开源动态8

多模态长文本理解测评首发:46款模型无一攻克128K难关

香港科大等研究者联合提出MMLongBench,用于评估多模态模型长文本理解能力。它覆盖5大类型任务的16个数据集,对46个模型测试显示,闭源和开源模型在长上下文任务均面临挑战,OCR和跨模态检索能力是瓶颈。

量子位