「测试时微调」共找到 2499 篇相关文章
来自MiniMax M2.5的震撼 :小尺寸几乎打平opus4.6,巨便宜,巨能干活,速度巨快
MiniMax M2.5正式发布,是优秀国产模型。它专注极致优化,部署方便、价格实惠、性能顶尖。在多项基准测试表现出色,速度提升、成本降低,多维度实现突破,已在MiniMax Agent全面部署。
一个全新的世界模型,终于让AI视频进入了“无限流”时代。
AI视频公司PixVerse推出实时世界生成模型PixVerse R1,用户可输入Prompt修改视频进程,无干涉时视频会自行延续。该模型为世界模型补上实时视频生成方向,实测体验乐趣十足。
AI编码工具变 “格式化神器”?Claude CLI半年频当“系统杀手”,多位开发者痛斥:心血都没了!
近日Reddit上一则对Claude CLI的控诉帖引发关注。一位开发者用其清理软件包时,整个Mac系统被清空。类似情况并非个例,‘删库’成AI工具通病,开发者需强化安全操作意识。
Cloudflare 用 Rust 重写核心系统:CDN 性能提升 25%,响应时间缩短 10 毫秒
Cloudflare 宣布用 Rust 重写核心子系统,响应时间缩短 10 毫秒、性能提升 25%。基于代理框架 Oxy 构建 FL2,创建中间层让 Rust 模块在旧系统运行,还制定测试发布策略及回退机制。
ICCV 2025 | 打造通用工具智能体的基石:北大提出ToolVQA数据集,引领多模态多步推理VQA新范式
北大团队提出ToolVQA数据集,用于提升基础模型工具使用能力。它含2.3万条样本,贴近真实需求。通过ToolEngine构建,涵盖多工具与任务领域。微调后模型表现佳,代码与模型已开源。
训练200万小时!OpenAI刚刚开源GPT-oss,AI Agent专属模型、可商用
今天凌晨OpenAI开源大模型GPT-oss,有1200亿和200亿两种参数,支持商用。它针对AI Agent训练,功能丰富。训练耗时超200万小时,测试表现出色,架构设计也有亮点。
MCP实战|从0到1构建异步 DeepResearch 工具,支持进度推送与超时控制
本文借助开源项目,构建可在MCP Server中异步运行的DeepResearch,支持任务进度推送与超时控制。介绍项目架构、构建步骤、任务管理器实现要点及效果测试,还提及优化方向并给出源码。
复旦提出自适应Reasoning方法ARM,“能屈能伸”
复旦提出自适应Reasoning方法ARM,解决LLM‘过思考’问题。ARM内置四种解题策略和三种决策模式,还搭配Ada - GRPO算法,在23个数据集测试中表现出色,省token、提速度且准确率高。
龙虾冲浪终于不迷路了!网页智能体新框架Avenir-Web开源即SOTA
伦敦大学学院等团队推出开源框架Avenir - Web,解决现有Web Agent在复杂网页操作中的难题。它采用模块化设计,包含经验模仿规划等模块,在ONLINE - MIND2WEB测试中表现出色,已开源供开发者探索。
8.5K星 Agent 记忆准确率 94.6%,RAG那套被打穿了
AI Agent常没记忆,每次对话像白纸。Hindsight(vectorize-io/hindsight)有8500+ star,是仿生记忆系统,分三层记忆,检索系统TEMPR四路并发,在测试中成绩优异,且上手简单,能让Agent从经验学习。