「多任务训练」共找到 6586 篇相关文章
社交Agent: 通过RL学习自适应Thinking,根据场景在“秒回”和“深思”间灵活切换
现有聊天机器人在人情世故场景表现不佳,论文指出大模型思维‘一根筋’。研究团队设计4种思维模式,用AMPO强化学习算法动态切换。在模拟社交任务中,AMPO表现超GPT - 4,省时高效。
个人开发者训400亿参数大模型:分布式算力,DeepSeek架构,3090单卡部署
Nous Research推出Psyche Network,可整合全球算力训练AI。它基于Deepseek的V3 MLA架构,有DisTrO优化器等技术,能让个人和小团体创建大规模模型,还实现40B参数LLM预训练。
可以用Claude Code来搞运维了
Claude Code刚发布后台任务功能,产品经理宣布它能处理长时间后台任务,不阻塞工作流程。有人将其变为全自动DevOps智能体用于运维,设置简单,还能语音播报、远程告警、自主诊断等。
他们让万亿参数RL学会了「省着跑」,顺便砍掉九成算力
2025年,强化学习成大模型进化主战场,但万亿参数模型跑RL成本高。Mind Lab团队实现1T参数模型LoRA高效RL训练,GPU消耗降90%,技术开源。此外还有Memory Diffusion记忆机制等成果。
5.1K Star!Codebuff 把整个 AI 编程团队装进你的终端!
Codebuff是开源AI编程助手,获超5.1k stars。其多智能体架构让不同智能体分工协作,理解代码上下文更好、编辑更准。官方测试中完成率61%,超Claude Code。它免费且上手简单,还能创建自定义智能体。
Vercel 推出 Drains 功能:实现统一数据导出
Vercel 发布 Drains 系统,将平台可观测性数据统一导出至外部服务,覆盖多来源日志等。用户可两种方式配置,导出数据与多系统兼容,能简化接入流程、减少管道碎片化。
「只参与,不参赛」奖牌数却仅次于宇树,这个幕后玩家如何做到的?
2025年世界人形机器人运动会,宇树科技获奖最多,没参赛的加速进化T1获奖牌数排第三。这家新公司选不同发展路径,重产品与生态,技术应用于多场景,有望成行业‘苹果’。
前OpenAI灵魂人物Jason Wei最新演讲!三大思路揭示2025年AI终极走向
前OpenAI核心研究员Jason Wei在斯坦福演讲,提出AI发展三大思路。他认为智能会商品化、成本下降,自适应算力出现;所有能被验证的任务最终会被AI解决;AI智能呈锯齿状,不会瞬间超越人类。
Claude Code is All You Need
Anthropic内部把Claude Code当万能助手。它核心理念是“一切皆文件”,能管理文件、日志和待办事项,还可打通Apple生态。MCP让其获取更多上下文。社区用户分享了在多场景的使用体验和技巧。
具身智能“高考”难疯了!人类100分,最强模型12.8
原推出RoboTwin系列基准的团队带来RoboDojo,这是统一的仿真+真实世界机器人操作评测基准。它设42个仿真任务、18个真实任务,让30个主流策略竞技,结果显示机器人距通用操作差距大。