「模型使用经验」共找到 8936 篇相关文章
Thinking Machines又发高质量博客:力推LoRA,不输全量微调
Thinking Machines 博客力推 LoRA 并与全量微调对比。研究发现小数据量任务中 LoRA 与全量微调效果接近,大数据量稍吃力,强化学习中低秩 LoRA 也能接近全量微调。还揭示了 LoRA 关键要素、超参数规律等。
独家丨专访 Tunee 产品负责人:国内首个对话式音乐创作 Agent,刚上线就好评如潮!
文章是对 Tunee 产品负责人的专访。Tunee 是国内首个对话式音乐创作 Agent,能记住用户偏好,自动完成母带与混音。团队坚持‘人人都能玩点音乐’,将在云栖大会发布新模型与吉他,还探讨了产品问题与未来规划。
2025 的企业 AI 市场, Data &AI 占据主流视野
数据是 AI 模型学习和训练的基础,Data & AI 基础设施可打通数据与 AI 全链路。企业应用 AI 不应只关注算法和算力,还需重视私域数据。同时介绍了不同类型企业在 Data & AI 领域的特点及合作成本等内容。
7个AI玩狼人杀,GPT-5获断崖式MVP,Kimi手段激进
OpenAI总裁转发基准测试,让7个LLMs玩210场狼人杀。GPT - 5胜率96.7%断崖式领先,国产Qwen3和Kimi - K2分列第4、6。测试方分析模型性格,还借此研究LLMs社会行为,长远目标是实现AI驱动的市场研究。
OpenAI重大发现:GPT-4b micro改造诺奖研究,山中因子重编程效率提高50倍
OpenAI与Retro Bio合作,用新模型GPT - 4b micro设计出新型山中因子变体,使重编程效率提高50倍。此前山中因子重编程效率极低,限制其应用,此次改进是突破。研究还在多方面验证了变体效果。
Cursor为Blackwell从零构建MXFP8内核,MoE层提速3.5倍,端到端训练提速1.5倍
Cursor团队从NVIDIA的Hopper H100s升级到Blackwell B200s后遇性能瓶颈,他们回归基础,从零重写MoE训练层,抛弃对现有CUDA库依赖,释放了Blackwell架构潜能,实现MoE层和端到端训练提速。
让强化学习快如闪电:FlashRL一条命令实现极速Rollout,已全部开源
清华AIR、字节联合团队曾发布DAPO实现大规模LLM强化学习。刘力源、姚峰团队发现DAPO-32B中rollout生成是瓶颈,推出FlashRL,应用INT8/FP8,用TIS解决不匹配问题,加速显著且不牺牲性能,一条命令即可使用。
垂直赛道 Agent 闷声发财指南:如何实现一年超千万营收?
本文围绕垂直赛道的2B Agent展开,分享了语核科技创始人的产品理念与经验,探讨了如何找到有价值的场景、构建高价值闭环。还介绍了客户的应用情况、对Agent的看法及选型考量,强调其商业价值与落地挑战。
八年孤独,Iceberg 赢得世界
本文讲述 Iceberg 的发展历程、技术特性、用户案例及商业生态。它从解决 Hive 痛点孵化,经开发者、客户、厂商推动成开放表格式标准。其 V3 Spec 补充短板,社区开始构想 V4 。诸多科技大厂深度使用并贡献代码。
Andrej Karpathy 盛赞!斯坦福团队新作,让Llama-1B 实现毫秒级推理
斯坦福Hazy Research团队将开源模型Llama - 3.2 - 1B前向推理整合为“Megakernel”,把推理延迟大幅降低,显存带宽利用率显著提升。团队指出当前主流LLM推理系统在小batch、极低延迟场景下低效,提出Megakernel以重构执行方式。