问一问」共找到 1298 篇相关文章

新闻资讯8

模型训练最重要的依然是 Scaling —— 对话阿里通义千 Qwen 多语言负责人杨宝嵩 | Open AGI Forum

本文是对阿里通义千Qwen多语言负责人杨宝嵩的专访。他透露Qwen开始就将国际化视作核心战略,团队建立文化标注体系确保内容安全合规。还谈到多语言推理难题及应对策略,认为扩大模型规模和数据量仍重要,合成数据是延续Scaling Law的关键。

AI科技大本营
算法论文8

监督学习未死,题训练五小时起飞!华人学者新方法20倍训练效率释放大模型推理能力

大模型推理能力研究中,RL训练资源成本高、不稳定,传统SFT低数据量易过拟合。加拿大滑铁卢大学华人团队提出One - Shot CFT方法,用题多解多点评训练,仅需约5个GPU小时,效果好、稳定性强。

量子位
推荐文章7

最新豆包、deepseek、元宝、夸克、千、百度、文心、Kimi、微信搜搜、抖音、小红书等AI搜索生成内容引用来自哪些地方?【干货】

作者白杨SEO指出,生成式人工智能发展快,AI搜索优化GEO受关注。介绍了豆包、DeepSeek等多个AI搜索生成内容引用来源,如豆包引用抖音、头条等,DeepSeek用开源数据等,还提及各平台优化要点。

白杨SEO优化教程
新闻资讯7

米哈游夜烧掉200万元Token,大厂高管也开始质疑:Token烧不出价值,但养肥了谁?

Uber运营负责人质疑AI tokenmaxxing成本合理性,米哈游员工晚烧200万Token。部分公司开始调整,如多邻国取消AI使用绩效评估,Shopify阻止失控消耗。Tokenmaxxing让模型厂商、编程工具和算力相关方受益,盲目跟风企业或成输家。

AI前线
新闻资讯7

GPA只有3.3,顶会作两篇,成功杀进TOP 20 AI博士?小哥曝光关键秘诀

亚洲硕士手握两篇顶会作,本科GPA 3.3,计划申请2026年秋季AI领域TOP 20博士项目。网友看法不,有人认为论文更重要,有人强调GPA是筛选因素。关键是进实验室、获大牛推荐信。还提及罗剑岚求学传奇。

新智元
算法论文8

不止Deep,更要Wide:清华、无芯穹发布多智能体系统WideSeek-R1,4B模型比肩671B模型!

清华与无芯穹的RLinf团队提出「广度扩展」,发布多智能体系统WideSeek-R1。它采用「Lead-agent-Subagent」框架,经MARL端到端训练,4B模型在广度搜索任务表现比肩671B模型,且在标准QA任务也出色。

机器之心
新闻资讯7

9B 模型“平替”GPT-4o ?!面壁赌对OpenClaw端侧AI,内部上演人月产65万行代码的效率核爆

2023年面壁智能转攻端侧大模型,起初遭质疑,后获市场认可。今年发布开源全模态模型MiniCPM - o 4.5,年中还将推AI硬件松果派。其内部有“人公司”趋势,对未来端侧智能发展有清晰判断。

AI前线
新闻资讯7

30天狂刷60万亿Token,光“榜”就烧掉140万美元!Meta员工搞出“AI Token排行榜”,结果小扎连前250都进不了?

Meta员工开发“Claudeonomics”仪表盘统计员工AI Token使用量,引发“Tokenmaxxing”风潮,上线两天因数据“外泄”下线。30天内全公司Token使用超60万亿,“榜”花超140万美元,扎克伯格未进前250。

AI科技大本营
产品应用7

单张消费级显卡也能参与大模型训练!无芯穹用「三个盒子」打通十万卡到张卡AI效能跃升路径

2025年WAIC上,无芯穹联合创始人夏立雪带来AI落地新解——三个盒子,即无穹AI云、无界智算平台、无垠终端智能,是面向未来的智能基础设施设计,能打通从十万卡到张卡的AI效能跃升路径。

量子位
开源动态8

NeurIPS 2025 | 中科大、港中深、通义千联合发布CoRT:仅30个样本教会大模型高效推理,token消耗降低50%

大型推理模型在精确数学计算上存在题,如认知冲突、行为低效、数据稀缺。中科大、港中深、通义千联合推出CoRT框架,用创新数据合成与多阶段训练,提升模型推理能力和效率,成果已开源。

机器之心