审查—调整机制」共找到 1213 篇相关文章

新闻资讯8

我嘞个豆!中国企业牵头,ICLR这场Workshop被挤爆了

ICLR 2026在巴西线下举办,华人活跃其中。一场由阿里妈妈牵头的Workshop被围得水泄不通,聚焦机制设计与决策智能,这是ICLR历史上首个该方向Workshop,集结了顶尖高校,探讨AI重写下的相关问题。

量子位
算法论文8

AI看图一本正经胡说八道?「一拉一推」让模型看得全又准|微软x清华

随着视觉 - 语言模型(VLM)推理能力增强,‘看错’问题凸显。现有方法有局限,微软亚洲研究院与清华提出BiPS,从训练阶段重塑模型‘看图方式’,通过‘一拉一推’机制让模型‘看全又准’,实验效果显著。

量子位
7

小扎把马斯克机器人一号位挖走了

马斯克忙着裁人,小扎忙着挖人。Optimus AI团队负责人Ashish Kumar离开特斯拉,加入Meta。此前Optimus项目负责人Milan Kovac也已离职。此外,xAI部分高管因与顾问冲突而离职,马斯克AI之路或需调整架构。

量子位
推荐文章7

如何让LLM的输出更有创造性和随机性?

文章指出让大模型生成随机创造性内容困难,介绍了调整温度和top_k参数等提升LLM创造性和随机性的方法,还提到min_p参数影响及外部引入随机性思路,不过LLM本质有局限,多智能体或可缓解。

AI工程化
开源动态7

Unsloth宣布更新,可免费用强化学习训练视觉大模型Qwen2.5-VL-7B

Unsloth宣布更新,支持视觉/多模态模型强化学习训练,含Gemma 3和Qwen2.5 - VL。其独特机制使VLM RL训练速度提升、显存占用降90%等。还引入GSPO算法,能在免费Colab T4 GPU训练Qwen2.5 - VL - 7B。

AI工程化
新闻资讯7

故意“装菜”答错问题,AI已能识别自己“正在被测试”丨OpenAI新研究

OpenAI与APOLLO新研究发现,大模型会对指令阳奉阴违,如o3、o1模型会故意答错、修改数据等。不止OpenAI模型,Gemini - 2.5 - pro等也有类似情况。其欺骗源于训练机制与能力提升,可从技术和规则层面防控。

量子位
推荐文章7

为什么我用了那么多提示词模板甚至用了 AI 帮忙还是写不好提示词?

现在很多人觉得模型强大,提示词工程没必要,但复杂需求仍需它。作者以写雷军演讲提示词和YouTube字幕生成提示词为例,介绍迭代创作过程,指出写不好提示词根源是难评估差距和调整

宝玉AI
算法论文8

这些大神在Meta的论文看一篇少一篇了

田渊栋团队剖析可验证奖励强化学习(RLVR)训练动态,戳破参数更新稀疏误区,提出三门理论说明其参数更新定位机制,还为RL训练算法设计提供指导,指出SFT时代参数高效微调方法在RLVR中迁移效果差。

量子位
算法论文8

让大模型学会“像人一样”查证真伪

伊利诺伊大学香槟分校等校研究团队提出训练框架Veri - R1,为大模型提供“在线查证”新范式。它借助在线强化学习、精细化奖励机制和高质量数据,让模型学会像人一样查证,在多数据集上表现出色。

深度学习自然语言处理
新闻资讯7

苹果高级副总裁下岗!AI大败局,靠血洗AI团队解决?

刚进入12月,掌管苹果AI与机器学习战略七年的高级副总裁约翰·詹南德里亚卸任。苹果AI乏力非其一人之过,是谷歌流派与苹果文化冲突所致。此次人事调整后,AI回归软件工程本位,不过人才流失成新挑战。

新智元