人在循环中」共找到 8829 篇相关文章

新闻资讯8

Claude 4 核心成员访谈:提升 Agent 独立工作能力,强化模型长程任务能力是关键

Anthropic 两位研究员采访中表示 2025 年强化学习大语言模型训练奏效,如 Opus 4 能处理长周期任务。还探讨模型发展方向,如用户与多模型交互、模型可解释性等,认为未来会有白领 AI 员工。

Founder Park
新闻资讯8

触觉具身来了个梦之队:天使轮近亿

5月27日,上海新智具身智能科技有限公司宣布完成近亿元天使轮融资。该公司源自复旦大学,核心团队实力强。它聚焦触觉具身智能,构建技术闭环,数据采集、模型训练等方面有进展,已工厂落地POC验证订单。

量子位
算法论文8

腾讯发布大模型思考早停算法SpecExit,效果无损,端到端加速2.5倍!

腾讯为破解大模型长思维链效率难题,提出思考早停算法SpecExit,将思考早停与投机采样融合,不影响准确性前提下,vLLM上实现端到端加速2.5倍,还能缩短思维链长度。

腾讯技术工程
产品应用7

“没有AI味”的Flux.1新模型,现可以免费试用

全新AI生图模型FLUX.1 Krea [dev]发布,可Krea Edit免费试用。官方称其“没有AI感,只有自然细节”。实测它光影和自然细节表现不错,但对形象、时空结构理解待提升,还存额度使用问题。

量子位
算法论文8

EasyCache:无需训练的视频扩散模型推理加速——极简高效的视频生成提速方案

近年来,扩散模型视频生成领域广泛应用,但推理慢、算力消耗高问题突出。EasyCache是无需训练的视频扩散模型推理加速方案,多模型实验中实现大幅提速且视频质量几乎无损,为技术落地提供基础。

机器之心
算法论文8

为什么BF16的FlashAttention会把训练「炸掉」?清华首次给出机制解释,用极简改动稳住训练

社区里长期存的FlashAttention+BF16训练GPT - 2时loss突然爆炸的问题,清华团队论文给出机制解释。指出是特定条件下数值偏置被放大所致,还给出极小修改稳定训练,且多模型和硬件上验证有效。

机器之心
算法论文8

AAAI 2026|新突破:北大彭宇新团队提出可见光-红外终身行重识别方法CKDA

终身行重识别有重要应用价值,但现有方法学习特定模态新知识时,会阻碍跨模态公共旧知识保留。北大彭宇新团队提出CKDA方法,解耦并净化不同模态信息,实现跨模态知识权衡,相关基准上取得最优性能。

机器之心
开源动态8

三大核心创新公开,快手开源多模态Keye-VL 1.5拿下视频理解SOTA,8B力压GPT-4o!

快手开源多模态Keye-VL 1.5,为8B视频理解最强模型,公开3大核心创新技术。它靠Slow-Fast视频编码等,20+基准屠榜。多类基准测试和内部测评中表现优异,将业务经验沉淀到开源社区。

PaperAgent
新闻资讯7

马斯克吹牛了吗?Grok 4第一波实测出炉:既能完虐o3,也菜到数不清6根手指

马斯克称Grok各学科达博士后水平,激起网友兴趣。博主测试显示Grok 4多项测试中完胜o3,网友还用它写游戏、让概念可视化。不过Grok 4也有翻车表现,马斯克称其仍有改进空间。

机器之心
算法论文8

合成数据>工数据,绝对性能暴涨超10个点!仅需任务定义,高效微调大模型

为解决基础模型专业领域表现不佳、依赖工标注数据的难题,北大、MIT等机构提出「合成数据强化学习」框架。该框架仅需任务定义,能生成合成数据微调模型,多领域基准上性能提升显著,代码已开源。

新智元