「设计模式」共找到 2123 篇相关文章
大模型是否对问题难度有预判?最新研究揭示 LLM 内部的“难度感知机制”
近期论文《Probing the Difficulty Perception Mechanism of Large Language Models》系统性解答大模型能否感知问题难度等问题。研究基于数据集在主流 LLM 上训练轻量线性探针,定位负责难度感知的注意力头,还发现不同模型表现有差异。
相机参数秒变图片!新模型打通理解生成壁垒,支持任意视角图像创作
S-Lab等机构研究员提出Puffin统一多模态模型,它能整合理解相机参数与按参数生成对应视角图片的能力。通过“用相机思考”和400万组数据训练,解决此前模型问题,还构建相关数据集和评测基准,性能出色。
打造图像编辑领域的ImageNet?苹果用Nano Banana开源了一个超大数据集
苹果研究团队提出Pico - Banana - 400K数据集,基于Nano - Banana在OpenImages实拍照片生成编辑对。其系统化设计保证质量与多样性,还构建自我编辑评估流程,为图像编辑模型训练评测奠定基础。
“Claude Skills很棒,可能比 MCP 更重要”
10月17日,Anthropic发布Claude Skills,是助其模型获新功能的模式。Claude用Skills可改进执行特定任务方式,且只在相关时调用。它易共享,可能比MCP更重要,实现依赖编码环境。
创始人强塞AI代码,致开源社区分裂!核心开发集体出走:“你这种强权压制,让人恶心!”
近期,GZDoom 背后的开源社区因创始人兼维护者 Graf Zahl 在代码库中加入未经测试的 AI 生成代码而分裂,抗议者创建了分支 UZDoom。Graf 称只是用 AI 生成样板代码,不影响核心功能,但社区成员认为开源项目不该用 AI 工具。
Google封神,计算机视觉的GPT3时刻来了!
Google Deepmind称在CV领域做出类似GPT-3的成果,Veo 3经大规模训练涌现通用视觉理解和推理能力,能以图片+提示词完成复杂视觉任务,还具备感知、建模等四大超能力。
破解MoE模型“规模越大,效率越低”困境!中科院自动化所提出新框架
大模型参数量飙升却陷入‘规模越大,效率越低’困境,中科院自动化所研究团队提出统一框架,直击MoE底层运作模式,让专家‘组队学习’,实现参数量、负载方差降低,达成三重优化。
斯坦福华人研究火了:45分钟让你的论文变身AI智能体!
斯坦福大学研究人员提出Paper2Agent,可将静态论文转化为可交互的AI智能体。它提供自动化工作流,核心是封装成MCP服务器。通过三个案例展示其将不同论文转化为智能体的能力,提升科研成果易用性与可复现性。
Databricks开源限流方案,抛弃redis,性能提升10倍
Databricks 开源高性能限流系统设计,抛弃 Redis,通过内存分片和批量上报机制,实现 10 倍性能提升。还将限流算法改为令牌桶,解决了精度控制、在线迁移等问题,权衡了分布式一致性。
首次实现第一视角视频与人体动作同步生成!新框架攻克视角-动作对齐两大技术壁垒
新加坡国立大学等联合发布EgoTwin框架,首次实现第一视角视频与人体动作联合生成,攻克视角-动作对齐与因果耦合瓶颈。它基于扩散模型,通过三大创新设计解决难题,实验性能超基线。