「实验平台」共找到 2607 篇相关文章
AI辩论能力碾压人类,81.7%概率让你信服!研究登Nature子刊
《自然·人类行为》研究指出,在线辩论中,大语言模型根据对手特征个性化论点时,比人类更具说服力。实验显示,与GPT - 4辩论的参与者有81.7%更高概率认同其观点,应加强对大模型舆论操控的监管。
苹果拆解AI大脑,推理模型全是「装」的?Bengio兄弟合著
苹果最新研究揭示大推理模型(LRM)在高复杂度任务中普遍‘推理崩溃’。即便给予明确算法提示,模型亦无法稳定执行,暴露推理机制的局限性。研究还通过多种实验环境分析了模型在不同复杂度问题中的表现。
斯坦福华人天团意外爆冷!AI用纯CUDA-C编内核,竟干翻PyTorch?
斯坦福华人团队用纯CUDA - C编写的快速AI生成内核超越PyTorch,成果登上Hacker News热榜。研究者采用KernelBench任务设置,引入新优化方法,实验显示多数最优内核在靠后轮次出现,优化策略集中在几类常见模式。
75页哈工大多模态推理大模型最新综述:感知、推理、思考与规划
哈工大提出75页多模态推理大模型综述,围绕四阶段发展路线图展开,即感知驱动的模块化推理、以语言为中心的短推理、以语言为中心的长推理、迈向原生多模态推理模型,还给出挑战性基准测试和实验案例见解。
近 300万人围观卡帕西亲测 Opus 5:两小时写完 5500 行代码, 却连自己写的游戏都玩不了
8月2日,Andrej Karpathy在X公布实验,让Claude Opus 5用Three.js将《指环王》第一章渲染成3D场景,约两小时写出5500行代码。Opus 5按传统游戏开发路线搭建场景,这改变了内容定制方式,但模型验证能力不足。
Slack 淘汰 SSH:700+ EMR 作业迁移至基于 REST 的调度架构
Slack 完成大规模数据平台改造,将 Amazon EMR 数据处理流程中 SSH 作业执行模式替换为基于 REST API 的统一调度架构,移除对生产集群的直接 SSH 访问,迁移 700 多个 Airflow Operator,解决了安全、运维等问题。
Claude Code 新功能 Agent Teams:4 类活效率翻倍,4 类活纯烧 token
Claude Code v2.1.32 后新增实验性功能 Agent Teams,可将其从单个 AI 助手升级为 AI 团队,但会使 token 用量线性放大。文章总结了适合和不适合用此功能的任务类型,还给出决策清单、实战避坑建议。
阿里开源PromptEcho:用冻结多模态大模型为文生图训练提供高质量Reward
阿里团队提出PromptEcho方法,无需标注和训练reward模型,仅通过冻结多模态大模型(VLM)的一次前向推理获高质量reward。实验显示其在文生图和电商海报文字渲染任务效果佳,且已开源相关代码等。
生成式推荐补上关键一环!语义ID首次实现可微分联合优化 | SIGIR'26
生成式推荐依赖语义ID,可现有语义ID常先学好再冻结,与推荐目标不一致。论文DIGER首次将可微分语义索引机制引入生成式推荐框架,让推荐损失参与语义ID学习,还设计策略解决训练问题,实验表现佳。
谷歌开源“Agent Skill 超级工具箱”,云、库、引擎、AI全线打通,开发者狂喜
在大模型竞争白热化背景下,谷歌为解决开发者难题推出 Agent Skills。官方仓库含多项技能,涵盖谷歌云核心服务及架构支柱技能,还提供常见任务流程指南,兼容多平台,能省开发代码。此前还有 Addy Osmani 开源的技能库。