「编程验证」共找到 1856 篇相关文章
PRSA 2025 | RPI Nithin Somasekharan、Shaowu Pan(潘韶武):突破柯尔莫哥洛夫屏障——面向模型降阶的可学习加权混合自编码器
本文将线性POD与非线性Autoencoder通过可学习参数融合,提出可学习加权混合自编码器架构。在多数据集验证中,该方法克服了POD和纯AE的局限,在复杂PDE系统预测中表现出色,或可降低大规模计算成本。
OpenAI 设计师:不写代码的设计师,将成为团队瓶颈
OpenAI 的 Ed Bayes 和 Figma AI 设计总监 Gui Seiz 深度对谈,探讨 AI 打通编程与设计工具后设计师工作流程的变化。涉及画布与代码的使用、代码与设计稿同步、实际应用效果、工作方式转变等内容,还给出新手入门建议。
AAAI 2026|AP2O-Coder 让大模型拥有「错题本」,像人类一样按题型高效刷题
在AI辅助Coding技术发展背景下,开源大语言模型生成代码有运行错误。上交博士团队提出AP2O方法,构建AP2O - Coder框架,借鉴人类学习模式,经实验验证能提升模型性能、抑制错误、提高样本效率,还适配通用模型。
Claude版Manus只用10天搓出,代码全AI写的!网友:小扎140亿并购像冤大头
Claude Cowork是面向工作场景的通用智能体,基于Anthropic自研模型打造。开发约10天,代码全由Claude Code写,人类仅负责规划等。它让非编程用户能用AI能力,这让扎克伯格20亿买Manus的操作显得冤。
「一脑多形」圆桌:世界模型、空间智能在具身智能出现了哪些具体进展?|GAIR 2025
在第八届GAIR全球人工智能与机器人大会“数据&一脑多形”分论坛的圆桌论坛上,高飞、金鑫、王靖博三位学者围绕具身智能、空间智能、世界模型等话题展开讨论,探讨研究进展、挑战与机遇,还谈及创业和数据获取等问题。
王兴一鸣惊人!美团首个开源大模型追平DeepSeek-V3.1
美团首个开源大模型Longcat-Flash-Chat发布即引发热议。它在部分benchmark上超DeepSeek-V3.1等,编程能力也出色。技术报告透露美团对大模型的理解,还有新发现,且性能好、训练效率高。
突破Pass@1瓶颈:一种让LLM自我博弈、永不枯竭的RL新范式,超越基线22.8%!
近年来,基于可验证奖励的强化学习(RLVR)在提升大型语言模型(LLM)推理能力上有关键作用,但存在熵崩溃问题。论文提出SVS创新策略,让模型自我合成变分问题形成自我提升循环,实验效果惊人。
16 个月、45 万资金投入,一款 AI 社交产品的创业失败复盘
作者复盘AI社交产品“抱抱窝”创业失败经历,涉及方向选择、团队搭建、时间资金把控、团队沟通等问题,还给出经验建议,如选方向要有标准,团队开发股份占比应合理,明确时间表等。
少说‘Wait’,多做题:NoWait重塑大模型推理路径
现代大模型在复杂推理时爱用自我反思词,触发冗余验证循环,拖慢速度、增加算力消耗。NoWait方法零训练成本,通过抓关键词、扩展变体、实时屏蔽,让模型跳过废话,在多任务中表现出色,且颠覆对推理的认知。
谢赛宁团队新基准让LLM集体自闭,DeepSeek R1、Gemini 2.5 Pro都是零分
纽约大学等8家机构研究者提出LiveCodeBench Pro竞技编程基准测试,评估了Gemini 2.5 Pro等前沿大模型。发现当前模型有显著不足,在无外部工具时,高难度题通过率为0,LLM与人类大师级水平差距明显。