编程能力评估」共找到 4484 篇相关文章

算法论文8

扩散LLM推理新范式:打破生成长度限制,实现动态自适应调节

随着扩散大语言模型成为热门,但其推理时存在预设固定长度的限制。香港中文大学 MMLab 等提出 DAEDAL,赋予模型根据问题自主调整回答长度的能力,在性能和计算效率上有提升。

机器之心
推荐文章7

AI 产品定价指南

本文编译对按量计费平台初创公司 CEO Scott Woody 的访谈,探讨 AI 改变软件定价逻辑、不同类型 AI 公司应对之法,还补充定价专家 Madhavan Ramanujam 关于 AI 产品定价四象限观点。

海外独角兽
新闻资讯7

GPT-5 的秘密武器:Universal Verifiers

OpenAI开发「Universal Verifier」(通用验证器)技术助力GPT - 5。该技术让一个AI模型检查另一个模型输出质量,解决了强化学习难题,使GPT - 5在多领域表现出色,不过技术可能因人员流动扩散。

AGI Hunt
新闻资讯8

MLLM集体翻车,缺乏婴儿级常识!业界首个核心认知基准发布,LeCun转赞

当前大模型在12项核心认知上普遍落后人类10 - 30%,越大的模型越易靠「背答案」糊弄。团队公开首个系统评测框架和题库,用Concept Hacking方法识破模型真假理解,指出模型存在核心知识缺失等问题。

新智元
新闻资讯8

OpenAI深夜发布ChatGPT Study:免费AI家教,彻底颠覆传统教育

今天凌晨1点,OpenAI发布ChatGPT Study学习模式,面向教育领域,有交互式提示等四种方法,能解读难题思路,免费版也有此模式。其底层有自定义系统指令,特色功能实用,不少内测用户已用它解决学习难题。

AIGC开放社区
算法论文8

EAAI | 香港理工大学王旭等:一种增强MFNN的多源气动数据重构方法

飞行器气动压力分布获取依赖风洞试验或数值模拟,多源数据差异为气动数据重构带来挑战。本研究提出增强型多保真神经网络,通过差分运算提升模型泛化精度,在跨声速压力分布重构中效果显著。

力学与人工智能
新闻资讯7

解道奥赛题成本5000美元?陶哲轩警告,AI下一步要规模化的「更便宜」

谷歌新一代 Gemini 进阶版在 IMO 竞赛达金牌水平,华人数学家陶哲轩对此关注且担忧。他认为评估 AI 表现应谨慎,AI 发展需从定性转向定量,要‘降本增效’,未来标准化评测很重要。

机器之心
算法论文8

MeanFlow再下一城,北大提出机器人学习新范式MP1,实现速度与成功率双SOTA

北大研究团队提出机器人学习新范式MP1,将MeanFlow引入机器人学习,实现毫秒级推理速度。还引入分散损失提升少样本泛化能力,在仿真和真机测试中,实现速度与成功率双SOTA。

机器之心
新闻资讯8

“连我也要被GPT-5踹了!”Altman再发暴论:写款软件就花7毛钱,大批高级程序员岗也说没就没

OpenAI 首席执行官 Sam Altman 在播客及会议中谈及 GPT - 5,称其在多方面超人类,还预言 AI 会引发就业变革,如淘汰部分职业,也带来新机遇。同时指出 AI 虽益处大但风险高,如欺诈危机。

AI前线
新闻资讯7

硅谷年度「分尸案」!带头卷走24亿跑路,明星创始人遭VC集体拉黑

AI爆火编程独角兽Windsurf原本有望被OpenAI 30亿美元收购,却在最后一刻告吹。谷歌24亿美元拿下部分,Cognition分食另一半。这让VC大佬、团队成员吃苦头,引发对创业生态负面影响的讨论。

新智元