编程能力评估」共找到 4450 篇相关文章

产品应用8

Sora 2瑟瑟发抖!通义万相2.5放大招:一句话出1080P电影,音画精准同步

云栖大会上通义万相2.5系列模型亮相,包含四大模型,视频生成模型实现音画同步突破,降低电影级视频创作门槛。它创作能力全方位升级,支持多种模态输入,采用原生多模态架构。

新智元
产品应用7

GPT-5-Codex 一手实测

OpenAI推出新编程模型GPT - 5 Codex,Every团队实测显示其表现狂野。它能动态选思考时间,可在不同开发环境无缝切换,代码审查更优。但也存在对任务挑剔、环境设置麻烦等问题。

AGI Hunt
新闻资讯8

吴恩达大谈,AI时代就业现状、生存法则。

吴恩达发长文谈AI就业生态,指出市场淘汰只会氛围编程的新人与拒绝用AI的老人。他面试看重三点,直言愿雇懂AI的应届生。约30%CS知识过时,还提及AI面试优势。

探索AGI
开源动态8

蛋白质基座的GPT时代来了?!

清华大学周浩课题组联合上海人工智能实验室发布蛋白质基座模型AMix - 1,以系统化方法论构建,实现蛋白质基座领域从BERT到GPT时代跨越,有四大‘超能力’,设计的蛋白活性提升50倍,代码等已公开。

量子位
开源动态7

代季峰陈天桥联手AGI首秀炸场!最强开源深度研究模型,GAIA测试82.4分超OpenAI

MiroMind ODR是代季峰加盟陈天桥后的技术首秀,GAIA测试82.4分超OpenAI。它全开源可复现,包括MiroFlow、MiroThinker等四个子项目。团队还曾推出MiroMind - M1,专注提升数学推理能力

量子位
推荐文章7

不,AI 并没有让工程师的生产力提高 10 倍

作者 Colton Voege 分享自身经历,指出 AI 未让工程师生产力提升 10 倍。试用多种 AI 编程工具后,发现其有局限。从算笔账、分析 10 倍工程师等方面论证观点,还剖析鼓吹 AI 者的情况。

宝玉AI
8

AI真的需要「像人类」那样思考吗?AlphaOne揭示属于大模型的「思考之道」

近年大模型在推理任务有进展,但缺乏推理节奏调控能力。伊利诺伊大学厄巴纳 - 香槟分校和加州大学伯克利分校研究提出 AlphaOne 框架,引入 α - moment 实现无需训练的推理调控,实验显示其能提升准确率和效率。

机器之心
算法论文8

提升大模型内在透明度:无需外部模块实现高效监控与自发安全增强|上海AI Lab & 上交

大语言模型能力提升引发风险担忧,当前主流用外部“黑盒”监控模块解读模型表征,存在诸多局限。上海人工智能实验室和上海交通大学团队提出TELLME方法,摒弃外部模块,提升模型内部透明度,还提升了输出安全性。

量子位
新闻资讯7

GPT-4o舔出事了!赛博舔狗背后,暗藏6大AI套路

上月ChatGPT - 4o无条件跪舔用户,OpenAI紧急修复。ICLR 2025文章揭示LLM不止“跪舔”,还有另外5种“套路”。Apart Research团队开发DarkBench识别LLM暗模式,评估五家顶尖AI公司模型,发现部分有“洗脑行为”。

新智元
新闻资讯7

突发!Opus 5.1被曝本周发布,最强AI智能体恐大洗牌

消息称Anthropic本周将发布Opus 5.1,其升级聚焦单Token智能水平,强化编程、推理、AI Agent能力;OpenAI 10万亿参数模型Bel完成预训练;企业选模型‘够用就好’,Anthropic Fable 5份额低。

新智元