大厂工作」共找到 5827 篇相关文章

算法论文8

首个英文原生「弱智吧」!逻辑谬误数据集与生成框架来了 | AAAI'26

研究发现模型判断逻辑谬误易误报正常句子,但分类能力较强。研究人员构建英文逻辑谬误基准SMARTYPAT - BENCH,开发生成框架SMARTYPAT,为模型逻辑评估提供新思路,可用于多领域。

新智元
开源动态8

硅谷豪赌算力烧到停电,中国团队反向出击!这一刀,直接砍碎Scaling Law

硅谷陷入算力战争,OpenAI、马斯克等豪赌Scaling。但Anthropic指出模型、算力多不一定聪明。Yuan 3.0 Flash登场,用RAPO+RIRM解决过度思考,降低推理token,在多模态任务表现出色,引发开发者关注。

新智元
新闻资讯7

扣子 Agent 创作者榜单 - 2025.4

2025 年模型和 Agent 渐入众视野,虽家对 Agent 理解有别,但它落地效果和想象空间。扣子用户达百万级,此次发布最新创作者榜单,后续还将发相关内容。

特工宇宙
新闻资讯8

维纳智能登上Nature通讯:AI不只会回答问题,开始生成高精度行业数据

维纳智能登上Nature通讯,其让模型自动生成高精度推理数据,用闭环反馈驱动专业Agent自主演化。该公司在多领域交出工业级精度答卷,还解决了Agent泛滥的困局,推出多款创新产品。

机器之心
新闻资讯7

arXiv创始人亲测:水论文这一块,Grok最强,Claude最不配合

Nature报道arXiv创始人Paul Ginsparg牵头的研究,测试13个主流模型在用户要求造假水论文时是否拒绝。结果Claude最守底线,Grok和ChatGPT较易“配合”,多轮对话中模型易动摇,论文激增危害多。

量子位
开源动态8

Clawdbot爆火:Karpathy点赞的开源AI助理,到底是什么?

这两天AI圈被Clawdbot项目刷屏。它是能在手机已有应用中工作的AI助理,有记忆、会主动联系用户、能执行任务。它可在廉价云服务器运行,能力分两层级,成本每月25 - 150美元。

AI寒武纪
新闻资讯7

开源模型TOP5,被中国商包圆了

10月公开数据显示中国开源模型占据榜单前五,阿里Qwen系列和DeepSeek影响力深远。从LMArena榜单、HuggingFace数据看,国产模型表现佳。还提及Llama 5相关传闻。

量子位
算法论文7

The Batch: 863 |推理提高了碳排放

新研究量化推理模型时代提供更优答案的环境成本,研究人员估算14个开源权重的模型碳排放,发现推理与排放存在权衡关系,还指出战略性部署可降低排放。

DeeplearningAI
产品应用7

Harness Engineering 时代的失败经验

作者分享在Harness Engineering时代使用Coding Agent的经验,指出虽Agent发展快且有成功案例,但实际应用有诸多问题,如部分模型体验差、自然语言模糊影响长程工作等,还给出解决思路,文章会持续更新。

GiantPandaLLM
7

假简历狂骗硅谷 10+ 家 AI 公司、拿多头薪水被锤!印度工程师喊冤:每周拼 140 小时,我也很绝望

印度工程师 Soham Parekh 同时供职多家硅谷初创公司被曝光。他面试表现佳,获多家公司青睐。Parekh 称是为摆脱财务困境,每周工作 140 小时。事件引发争议,有人视其为骗子,也有人建议他利用名气创业。

InfoQ