← 返回情报列表**作者论点:前沿实验室的定价基于“已产出或将在极近的未来产出完全自动化、可直接替代大多数知识工作者”的叙事,但当前前沿模型即使在最简单的任务上也需要费力的监督和防护栏** **文中列举易误导人的“头条式炫技”案例:Navier-Stokes(纳维-斯托克斯方程)、FreeBSD RCE漏洞、Hugging Face事件** **作者提出一个反证:软件公司仍在继续雇用并招聘排名末四分之一的软件工程师,这些工程师在当下基准测试中的得分远低于他们所监督的模型** **模型只在与其训练任务相近的狭窄邻域内泛化良好,且附带严重限制;即使对已覆盖任务类别做微小扰动,也会导致彻底失败或奖励作弊(reward hacking)** **作者认为奖励作弊问题只能靠领域专家进行严格规范来解决,而领域专家的时间成本高昂(原文摘录至此中断)** **作者在文末致谢Claude Fable 5.1、Holden Saberhagen、Gabriel Kammer、Andres Erbsen、Alice McKean和Tristan Wylde-Larue对本文提出意见**
📌 2026-09-16·Hacker News
为何在Navier-Stokes之后我仍然看衰LLM
#LLM#行业分析