研究与学习 3.0 · 值得看 2026-09-22 · 文章

Are LLMs still surprisingly bad at some simple tasks?

Terence Eden 一年前出过一道题"哪些 TLD 与合法 HTML5 元素同名"当时所有模型全错;一年后复测,仍没有模型完全答对:Gemini Flash 编造 .a 与从未存在的 //,Gemini 思考模型不编造但漏掉 ///,Claude 样本漏 ccTLD 或塞入 near-misses 装充实,Perplexity 给 54 条大多错误,GPT Astra 6 全对元素并标出废弃项而 Siri 因为直接抄了作者旧网站反而全对反转在于题眼:HTML 自定义元素规则(小写开头+含连字符)使 150+ 个 TLD(含 Punycode 如 xn--vermgensberatung-pwb,作者用 customElements.define 在浏览器实测可注册)合法,加上 MathML 的 mn/mo/ms/mtr作者的落点:这不是刁难题...

打开原文回到归档

Are LLMs still surprisingly bad at some simple tasks?

原文链接: https://shkspr.mobi/blog/2026/09/are-llms-still-surprisingly-bad-at-some-simple-tasks/
作者: Terence Eden
发布时间: 2026-09-22
来源笔记: OpenClaw定时任务/X书签消化/2026-09-22(AK-RSS 同日收录)

摘要(AAIF 提取)

2025 年 9 月 Terence Eden 出题:"Which TLDs have the same name as valid HTML5 elements?"——所有模型全错。365 天后用同一道题复测当前模型:

  • Gemini Flash:给出 .a(TLD 最短长度是 2,不合法)与从未存在过的 <art>/<app>/<bar>,还附"historical element"之类注释。
  • Gemini thinking:不编造,但漏 <data>、<map>、<select>、<search>。
  • Claude(两份样本):一份漏 search/select 且完全不报 ccTLD;另一份在结尾塞入 "near misses" 清单(.forum、.baseball 等)——看着像做过研究的填充话术。
  • Perplexity:报 54 条匹配,多数错误;不过它顺带说了 .math/.svg 不是已委托 TLD,却仍没推到 MathML 的 mn/mo/ms/mtr。
  • GPT Astra 6 Extra High:元素全对,还标出其中两个已废弃——表现最好。
  • Siri:全对——因为它直接抄了 Eden 自己 2023 年的博客(一道关于 LLM 评测的题,最后是检索赢了生成)。

题眼(隐藏的反转):HTML 自定义元素规则——小写字母开头、不含大写、必须含连字符。满足该规则的 TLD 超过 150 个,包括 Punycode TLD(如 xn--vermgensberatung-pwb)。作者在浏览器控制台用 customElements.define('xn--vermgensberatung-pwb', Example) 实测注册成功,而 holiday(同为 TLD 但无连字符)报错 "not a valid custom element name"。另外 HTML 允许 MathML 元素,mn/mo/ms/mtr 也算合法元素且同为 TLD。

作者的工程落点:多数人不改默认设置、也不会核查输出;谄媚式模型用多余细节伪装可靠;快速模型与一年前相比没有"智能下渗"证据。这道题的价值不在 trick,而在它是模型不知道元素集合边界的具体证明——benchmark 同样不知道。对工程实践的唯一可操作结论:对简单但无聊的任务保持持续抽检,不要因为答案长得像答案就接受它。