GPT-5.4被虐出-189BB/100手!GTO Wizard AI血洗20个大语言模型,扑克仍是人类最后的护城河
写在前面:你的对手要是用ChatGPT打牌,那你就偷着乐吧
老铁们,最近扑克圈炸了一个大瓜,荟长看到数据的时候差点把咖啡喷屏幕上。
GTO Wizard——就是那个做求解器做到行业顶流的平台——搞了个大动作,拿自己的AI模型和20多个主流大语言模型(LLM)打了一场单挑无限注德州扑克大赛。
参赛选手名单亮出来能吓死人:GPT全系(包括最新的GPT-5.3、5.4)、Gemini、Claude Opus、Kimi、Grok……一个个写诗、编程、解数学题、通过律师资格考试样样精通,感觉马上就要统治世界了。
结果呢?被GTO Wizard AI按在地上摩擦。
最惨的GPT-5.4 Nano(无推理模式),运气调整后输率达到了惊人的-189.7 BB/100。什么概念?顶尖职业牌手能稳定盈利4 BB/100就已经是神一样的存在了。这帮AI大佬输的速度,是顶级人类提升决策质量速度的47倍。
连表现最好的GPT-5.3(超高推理模式),也输了-16 BB/100——相当于每100手牌稳定送出去16个大盲注。在低级别桌上,这个输率足够让你一个月破产三回。
GTO Wizard自己都忍不住吐槽:“每一个模型在单挑扑克面前,都烂得一塌糊涂。”
今天这篇文章,荟长就带你把这场比赛的里里外外扒个干净。看完你会明白三件事:第一,AI离攻克扑克还差得远;第二,LLM在扑克桌上就是来送钱的;第三,你的人类大脑,仍然是这个星球上最锋利的扑克武器。
◈ 付费内容继续 ◈
下方包含Ruse AI技术架构拆解、LLM四大致命缺陷深度分析、GTO Wizard是否攻克扑克的冷静提醒、普通玩家定心丸与5道实战测试题。
以下内容仅限德扑荟VIP会员阅读。
一、GTO Wizard AI什么来头?从Ruse AI到扑克AI新王
你可能想问:这个GTO Wizard AI凭啥这么狂?能把GPT-5.4这种级别的模型虐出将近-200BB/100?
故事得从2023年说起。
那一年,GTO Wizard收购了一家名叫Ruse AI的公司。这家公司由两个加拿大小伙Philippe Beardsell和Marc-Antoine Provost在一年前创立,专门做扑克求解器。别看公司小,它干了一件震动扑克AI圈的大事——
打爆了当年的计算机扑克冠军Slumbot。
Ruse AI vs Slumbot:15万手牌的屠杀
那场比赛有多残暴?双方打了15万手牌,每手牌平均思考时间不超过7秒,每手牌后记分牌重置为200BB。结果Ruse AI以19.4 BB/100的赢率碾压对手,创下纪录。
19.4 BB/100是什么概念?在AI对AI的高水平对决中,通常赢率超过2 BB/100就已经是显著优势了。19.4属于“降维打击”级别。
关键差距在打法上。Slumbot也在试图接近纳什均衡(Nash Equilibrium),但它的问题是死板——它不会主动调整策略,也不会利用对手的错误。它就像一个背熟了GTO表格的书呆子,不管对手是谁,永远按同一套剧本出牌。
而Ruse AI会实时分析每一手牌的具体情境,动态求解。它能识别对手偏离GTO的漏洞,并针对性地剥削。说白了,一个死背公式,一个活学活用。
GTO Wizard拿到这个技术之后,如虎添翼。他们把Ruse AI的引擎整合进自己的求解器生态,这才有了后来单挑20多个大语言模型的底气。
二、LLM打牌为什么烂到令人发指?四大致命缺陷
这就让人纳闷了:这些大语言模型不是能写代码、能考律师证、能通过图灵测试吗?怎么打个扑克就集体翻车了?
GTO Wizard总结了四个核心原因,荟长一条一条给你讲清楚。
缺陷1:隐藏信息(Hidden Information)——不完全信息博弈的降维打击
LLM的强项是什么?处理显性信息。你给它们一段代码,它们能找出bug;你给它们一道数学题,它们能推导出答案。因为这些任务的信息是完整的、确定的、给定的。
但扑克的本质是什么?不完全信息博弈(Imperfect Information Game)。你看不到对手的底牌,看不到对手的心理活动,甚至看不到对手过去的完整手牌历史(除非你专门输入)。
LLM在面对隐藏信息时,会做出一系列让人啼笑皆非的决策。比如:
- 对手在干燥牌面上下注,LLM因为”不确定对手有没有强牌”,选择用中等对子跟注到底,结果被更好的牌收割;
- LLM拿着坚果同花,却因为”担心对手有更大的同花”而过牌,白白放弃价值;
- LLM在河牌圈面对一个明显的诈唬,却因为”无法确认对手是否在诈唬”而过度弃牌。
这些问题在人类玩家身上也存在,但人类有直觉、有读牌经验、有对手建模能力。LLM没有。它们只能基于”可见信息”做推理,而扑克桌上80%的关键信息是隐藏的。
缺陷2:范围平衡(Range Balance)——几千个决策点的逻辑崩塌
这是GTO策略的核心,也是LLM的噩梦。
在单挑扑克中,你在每一个决策点(翻牌前、翻牌圈、转牌圈、河牌圈,每个圈又有下注/跟注/加注/弃牌等选项)都需要保持范围的一致性。也就是说,你的某一个动作(比如翻牌圈持续下注70%底池),必须由一组平衡的牌来执行——这组牌里要有价值牌(强牌)、诈唬牌(弱牌)、以及一部分”无所谓”的牌(中等牌力)。
LLM的问题在于,它们的逻辑连贯性在长链条决策中会崩盘。它们可能在翻牌圈用正确的范围下注,但到了转牌圈,因为”上下文窗口”的限制或推理深度的不足,突然开始用完全不同的逻辑处理同一手牌。这种跨街不一致(Street Inconsistency),在对手眼里就是明晃晃的漏洞。
GTO Wizard在测试中发现,LLM在单挑桌上大约每10手牌就会出现一次明显的范围失衡——要么连续用弱牌诈唬被抓住,要么连续用强牌价值下注吓跑对手。
缺陷3:长期规划(Long-term Planning)——单步推理的先天残疾
LLM的架构决定了它们擅长单步推理(Single-step Reasoning):输入一个问题,输出一个答案。但扑克需要的是多步规划(Multi-step Planning):翻牌圈的一个下注,会影响转牌圈底池大小、会影响河牌圈筹码深度、会影响对手对你整个范围的判断。
举个例子:你在翻牌圈用一手听牌下注,计划是”如果转牌中了就价值下注,没中就诈唬”。这个计划在人类大脑里是一瞬间完成的,但LLM需要显式地构建这个推理链。而当你要求LLM同时管理几十种不同牌型的”翻牌圈计划→转牌圈计划→河牌圈计划”时,它的推理链会指数级爆炸,最终输出一堆自相矛盾的决策。
更搞笑的是,实验发现这些大模型大约有2%的概率会读错自己的手牌——把同花和不同花搞混,把顺子听牌当成成牌,把一对当成两对……你能想象吗?一个能解偏微分方程的AI,竟然分不清自己手里是不是同花?
缺陷4:深度不确定性下的对手建模(Opponent Modeling)——没有”心智”的超纲题
这是最高阶的缺陷,也是人类玩家相对于AI的最后护城河。
顶尖人类牌手在单挑时,会不断构建和更新对对手的心智模型(Mental Model):他是激进型还是被动型?他刚才那手牌是不是诈唬?他在压力下会不会情绪失控?他有没有明显的”tilt”倾向?
LLM没有”心智”,也没有”情绪”。它们无法真正理解”对手是人”这个概念,只能在极其有限的上下文里做一些统计模式匹配。比如:”对手过去10手牌下注了7次,所以他很激进。”但这种统计在样本量不足时毫无意义(10手牌在统计学上等于零),而且LLM无法区分”对手真的激进”和”对手恰好拿到了10手强牌”。
负责审计Gemini和Grok的Cesar Enrique Aponte Rivas在X上说了句大实话:
三、GTO Wizard AI到底有没有”攻克”扑克?四个冷静提醒
GTO Wizard的开发者放话了:“GTO Wizard AI执行的是近乎完美的纳什均衡策略”,”没有人类能在有意义的样本量下击败它。”
这话听起来挺吓人的。但你先别急着卖记分牌。荟长给你四个冷静提醒。
提醒1:目前只测试了单挑无限注德州
扑克的世界远不止单挑。还有六人桌、九人桌、奥马哈(PLO)、混合游戏(Mixed Games)、短牌(Short Deck)……每种游戏的复杂度都不一样。
单挑被攻克,不代表其他形式也被攻克。事实上,多人桌扑克的复杂度随着玩家数量呈指数级增长——九人桌的博弈树规模,可能是单挑的百万倍甚至亿倍。GTO Wizard AI在单挑上的表现,无法直接外推到多人桌。
提醒2:它还没和真正的顶级职业牌手公开较量过
虐一虐大语言模型是一回事,和Phil Ivey、Fedor Holz、Stephen Chidwick这种级别的选手过招是另一回事。
人类顶尖牌手有AI难以模拟的优势:直觉(Intuition)——基于数十万手牌经验形成的”感觉”;心理战(Psychological Warfare)——通过下注节奏、聊天、表情(线下)传递假信息;情绪控制(Emotional Control)——在长时间session中保持专注和决策质量;动态调整(Dynamic Adjustment)——在几手牌之内识别对手漏洞并切换剥削模式。
AI可以模拟GTO,但很难模拟”人类的不可预测性”。
提醒3:GTO Wizard AI不是公开工具
这只是GTO Wizard求解器背后的引擎,普通玩家用不了。开发团队之外的人,连摸都摸不到。你在线上扑克室遇到的对手,99.999%不可能在使用这个级别的AI。
市面上那些声称”AI辅助打牌”的工具,大多是垃圾——要么是基于简单规则的脚本,要么是低水平的Solver输出,和GTO Wizard AI差了至少十个世代。
提醒4:所有线上扑克室都禁止使用求解器
这是最关键的现实约束。PokerStars、GGPoker、partypoker等主流平台的安全团队,不光监控你的桌面,连后台进程都不放过。用AI辅助打牌,封号是分分钟的事,而且通常是永久封号+资金没收。
所以即使有人拿到了GTO Wizard AI级别的工具,他也不敢在线上使用。线下私人局?那是另一回事,但线下有线下的问题(需要硬件接入、需要避开监控摄像头等)。
任何在线上平台使用求解器、AI辅助决策、实时计算工具的行为,都属于严格禁止的作弊。
平台检测技术已经进化到可以识别屏幕抓取、内存读取、异常决策模式。
别为了短期利益毁掉账号和声誉。真正的高手,靠的是脑子,不是外挂。
四、给普通玩家的定心丸:AI越热闹,人类越值钱
读到这里的你,应该松一口气了。
为什么?因为实验揭示了一个被很多人忽略的事实:目前所有面向公众开放的大语言模型,打牌都烂到了令人发指的程度。
-16 BB/100的输率,在低级别都能把用户打破产。-189 BB/100?那简直是慈善家级别的送钱速度。
这意味着什么?你在线上扑克室遇到的那些”可疑”对手,但凡他敢说自己用ChatGPT、Gemini或者任何LLM来辅助决策,你就偷着乐吧——他基本上是来送钱的。
荟长给你算笔账:假设你在NL50(盲注0.25/0.5美元)打6人桌,每100手牌大约打50BB的底池。如果对手用GPT-5.3辅助决策,输率-16 BB/100,相当于每100手牌他稳定送你8美元。你一天打500手牌,他一天送你40美元。一个月下来,他给你发了一千多美元的红包。
所以别听风就是雨。AI在扑克领域的进步是事实,但它离“普通玩家随手可得的作弊工具”还差着十万八千里。
真正的高手,从来不是靠背GTO表格提升决策质量的
这句话荟长要强调三遍。
GTO是防守基准线,不是进攻武器。GTO告诉你”在完美对手面前,你不该被剥削”;但它不告诉你”在面对漏洞百出的对手时,如何最大化剥削”。
而后者,恰恰是人类玩家的金矿。
读人、调整、情绪控制、资金管理、tilt管理、session选择、牌桌选择——这些才是普通玩家可以建立优势的地方。这些能力没有一个是LLM当前具备的,也没有一个是Solver能直接教给你的。
GTO Wizard AI能击败LLM,不是因为LLM”不够聪明”,而是因为扑克不是智商测试,而是人性测试。在这个战场上,有心脏、有脑子、有经验的人类,仍然是王者。
总结:AI扑克时代的五条生存法则
好,唠了这么多,荟长给你提炼五条硬核结论,直接截图保存:
① LLM在扑克桌上就是来送钱的。GPT-5.4输率-189 BB/100,GPT-5.3输率-16 BB/100,所有公开LLM均被GTO Wizard AI碾压。你的对手如果用ChatGPT打牌,请笑着收记分牌。
② LLM的四大致命缺陷:隐藏信息处理无能、范围平衡逻辑崩塌、长期规划链条断裂、对手建模能力为零。这些缺陷根植于LLM的架构,短期内无法解决。
③ GTO Wizard AI虽强,但尚未”攻克”扑克。目前仅验证于单挑NLH,未与顶尖人类公开较量,且非公开工具。多人桌的复杂度仍是AI的未竟之地。
④ 线上平台严禁求解器,检测技术已非常成熟。不要尝试用任何AI工具辅助线上决策,封号+没收资金是标准处罚。
⑤ 人类的核心优势不可替代:读人、动态调整、情绪控制、资金管理、tilt管理。这些是LLM和Solver教不会的,也是你提升决策质量的真正护城河。
在德扑荟,我们不止教你打牌,更教你在AI时代做不可替代的扑克人。
AI扑克观察室,陪你从”怕被AI取代”进化到”让AI给你送钱”。
◆ AI扑克观察室 · 实战测试 ◆
答对全部题目,才算真正吃透AI扑克的现状与边界。点击题目下方按钮查看答案与解析。
查看答案与解析
原文明确提到,表现最好的GPT-5.3(超高推理模式)输了-16 BB/100。顶尖职业牌手能稳定盈利4 BB/100就已经是神级存在,-16 BB/100意味着这个AI的输钱速度是顶级人类提升决策质量速度的4倍。
在低级别实战(如NL25、NL50)中,-16 BB/100的输率足以让玩家在几周内清空资金。以NL50为例,每100手牌大约打50BB的底池,-16 BB/100相当于每100手牌稳定亏损8美元。一天打500手牌就是亏40美元,一个月下来亏损近千美元。选项A的-1.6过于乐观;选项C的-160混淆了GPT-5.4 Nano的-189.7数据;选项D的正负号完全颠倒。
查看答案与解析
题目问的是“LLM架构的先天残疾”。四大缺陷中,“长期规划”最直接指向LLM的架构限制——LLM基于Transformer架构,核心优势是单步推理(Single-step Reasoning):输入一个问题,输出一个答案。但扑克需要的是多步规划(Multi-step Planning):翻牌圈决策会影响转牌圈底池大小、河牌圈筹码深度、对手的范围判断等。
当LLM需要同时管理几十种不同牌型的”翻牌圈计划→转牌圈计划→河牌圈计划”时,其推理链会指数级爆炸,输出自相矛盾的决策。这是根植于LLM架构的根本限制,不是增加训练数据就能解决的。选项A的隐藏信息问题是扑克本身的性质,不是LLM独有的”先天残疾”;选项B的范围失衡是长期规划失败的后果而非根源;选项D的对手建模缺失虽然也是架构限制,但”没有心智”更多是哲学层面的描述,而”单步推理无法处理多步规划”是更精确的架构层面诊断。
查看答案与解析
原文明确指出,Slumbot也在试图接近纳什均衡,但它不会主动调整策略,也不会利用对手的错误——它就像一个死背GTO表格的书呆子,永远按同一套剧本出牌。而Ruse AI会实时分析每一手牌的具体情境,动态求解,能识别对手偏离GTO的漏洞并针对性剥削。
原文用了一个精妙的比喻:“一个死背公式,一个活学活用”。这才是19.4 BB/100碾压级赢率的技术根源。选项A的硬件优势未被原文提及;选项C纯属恶搞;选项D的量子计算机是科幻概念,与本文无关。
查看答案与解析
原文明确列出了四个限制条件,其中“目前只测试了单挑无限注德州”是核心限制。文章指出:扑克还有六人桌、九人桌、奥马哈、混合游戏等形式,每种游戏的复杂度都不一样。单挑被攻克不代表其他形式也被攻克。事实上,多人桌扑克的复杂度随玩家数量呈指数级增长,九人桌的博弈树规模可能是单挑的百万倍甚至亿倍。
选项A与原文完全相反——GTO Wizard AI不是公开工具,普通玩家用不了;选项C与原文相反——它还没和真正的顶级职业牌手公开较量过;选项D与事实相反——所有线上平台都禁止使用求解器,GTO Wizard AI若被使用属于作弊行为。
查看答案与解析
文章最后部分的核心论点是“AI越热闹,人类越值钱”。原文明确指出:所有公开LLM的打牌水平都烂到令人发指,-16 BB/100甚至-189 BB/100的输率意味着用LLM辅助的对手基本是来送钱的。同时,文章强调真正的高手从来不是靠背GTO表格提升决策质量的——读人、调整、情绪控制、资金管理、tilt管理这些能力,是LLM和Solver教不会的,也是人类玩家的真正护城河。
文章最后一句更是直接点题:“扑克没有被AI解决,你的对手也没有外挂。安安心心打你的牌,该咋呼咋呼,该弃牌弃牌。” 选项A的恐慌心态与文章主旨完全相反;选项C的自行开发AI既不现实也违背平台规则;选项D的”AI合法化”与原文明确提到的”所有线上平台严禁求解器”直接矛盾。
德扑荟 DPH · 中国扑克内容第一站









评论 ( 0 )