基于深度神经网络的桥牌叫牌策略研究

2026-07-30 17:24:55

在机器博弈研究领域中,完备信息下的博弈已经取得突出的成就,如国际象棋‎[1]、围棋‎[2]。然而,非完备信息博弈由于信息不对称性和庞大的搜索空间,使得许多搜索算法难以应用。在信息不完备的情况下,进行正确的评估和决策变得更加困难。目前,研究主要集中在德州扑克‎[3−4]、斗地主[5−6]、麻将[7−8]、桥牌[9−10]等领域‎[11]。桥牌是规则最为复杂、最具代表性的非完备信息博弈游戏之一。其特点包括隐藏的大量信息、分阶段的游戏过程以及合作与对抗的共存,这些特性使得桥牌博弈更贴近现实生活中的许多博弈场景。研究桥牌等非完备信息博弈游戏,不仅能推动人工智能在现实场景中的应用,还能启发人们对人工智能在其他领域的研究和应用‎‎[12]。

桥牌游戏过程分为2个阶段:叫牌和打牌。在实际的比赛中,专家级队伍的打牌水平一般都不分上下,叫牌更能决定一个队伍的输赢。在机器博弈领域同样如此,如WBridge5‎[13]、新睿桥牌等桥牌程序在打牌阶段都已经能达到甚至超越专家级水平,但是在叫牌阶段的水平还远远落后,所以越来越多的研究都以叫牌为对象。叫牌阶段的研究主要有以下方法:基于专家经验的学习算法、以机器自博弈形式为基础的强化学习算法、将搜索和局面评估相结合的蒙特卡洛采样算法。目前叫牌方面的研究大多数是针对无争叫场景的,但是实际比赛中是有争叫的,己方在传递叫品信息时很容易受到对方的干扰,所以为了能够更加贴合实际场景并且提高叫牌的可靠性,本文针对有竞争的叫牌提出了一种利用门控循环单元(gate recurrent unit,GRU)网络进行叫牌预测的模型。

1.

定约桥牌规则

定约桥牌,简称桥牌,是一种4人参与的纸牌游戏,使用去掉大小王的标准52张牌。4位玩家(东家、北家、西家、南家)按照东西、南北分为2个队伍进行对抗。游戏分为叫牌和打牌2个阶段。

1.1

叫牌规则

叫牌阶段确定一局游戏的定约,包括阶数和花色,同时相应的定约方、庄家等信息也随之确定。桥牌叫品共38个,包括35个实质性叫品和3个非实质性叫品。实质性叫品由阶数加花色组成,阶数为1~7,花色为梅花、方块、红桃、黑桃和无将,从小到大依次为1♣、1♦、1♥、1♠、1NT、2♣、2♦、…、7♥、7♠、7NT。非实质性叫品包括3个:加倍(X)、再加倍(XX)和过牌(PASS)。

叫牌从首叫人开始,再由他的下家(左方)叫牌,依次顺时针轮流进行。如果4家全都不叫,则这副牌作废,由下家重新发牌。

叫品有3方面的约束:1)要比前一家的叫品大;2)叫品要符合己方约定卡上的规则,也就是要符合己方使用的叫牌体系;3)叫牌中还有一些限制,比如加倍只能出现在实质性叫品之后等。当叫牌过程中已经出现实质性叫品时,再出现连续的3个PASS便表示叫牌结束。但要,开局连续的3个PASS不代表叫牌结束,开局连续的4个PASS才表示叫牌结束,这种方式结束之后,不会进入打牌阶段,本局双方都记为0分,直接进行下一局游戏。叫牌的目的是使同伴之间互通牌情,以便找到最佳定约,或者干扰对方选择出最有利的定约,以此达到战胜敌方的目的。

当叫牌阶段正常结束时,最后一个实质性叫品被称为定约,决定了定约方完成定约会赢得多少墩(在桥牌打牌过程中,4家各打1张牌称为1墩)。叫出定约叫品的一方是定约方,其目的是完成定约;另一方则是防守方,其目标是阻止敌方完成定约。首次叫出定约花色的玩家被称为庄家。

定约分为有将定约和无将定约。有将定约是确定梅花、方块、红桃、黑桃中的某一种花色作为将牌。将牌在一轮出牌中比其他任何花色的牌都要大,一轮出牌中以将牌压制其他3名玩家称为将吃。无将定约则是没有将牌,其输赢指根据同一花色中的牌点的大小来确定,若没有此花色的牌,可以任意出一张其他花色的牌,这称为垫牌,不论大小,这一轮出牌都不会获得胜利。

1.2

打牌规则

打牌阶段分为13轮,每一轮中每一位玩家都要打出一张牌。庄家的下一家打出第一张牌,然后按照顺时针的方向其他玩家依次出牌,同时庄家的队友,也就是庄家的对家需要把手牌亮出来,成为明牌,明牌的该玩家称为明手。后续的每一轮都由上一轮的获胜者引出第一张牌,并且引出的牌可以是任意花色、任意大小,但是引出的花色是作为这一轮的主花色,其他玩家手里有该花色的牌时,必须打该花色的牌;手里没有该花色的牌时,可以随便打一张其他颜色的手牌,这包括2种情况:打出将牌或打出非将牌非该花色的牌。每一轮中将牌大于这一轮的主花色,主花色又大于其他的非将牌花色。每赢得一轮游戏,则称赢得了一墩。

1.3

计分规则

在打牌阶段结束后进行计分。分数由3部分组成:墩分、奖分、罚分。墩分也称基本分,指定约方完成定约的情况下,按照花色等级,获得一定的分数。如果定约被加倍,则分数翻倍;如果再加倍,则分数翻2倍。当定约得墩分达到100分及以上,则称为成局定约。奖分是指定约方超额完成定约的情况下,每超一墩都会有额外的奖励分数。当完成满贯定约时还有额外的奖分。若定约方未完成定约,则要进行罚分,也称为宕分,同时这也是防守方击破定约所获得的分数。定约方距离完成定约差几墩就称宕几墩,每宕一墩则会有相应的罚分,根据是否是有局方、是否加倍等罚分会有相应的翻倍。

在比赛中通常采用复式赛制,可以更好地反映选手实力。2个队伍各4名队员分别位于一张牌桌的东西方和另一张牌桌的南北方,同时打一副牌。最后将双方每副牌的分差按照规则转换为国际比赛分(international match point,IMP),再将双方所获总IMP之差折合成胜利分(victory point,VP)。

2.

相关研究

2.1

非完备信息博弈

近年来,完备信息博弈随着深度学习、强化学习的发展在多种棋类游戏中取得了突破性的成就,如国际象棋和围棋。1997年,IBM的“深蓝”击败国际象棋冠军卡斯帕罗夫,这是人工智能在完全信息博弈领域取得的重大突破之一‎‎[14]。2016年,AlphaGo在围棋比赛中战胜了世界冠军李世石,这标志着一直以来因为搜索空间巨大发展缓慢的围棋也被攻克,将人工智能又一次推向了热潮‎[15]。完全信息博弈领域中智能体已经达到并且超过了人类专家的水平。

非完备信息博弈的研究相对来说起步较晚,并且存在着信息的不对称性、庞大的搜索空间,导致许多搜索算法无法使用,在信息不完备的情况下做出正确的评估与决策也变得愈加困难。之前非完备信息的研究主要集中在德州扑克上,也取得了不错的进展。Brown等‎[3]和Moravčík 等[4]的研究成果在2人无限注德州扑克中击败了职业选手,取得了重要突破。2019年,Brown等‎‎[16]的研究成果在6人德州扑克上战胜了职业选手。不过由于其隐藏信息极大,多人德州扑克的研究仍然存在着许多挑战。在其他的棋牌类游戏中,非完备信息博弈的研究还很少能取得突破性进展。

2.2

叫牌研究方法

桥牌作为典型的非完备信息博弈游戏代表之一,其最主要、也最有挑战性的内容是叫牌截断,目前其研究还未能达到人类专家级水平,而打牌阶段的研究已经能达到甚至超过人类专家级水平,所以本文以有竞争的叫牌为研究对象。

对于叫牌的研究方法大致可以分为基于人类已有叫牌体系和不基于人类已有的叫牌体系‎[17],二者的区别在于模型的训练中是否遵循人类的叫牌体系规则。基于人类已有叫牌体系的研究根据信息是否完备化又可以分为2种:叫牌搜索与状态评估结合的蒙特卡洛叫牌算法和基于专家经验的监督学习算法。如Amit等‎[18]利用蒙特卡洛采样的方法来克服非完备性,提出了面向无争叫的叫牌策略,但由于现实中缺乏足够的资源,结果的精度和稳定性很难保证。2019年,Rong等‎‎‎[19]提出了一种基于深度学习、采用2个神经网络实现的叫牌系统,2个网络分别用于预测队友的手牌信息和下一步叫牌动作,取得了较好的效果。不基于人类已有的叫牌体系主要是机器通过自博弈学习叫牌,如Ho等‎[20]提出的不基于人类叫牌体系的叫牌框架,但是5次叫牌后程序就会强制结束。Yeh等‎‎[21]提出的深度强化学习算法,面向无争叫叫牌,直接从原始数据提取特征训练网络,采用置信上限算法来平衡探索和利用问题。

基于专家经验的监督学习算法通常是基于现有的人类叫牌体系,使用人类顶级玩家对抗的数据,通过深度学习、强化学习等方法对数据进行训练,得到叫牌动作的概率分布从而更好地对下一步叫牌动作进行预测。这种方法通过模型的训练来学习叫牌体系包含的规则,避免了人为的设置大量规则,不过需要大量的比赛数据‎[22]。叫牌搜索和状态评估结合的叫牌算法一般包括叫牌搜索算法和局面评估算法,叫牌搜索算法搜索在当前局面状态下下一步可能的叫牌动作,状态评估算法对上面各个可能的叫牌动作进行评估,最后根据评估的结果选择一个最适合的叫牌动作。不基于人类已有的叫牌体系的研究方法最后得出的叫牌模型无法对给出的叫品做出解释,这与现实桥牌比赛中的要求每一个叫品的选择都要对应着一定的含义并做出合理的解释这一点相悖,因此该研究方法得出的叫牌模型应用面比较窄,更多的研究还是以人类已有的叫牌体系为基准展开的。文章采用基于专家经验的学习算法,从顶级玩家对局的数据中学习训练出一个叫牌模型。

3.

模型架构

大多数传统叫牌系统都过度关注当前的叫牌动作,仅仅基于当前时刻的叫品做出下一步预测。而桥牌叫牌本就是一个队友之间互相沟通协作、对手之间互相抗衡竞争的过程,玩家通过叫品的选择来完成信息的传递,所以叫牌历史序列中隐藏着许多能够被利用的信息。循环神经网络能很好地处理这个问题,可以捕捉到序列之间存在的关系,从而叫出一个合理的叫品。对于传统的循环神经网络(recurrent neural networks,RNN)在处理长序列时面临着长期依赖问题,会产生梯度爆炸和梯度消失,而GRU和长短期记忆网络(long short-term memory,LSTM)则很好地缓解了这个问题,GRU相对于LSTM结构又更加精简,性能差距不大,所以本文针对有争叫的定约桥牌叫牌提出了一种基于深度循环神经网络GRU的叫牌预测模型。此外,桥牌叫牌过程要求玩家对所选择的叫品做出合理的解释,所以在预测叫牌的同时,也预测了队友手牌的手牌特征,包括大牌点、各花色的牌张数,以便可以更好地理解所选叫品的含义。

GRU模型中有2个门,更新门和重置门。更新门用来控制前一时刻的状态信息被带入当前状态的程度,即更新门帮助模型决定到底要将多少过去的信息传递过来,更新记忆。重置门则决定如何将新的输入信息与前面的记忆相结合。相关公式为

$$ {{\boldsymbol{z}}_t} = \sigma ({{\boldsymbol{W}}_z} \cdot [{{\boldsymbol{h}}_{t - 1}},{{\boldsymbol{x}}_t}]) $$

$$ {{\boldsymbol{r}}_t} = \sigma ({{\boldsymbol{W}}_r} \cdot [{{\boldsymbol{h}}_{t - 1}},{{\boldsymbol{x}}_t}]) $$

$$ {\widetilde {\boldsymbol{h}}_t} = \tanh ({\boldsymbol{W}} \cdot [{{\boldsymbol{r}}_t} * {{\boldsymbol{h}}_{t - 1}},{{\boldsymbol{x}}_t}]) $$

$$ {{\boldsymbol{h}}_t} = (1 - {{\boldsymbol{z}}_t}) * {{\boldsymbol{h}}_{t - 1}} + {{\boldsymbol{z}}_t} * {\widetilde {\boldsymbol{h}}_t} $$

式中:$ {{\boldsymbol{z}}}_{t} $为更新门,$ {{\boldsymbol{r}}}_{t} $为重置门,$ {\stackrel{~}{{\boldsymbol{h}}}}_{t} $为候选隐藏状态,$ {{\boldsymbol{h}}}_{t} $为传递到下一时刻的隐藏状态,$ {{\boldsymbol{x}}}_{t} $为当前时刻的输入信息,$ \sigma $为sigmoid函数,可以将数据变为[0,1]范围的数值,$ \mathrm{t}\mathrm{a}\mathrm{n}\mathrm{h} $为$ \mathrm{t}\mathrm{a}\mathrm{n}\mathrm{h} $函数,可以将数据变为[−1,1]范围的数值,$ {\boldsymbol{W}}_z $、$ {{{\boldsymbol{W}}}}_{r} $、$ {{\boldsymbol{W}}} $为权重矩阵。

GRU的输入是一个序列{x1, x2, … , xn},输出包括2个部分,序列{y1, y2, … , yn,}和hn,其中xn为时刻n的输入信息,yn为时刻n隐藏层的输出,hn为最后一个时刻隐藏层的输出。叫牌模型的输入是一场专家对局的叫牌历史序列BL和手牌信息Di,BL表示长度为L的叫牌序列,Di为玩家i的手牌信息。由于叫牌过程中不止自己叫牌,所以需要一个位置信息来标记玩家i的出牌轮次,只有预测该轮次的叫牌才能更好地从叫牌序列中学习到更加准确的信息,从而作出更精确的叫牌预测。输入数据的格式如图1所示。

1

数据编码

下载:

全尺寸图片

数据由52位编码的玩家i的手牌信息、38位编码的叫牌动作、4位编码的局况信息、1位编码的位置信息组成。数据先经过嵌入层进行编码,提高表征能力并增强数据之间的序列关系的捕捉能力;然后通过一个3层堆叠的GRU层,将隐层的特征输出输入到多个全连接层进行分类预测叫牌动作和队友手牌特征,包括大牌点和各花色牌张数。模型通过对2部分子任务的训练来学习并更新参数,也是一个多任务学习模型。模型的结构图如图2所示,bid为叫牌序列,Embedding layer为嵌入层,bid_input为嵌入层处理之后的结果。Input为输入,由bid_input和玩家手牌(Xi)组成。GRU Layers为GRU网络层,Classifier为分类器,Bid Classifier为叫牌分类器,Partner Hand Classifiers为队友手牌分类器。Outputs为输出结果,bid_pre为叫牌预测序列,hcp、card_amount分别为大牌点、手牌张数。Position表示是否轮到当前玩家叫牌。

2

模型架构

下载:

全尺寸图片

在桥牌中,叫品包含实质性叫品和非实质性叫品一起共有38个,所以模型对于叫牌动作的预测输出是一个大小为38的概率分布,表示下一步叫牌叫出每一个叫品的概率,相当于是一个分类任务,而大牌点、各花色牌张数也是如此,因此选择了交叉熵损失L作为各个分类器的损失函数,公式为

$$ L = \frac{{\displaystyle\sum\limits_{n = 1}^N {{l_n}} }}{{\displaystyle\sum\limits_{n = 1}^N {{w_{{y_n}}}} }} $$

$$ {l_n} = - {w_{{y_n}}}\log \frac{{\exp ({x_n},{y_n})}}{{\displaystyle\sum\limits_{c = 1}^C {\exp ({x_{nc}})} }} $$

式中:w为各个类别的权重,c为类别的种数,N为每次迭代所使用的样本量(batch_size)的大小,x为模型的预测输出,y为真实标签数据,$ {l}_{n} $为第n个时刻的损失。由于多任务学习中,多个子任务需要共享GRU的参数,最后总的损失函数为TL:

$$ {T_L} = \frac{1}{N}\sum\limits_{i = 1}^N {{L_i}} $$

式中:Li为各个预测任务计算所得的损失,N为预测任务的个数。

4.

实验设计与结果分析

文章基于专家数据训练了一个有争叫的桥牌叫牌模型。首先对实验的数据进行可行性分析;然后对嵌入维度、网络模型、网络层数、隐层大小等超参数进行对比实验,并给出各种情况下的模型叫牌预测的准确率,以便找到最佳的超参数组合。

4.1

实验数据

实验数据来自一些赛事的对局记录,由于某些对局记录中存在着诸多不必要信息以及记录不完整等信息,最后将数据筛选、去除之后生成了将近10万条叫牌数据。在实验中,将其中70%的数据作为训练集进行模型的训练;20%的数据作为验证集,进行超参数的拟合并确定网络的结构;10%的数据作为测试集,用来评估最终模型的性能。每一条实验数据都包含玩家的手牌信息、一场对局的完整叫牌历史、局况等信息,然后再对各部分信息进行编码处理成模型需要的输入格式进行训练。

实验数据中所有的叫牌序列长度的分布如图3所示,从中可以看出,叫牌序列的长度大部分集中在8~14,长度过短和过长的占比都较小。实验数据中各个叫品的数量占比如图4所示,由此可知,专家在进行叫品选择时大多数倾向于4阶及以下,并且方块和梅花被选择的次数相对来说要少一点。数据中的大牌点分布如图5所示,手牌的大牌点大多数集中在6~13,没有过分的偏差,具有一定的代表性。

3

叫牌序列长度分布

下载:

全尺寸图片

4

叫品分布

下载:

全尺寸图片

5

大牌点分布

下载:

全尺寸图片

4.2

网络训练

训练数据中的每一条数据都包含着叫牌动作等信息,首先将叫牌动作经过嵌入层编码成一个固定大小的向量,然后将该向量与手牌信息等结合起来作为模型的输入。输入信息经过一系列的处理之后用于叫牌决策和手牌特征的预测。从不同网络、嵌入层维度、GRU网络层数等多个方面进行实验的设计与分析。所有实验都是运行在CPU上,并且每个模型的训练都迭代70轮次。

首先,对于RNN和GRU网络进行了对比实验,以叫牌准确率作为评价指标,对比结果如图6所示。从图中可以看出,使用RNN、GRU这2种网络结构的模型之间存在着较大的差异,GRU模型的叫牌预测的准确率比RNN网络结构的模型要更高,效果更好,所以模型的网络结构选取了GRU。

6

RNN、GRU对比

下载:

全尺寸图片

合适的嵌入向量维度可以提高叫牌动作之间关系的捕捉能力。根据实验数据中叫牌长度等信息,设计了嵌入向量为64维、128维、256维的一组对照实验,结果如图7所示,嵌入向量为128维的情况下模型的叫牌准确率要高于另外2种情况。

7

嵌入层维度对比

下载:

全尺寸图片

另外,为了验证GRU堆叠层数对模型性能的影响,实验设置了1、3、5层的对比实验,如图8所示,3 层堆叠网络情况下的模型性能要优于其他2种。

8

GRU层数对比

下载:

全尺寸图片

最后设置了一组隐层大小的对比实验,如图9所示,模型在隐层大小为512的情况下表现更加稳定,叫牌准确率相对来说更高。

9

隐层大小对比

下载:

全尺寸图片

5.

结束语

定约桥牌作为最具挑战性的非完备信息机器博弈游戏之一,其叫牌方面的研究具有重大的意义。论文基于收集的近10万条真实比赛数据设计了一种基于GRU网络的有争叫叫牌预测模型,并且还可以进行手牌特征的预测,以便更好地理解叫品的含义。实验表明,模型对于叫牌的预测可以达到一个相对较好的准确率,利用循环神经网络可以更好地捕捉叫牌序列之间的关系,这一设计可以为后续的研究提供一个方向指导。但是该模型还存在着较大的改进空间,后续将优化网络的结构以缩短模型的训练时长,并且将该网络与自博弈相结合起来,提高模型的性能表现。

如何申请专利详细步骤?2025年最新分阶段指南与法律依据
美的301升冰柜评测:大容量与节能设计的完美结合,家用冷冻的理想选择