Este problema de teoria dos jogos vai mudar a forma como vês o mundo
Descrição
Este é um vídeo sobre o problema mais famoso da Teoria dos Jogos, o Dilema do Prisioneiro. Aceda a https://brilliant.org/veritasium para iniciar a sua avaliação gratuita de 30 dias, e as primeiras 200 pessoas recebem 20% de desconto numa subscrição premium anual. Em 2025, lançámos o jogo Elements of Truth no Kickstarter e ficámos encantados com a resposta. Estamos agora nas fases finais de produção, com as recompensas do Kickstarter a serem enviadas em breve. Se perdeu a campanha, já pode pré-encomendar a edição de venda ao público através do nosso novo website aqui -https://ve42.co/GameTheoryDesc Um agradecimento especial aos nossos apoiantes no Patreon! Junte-se à comunidade para nos ajudar a manter os nossos vídeos gratuitos, para sempre: https://ve42.co/PatreonDEB Se procura um kit de modelação molecular, experimente Snatoms – um kit que inventei onde os átomos se encaixam magneticamente – https://ve42.co/SnatomsV ▀▀▀ Um enorme agradecimento ao Prof. Robert Axelrod e ao Prof. Steven Strogatz pela sua perícia e tempo. Para ler mais sobre a Paixão pela Cooperação do Prof. Axelrod, visite: https://ve42.co/Axelrod2023 Um enorme agradecimento ao maravilhoso Nicky Case. O jogo "The Evolution of Trust" do Nicky foi uma enorme inspiração para este vídeo. Recomendamos vivamente que jogue este excelente jogo, em: https://ncase.me/trust/ Um enorme agradecimento àqueles que nos ajudaram a compreender e a verificar factos de diferentes partes deste tópico - Dr. Christian Hilbe, Dr. Vincent Knight, Dr. Jelena Grujic, Prof. Andreas Diekmann, e Dr. Alexander Stewart. ▀▀▀ Referências: Excellent game on the evolution of trust by Nicky Case - https://ve42.co/Case2023 Summary of Axelrod’s work by This Place - https://www.youtube.com/watch?v=BOvAbjfJ0x0 How to outsmart the Prisoner’s Dilemma by TED-Ed - https://www.youtube.com/watch?v=emyi4z-O0ls&pp=ygUScHJpc29uZXIncyBkaWxlbW1h Tit for Tat by radiolab - https://ve42.co/T4T The Golden Rule by radiolab - https://ve42.co/GoldenRule Axelrod, R. (1984). The Evolution of Cooperation. Dawkins, R. (2016). The selfish gene. Oxford university press. Poundstone, W. (1992). Prisoner's Dilemma. William Poundstone. Nowak, M. A., & Highfield, R. (2011). Supercooperators. Edinburgh: Canongate. Binmore, K. (2007). Game theory: a very short introduction. OUP Oxford. Northrup, L. & Rock, D. (1966). The Detection of Joe I. - https://ve42.co/JOE1 Prisoner’s dilemma, Wikipedia - https://ve42.co/WikiPD Prisoner’s Dilemma, Stanford - https://ve42.co/StanfordPD Flood, M. M. (1952). Some experimental games. - https://ve42.co/Flood1952 Historical nuclear weapons stockpiles, Wikipedia - https://ve42.co/WikiNWS Goodwin, I. (1998). The Price of Victory in Cold War - https://ve42.co/Goodwin1998 Cold war: How it happened. - https://ve42.co/CW2014 Axelrod, R. (1980). Effective choice in the prisoner's dilemma. Journal of conflict resolution, 24(1), 3-25. - https://ve42.co/Axelrod1980a Axelrod, R. (1980). More effective choice in the prisoner's dilemma. Journal of conflict resolution, 24(3), 379-403. - https://ve42.co/Axelrod1980b Axelrod, R., & Hamilton, W. D. (1981). The evolution of cooperation. science, 211(4489), 1390-1396. https://ve42.co/Axelrod1981 Stanislav Petrov, Wikipedia - https://ve42.co/WikiSP Wu, J., & Axelrod, R. (1995). How to cope with noise in the iterated prisoner's dilemma. Journal of conflict resolution, 39(1), 183-189. - https://ve42.co/Wu1995 INF Treaty - https://ve42.co/INF START Treaties - https://ve42.co/START START I, Wikipedia - https://ve42.co/WikiSTART Imagens e Vídeo: Imagens históricas via rand.org - https://ve42.co/RAND Golden Balls - https://www.youtube.com/watch?v=S0qjK3TWZE8 Zotti, G., et al. (2021). The Simulated Sky: Stellarium for Cultural Astronomy Research - https://ve42.co/Stellarium Jornais da década de 1980 via Newspapers.com – https://ve42.co/Newspapers Imagem de bomba nuclear desativada via The Moscow Times - https://ve42.co/MT2012 Imagem de inspeção soviética via Bulletin of the Atomic Scientists - https://ve42.co/Krzyzaniak2019 Desativação de arma nuclear via ShareAmerica -
Transcrição completa
Este é um vídeo sobre o problema mais famoso na teoria dos jogos.
Problemas deste tipo surgem em todo o lado.
Desde nações em conflito até colegas de casa a lavar a loiça.
Até programas de jogos foram baseados neste conceito.
Descobrir a melhor estratégia pode significar a diferença entre a vida e a morte.
Guerra e paz, prosperidade e a destruição do planeta.
E na mecânica deste jogo, podemos encontrar a própria origem de um dos fenómenos mais inesperados da natureza.
Cooperação.
CAPÍTULO 1 AS CURIOSAS ORIGENS DO DILEMA DO PRISIONEIRO
A 3 de setembro de 1949, um avião americano de monitorização meteorológica recolheu amostras de ar sobre o Japão.
Nessas amostras, encontraram vestígios de material radioativo.
A Marinha recolheu e testou rapidamente amostras de água da chuva dos seus navios e bases em todo o mundo.
Também detetaram pequenas quantidades de Cério 141 e Ítrio 91.
Mas estes isótopos têm meias-vidas de um ou dois meses, por isso devem ter sido produzidos recentemente.
E o único lugar de onde poderiam ter vindo era uma explosão nuclear.
Mas os EUA não tinham realizado nenhum teste naquele ano.
Portanto, a única conclusão possível era que a União Soviética tinha descoberto como fazer uma bomba nuclear.
Esta era a notícia que os americanos temiam.
A sua supremacia militar, alcançada através do Projeto Manhattan, estava a desvanecer-se rapidamente.
Isto torna o problema da Europa Ocidental e dos Estados Unidos muito mais sério do que era antes.
E talvez torne a iminência da guerra maior.
Alguns pensaram que a melhor ação seria lançar um ataque nuclear não provocado contra os Soviéticos enquanto ainda estavam em vantagem.
Nas palavras do Secretário da Marinha Matthews, tornar-se 'agressores pela paz'.
John von Neumann, o fundador da teoria dos jogos, disse:
Se dizes 'porque não bombardeá-los amanhã?', eu digo 'porque não bombardeá-los hoje?'
Se dizes 'hoje às cinco horas', eu digo 'porque não à uma hora?'
Algo precisava de ser feito em relação às armas nucleares, e rápido.
Mas o quê?
Em 1950, a RAND Corporation, um think tank sediado nos EUA, estava a estudar esta questão.
E como parte desta pesquisa, recorreram à teoria dos jogos.
Nesse mesmo ano, dois matemáticos da RAND tinham inventado um novo jogo, um que, sem o saberem na altura, assemelhava-se muito ao conflito EUA-Soviético.
Este jogo é agora conhecido como o Dilema do Prisioneiro.
Então, vamos jogar um jogo.
Um banqueiro com um baú cheio de moedas de ouro convida-te a ti e a outro jogador para jogarem um contra o outro.
Cada um tem duas escolhas.
Podem cooperar ou podem desertar.
Se ambos cooperarem, cada um recebe três moedas.
Se um de vocês cooperar, mas o outro desertar, então aquele que desertou recebe cinco moedas e o outro não recebe nada.
E se ambos desertarem, então cada um recebe uma moeda.
O objetivo do jogo é simples: conseguir o máximo de moedas possível.
Então, o que farias?
Supõe que o teu oponente coopera. Então também poderias cooperar e receber três moedas.
Ou poderias desertar e receber cinco moedas em vez disso.
Portanto, é melhor desertares.
Mas e se o teu oponente desertar em vez disso?
Bem, poderias cooperar e não receber moedas.
Ou poderias desertar e pelo menos receber uma moeda.
Portanto, não importa o que o teu oponente faça, a tua melhor opção é sempre desertar.
Agora, se o teu oponente também for racional, ele chegará à mesma conclusão e, portanto, também desertará.
Como resultado, quando ambos agem racionalmente, ambos acabam na situação subótima, recebendo uma moeda cada.
Quando poderiam ter recebido três em vez disso.
No caso dos EUA e da União Soviética, isto levou ambos os países a desenvolver enormes arsenais nucleares.
de dezenas de milhares de armas nucleares cada.
Mais do que suficiente para nos destruirmos mutuamente muitas vezes.
Mas como ambos os países tinham armas nucleares, nenhum podia usá-las.
E ambos os países gastaram cerca de 10 biliões de dólares a desenvolver estas armas.
Ambos teriam ficado em melhor situação se tivessem cooperado e concordado em não desenvolver mais esta tecnologia.
Mas como ambos agiram no seu próprio interesse, acabaram numa situação em que todos ficaram em pior situação.
O dilema do prisioneiro é um dos jogos mais famosos da teoria dos jogos.
Milhares e milhares de artigos foram publicados sobre versões deste jogo.
Em parte, isso acontece porque surge em todo o lado.
Os impalas, que vivem entre as florestas e savanas africanas, são propensos a apanhar carraças,
o que pode levar a doenças infeciosas, paralisia, até mesmo à morte.
Por isso, é importante que os impalas removam as carraças, e fazem-no através da higiene.
Mas não conseguem alcançar todos os pontos dos seus corpos e, por isso, precisam de outro impala para os limpar.
Ora, limpar outra pessoa tem um custo.
Custa saliva, eletrólitos, tempo e atenção, todos recursos vitais sob o sol africano escaldante, onde um predador pode atacar a qualquer momento.
Portanto, para o outro impala, seria melhor não pagar este custo.
Mas, por outro lado, também precisará de ajuda para se limpar.
Assim, todos os impalas enfrentam uma escolha: devem limpar-se uns aos outros ou não?
Por outras palavras, devem cooperar ou desertar?
Bem, se eles interagirem apenas uma vez, então a solução racional é sempre desertar.
Esse outro impala nunca te vai ajudar, então porquê incomodar-te?
Mas o que acontece com muitos problemas é que não são um único dilema do prisioneiro.
Os impalas veem-se uns aos outros dia após dia e a mesma situação continua a acontecer repetidamente.
Portanto, isso muda o problema.
Porque em vez de jogar o dilema do prisioneiro apenas uma vez, agora estás a jogá-lo muitas, muitas vezes.
E se eu desertar agora, o meu oponente saberá que desertei, e poderá usar isso contra mim no futuro.
Então, qual é a melhor estratégia neste jogo repetido?
CAPÍTULO 2 O TORNEIO
Foi isso que Robert Axelrod, um cientista político, quis descobrir.
Assim, em 1980, ele decidiu organizar um torneio de computador.
Ele convidou alguns dos principais teóricos de jogos do mundo, de muitas áreas diferentes, para submeter programas de computador que jogariam uns contra os outros.
Axelrod chamou a estes programas estratégias.
Cada estratégia enfrentaria todas as outras estratégias e uma cópia de si mesma.
E cada confronto duraria 200 rondas. Isso é importante, e voltaremos a isso.
Ora, Axelrod usou pontos em vez de moedas, mas os ganhos eram os mesmos.
O objetivo do torneio era ganhar o máximo de pontos possível.
E, no final, todo o torneio foi repetido cinco vezes para garantir que o sucesso era robusto e não apenas um acaso.
Axelrod deu um exemplo de uma estratégia simples.
Começaria cada jogo a cooperar e só desertaria depois de o seu oponente ter desertado duas vezes seguidas.
No total, Axelrod recebeu 14 estratégias, e adicionou uma 15ª chamada aleatória, que simplesmente coopera ou deserta aleatoriamente 50% das vezes.
Todas as estratégias foram carregadas num único computador, onde se enfrentaram umas às outras.
Uma das estratégias chamava-se Friedman.
Começa por cooperar, mas se o seu oponente desertar apenas uma vez, continuará a desertar durante o resto do jogo.
Outra estratégia chamava-se Joss.
Também começa por cooperar, mas depois copia o que o outro jogador fez na jogada anterior.
Depois, cerca de 10% das vezes, Joss torna-se sorrateiro e deserta.
Havia também uma estratégia bastante elaborada chamada Grasskamp. Esta estratégia funciona...
O mesmo que o Joss, mas em vez de desertar probabilisticamente, o Grasskamp deserta na 50ª ronda.
Para tentar sondar a estratégia do seu oponente e ver se consegue tirar partido de alguma fraqueza.
A estratégia mais elaborada foi "nome retido" com 77 linhas de código.
Depois de todos os jogos terem sido jogados, os resultados foram contabilizados e a tabela de classificação estabelecida.
O mais louco foi que o programa mais simples acabou por ganhar.
Um programa que veio a ser chamado de "Olho por Olho".
O "Olho por Olho" começa por cooperar,
e depois copia exatamente o que o seu oponente fez no último movimento.
Então, seguiria a cooperação com cooperação e a deserção com deserção.
Mas apenas uma vez, se o seu oponente voltar a cooperar, o "Olho por Olho" também o faz.
Quando o "Olho por Olho" jogou contra o Friedman, ambos começaram por cooperar,
e continuaram a cooperar, ambos terminando com pontuações perfeitas por completa cooperação.
Quando o "Olho por Olho" jogou contra o Joss, eles também começaram por cooperar,
mas depois, no sexto movimento, o Joss desertou.
Isto desencadeou uma série de deserções de ida e volta, uma espécie de efeito de eco.
Ok, então agora temos esta coisa alternada, que vos fará lembrar algumas das políticas do mundo de hoje, onde temos de vos fazer algo por causa do que nos fizeram.
E depois, quando este programa estranho introduz uma segunda deserção não provocada.
Agora é realmente mau porque agora ambos os programas vão desertar um do outro pelo resto do jogo.
E isso também é como algumas das coisas que estamos a ver na política hoje e nas relações internacionais.
Como resultado destas retaliações mútuas, tanto o "Olho por Olho" como o Joss tiveram um desempenho fraco.
Mas porque o "Olho por Olho" conseguiu cooperar com estratégias suficientes, ainda assim venceu o torneio.
estamos a ser acompanhados por
Oh meu Deus, aí está o Professor Axelrod.
Ei, aí está o Stephen Hertz.
Que delícia é esta.
E eu imaginei inicialmente que seria algo como xadrez de computador, onde precisas de um programa bastante complicado para jogar um jogo sofisticado.
Mas, na verdade, não foi assim de todo, foi a estratégia mais simples que se saiu melhor.
Então analisei como isso aconteceu.
Axelrod descobriu que todas as estratégias com melhor desempenho, incluindo "Olho por Olho", partilhavam quatro qualidades.
Primeiro, eram todas "boas", o que significa que não são as primeiras a desertar.
Então, "Olho por Olho" é uma estratégia "boa", pode desertar, mas apenas em retaliação.
O oposto de "boa" é "má", essa é uma estratégia que deserta primeiro.
Então, o Joss é "mau".
Das 15 estratégias no torneio, oito eram "boas" e sete "más".
As oito melhores estratégias eram todas "boas".
E mesmo a estratégia "boa" com pior desempenho ainda superou em muito a "má" com melhor desempenho.
A segunda qualidade importante era ser "perdoador".
Uma estratégia "perdoadora" é aquela que pode retaliar, mas não guarda rancor.
Então, "Olho por Olho" é uma estratégia "perdoadora".
Retalia quando o seu oponente deserta, mas não deixa que deserções de antes da última ronda influenciem as suas decisões atuais.
Friedman, por outro lado, é o mais "implacável" possível.
Após a primeira deserção, apenas do oponente, desertaria pelo resto do jogo.
Ok, é isso. Sem misericórdia.
E isso pode parecer bom de fazer, mas não acaba por funcionar bem a longo prazo.
Esta conclusão de que compensa ser "bom" e "perdoador" foi um choque para os especialistas.
Muitos tentaram ser astutos e criar estratégias "más" subtis para vencer o seu oponente e obter uma vantagem.
Mas todos falharam. Em vez disso, neste torneio, os "bons" terminaram em primeiro.
Ora, "Olho por Olho" é bastante "perdoador", mas é possível ser ainda mais "perdoador".
A estratégia de amostra de Axelrod só deserta depois de o seu oponente ter desertado duas vezes seguidas.
Era "Olho por Dois Olhos".
Ora, isso pode parecer excessivamente generoso, mas quando Axelrod analisou os números, descobriu que se alguém tivesse submetido a estratégia de amostra, eles
teria ganho o torneio.
Quer dizer, é tão inteligente, há tantas camadas nesta história.
Depois de Axelrod ter publicado a sua análise do que aconteceu, ou tê-la feito circular entre estes teóricos de jogos,
Ele disse, agora que todos sabemos o que funcionou bem,
Ah, vamos tentar de novo.
Então, ele anunciou um segundo torneio onde tudo seria igual, exceto por uma mudança, o número de rondas por jogo.
Vejam, no primeiro torneio, cada jogo durou precisamente 200 rondas.
E isso é importante porque, se souberem quando é a última ronda, então não há razão para cooperar nessa ronda.
Então, é melhor desertar.
Claro, o seu oponente deve raciocinar da mesma forma e, portanto, também deve desertar na última ronda.
Mas se ambos anteciparem a deserção na última ronda, então não há razão para cooperar na penúltima ronda, ou na ronda anterior a essa, ou antes dessa, e assim por diante até à primeira ronda.
E assim, no torneio de Axelrod, era muito importante que os jogadores não soubessem exatamente quanto tempo iriam jogar.
Eles sabiam que, em média, seriam 200 rondas, mas havia um gerador de números aleatórios que os impedia de saber com certeza.
Sim, se não tens a certeza de quando acaba, então tens de continuar a cooperar porque pode continuar.
E podes precisar deles do teu lado.
Isso é tão verdade.
Sim.
Para este segundo torneio, Axelrod recebeu 62 inscrições e, novamente, adicionou aleatoriedade.
Os concorrentes tinham obtido os resultados e a análise do primeiro torneio e podiam usar essa informação a seu favor.
Isto criou dois campos.
Alguns pensaram que ser claramente simpático e perdoador eram qualidades vencedoras, então apresentaram estratégias simpáticas e perdoadoras.
Um até apresentou 'Olho por Dois Olhos'.
O segundo campo antecipou que outros seriam simpáticos e extra-perdoadores.
E, portanto, apresentaram estratégias desagradáveis para tentar tirar vantagem daqueles que eram extra-perdoadores.
Uma dessas estratégias chamava-se 'Testador'.
Desertaria no primeiro movimento para ver como o seu oponente reagia.
Se retaliasse, o 'Testador' pediria desculpa e jogaria 'Olho por Olho' durante o resto do jogo.
Se não retaliasse, o 'Testador' desertaria em cada segundo movimento depois disso.
Mas, novamente, ser desagradável não compensou.
E, mais uma vez, 'Olho por Olho' foi o mais eficaz.
Estratégias simpáticas, novamente, tiveram um desempenho muito melhor.
Nos 15 primeiros, apenas uma não era simpática.
Da mesma forma, nos 15 últimos, apenas uma não era desagradável.
Após o segundo torneio, Axelrod identificou as outras qualidades que distinguiam as estratégias com melhor desempenho.
A terceira é ser retaliatória, o que significa que se o seu oponente desertar, deve retaliar imediatamente.
Não seja um 'pau-mandado'.
Coopere sempre é um 'pau-mandado' total e, portanto, é muito fácil tirar vantagem.
'Olho por Olho', por outro lado, é muito difícil de tirar vantagem.
A última qualidade que Axelrod identificou é ser claro.
Programas que eram demasiado opacos, que eram demasiado semelhantes a um programa aleatório, não se conseguia percebê-los porque eram muito complicados.
Era muito difícil estabelecer qualquer padrão de confiança com um programa assim porque não se conseguia perceber o que ele estava a fazer.
não tu, quero dizer, os outros programas com que estava a jogar não conseguiam percebê-los.
E assim, acabariam por, mais ou menos, assumir que cada vez é como a última vez que te vou ver, então é melhor desertar.
O que para mim é alucinante sobre isto,
é que estes quatro princípios, ser simpático, perdoador, provocável e claro,
é muito parecido com a moralidade que evoluiu em todo o mundo e que é frequentemente resumida como 'olho por olho'.
Não é Cristianismo, a propósito.
Não é a filosofia de 'dar a outra face', é uma filosofia mais antiga.
O interessante é que, embora 'Olho por Dois Olhos' tivesse ganho o primeiro
torneio. Ficou apenas em 24º lugar no segundo torneio.
Isto realça um facto importante.
No dilema do prisioneiro repetido, não há uma única estratégia melhor.
A estratégia que tem o melhor desempenho depende sempre das outras estratégias com as quais interage.
Por exemplo, se colocarmos o 'olho por olho' num ambiente com apenas os 'valentões' que sempre desertam, então o 'olho por olho' fica em último lugar.
Eu queria ver se, por exemplo, o 'olho por olho' se saía bem porque se saía bem com regras realmente estúpidas que não se saíam bem por si mesmas, que basicamente se aproveitavam das pessoas.
Então ele fez uma simulação onde estratégias bem-sucedidas numa geração veriam os seus números crescer e as malsucedidas veriam os seus números cair.
Nesta simulação, as estratégias com pior desempenho encolhem rapidamente e extinguem-se, enquanto as estratégias com melhor desempenho se tornam mais comuns.
Harrington, a única estratégia 'má' no top 15, cresceu rapidamente no início, mas depois, à medida que as estratégias das quais se aproveitava se extinguiram, os números de Harrington também caíram rapidamente.
Isto mostra um dos principais benefícios desta simulação, porque testa o quão bem uma estratégia se comporta com outras estratégias bem-sucedidas.
Após mil gerações, as proporções são maioritariamente estáveis, e apenas as estratégias 'boas' sobrevivem.
Mais uma vez, o 'Olho por Olho' sai vitorioso, representando 14,5% da população total.
Ora, este processo pode parecer semelhante à evolução, mas há uma diferença subtil, que é o facto de, neste caso, não haver mutações. Portanto, é na verdade uma simulação ecológica.
Mas e se o mundo em que começaste fosse diferente?
Imagina um mundo que é um lugar realmente desagradável para viver, mais ou menos povoado por jogadores que sempre desertam.
Exceto que há um pequeno aglomerado de jogadores 'olho por olho' que vivem numa espécie de núcleo.
E eles conseguem jogar muito uns com os outros porque estão geograficamente... segregados.
Eles começarão a acumular muitos pontos e também, porque isso se traduz em descendência, começarão a dominar a população.
Então, na verdade, Axelrod mostrou que uma pequena ilha de cooperação pode surgir e espalhar-se, e eventualmente dominará o mundo, o que é fantástico.
Como pode a cooperação surgir numa população de jogadores que são egoístas?
Que não estão a tentar ser bons porque são bondosos.
Não tens de ser altruísta. Poderias estar a pensar em ti próprio e nos teus próprios interesses, e ainda assim a cooperação pode surgir.
Alguns argumentam que isto poderia explicar como passámos de um mundo cheio de organismos completamente egoístas, onde cada organismo só se preocupava consigo mesmo,
para um onde a cooperação surgiu e floresceu.
Desde impalas a fazerem a higiene uns aos outros até peixes a limparem tubarões.
Muitas formas de vida experimentam conflitos semelhantes ao dilema do prisioneiro.
Mas como não interagem apenas uma vez, ambos podem ficar em melhor situação ao cooperar.
E isto não requer confiança ou pensamento consciente, porque a estratégia pode estar codificada no ADN.
Desde que tenha um desempenho melhor do que as outras estratégias, pode dominar uma população.
CAPÍTULO 4 ISTO APLICA-SE AO MUNDO REAL?
As ideias de Axelrod foram aplicadas a áreas como a biologia evolutiva e os conflitos internacionais.
Mas havia um aspeto que os seus torneios originais não cobriam: o que acontece se houver um pequeno erro aleatório no jogo, algum ruído no sistema?
Por exemplo, um jogador tenta cooperar, mas isso é interpretado como uma deserção.
Pequenos erros como este acontecem no mundo real o tempo todo.
Como em 1983, o sistema de alerta precoce soviético baseado em satélites detetou o lançamento de um míssil balístico intercontinental dos EUA.
Mas os EUA não tinham lançado
não tinha falhado nada. O sistema soviético tinha confundido a luz solar refletida em nuvens de grande altitude com um míssil balístico.
Felizmente, Stanislav Petrov, o oficial soviético de serviço, descartou o alarme.
Mas este exemplo mostra os custos potenciais de um erro de sinal e a importância de estudar os efeitos do ruído nessas estratégias.
A palavra 'jogo' soa a jogo de crianças ou talvez seja um termo impróprio chamar-lhe 'teoria dos jogos', porque estes são, obviamente, assuntos de vida ou de morte.
E como mencionaste que isto surgiu na Guerra Fria, poderia ser a vida e a morte de todo o planeta; poderíamos aniquilar a civilização humana. Portanto, não são jogos num sentido trivial, é apenas o termo usado por matemáticos e teóricos.
Quando Olho por Olho joga contra si mesmo num ambiente ruidoso, ambos começam por cooperar.
Mas se uma única cooperação for entendida como uma deserção, o outro Olho por Olho retalia, desencadeando uma cadeia de retaliações alternadas.
E se outra cooperação for entendida como deserção, o resto do jogo passa a ser uma deserção mútua constante.
Por isso, a longo prazo, ambos obteriam apenas um terço dos pontos que conseguiriam num ambiente perfeito.
O Olho por Olho passa de um desempenho muito bom para um fraco desempenho.
Então, como se resolve isto? Bem, é preciso uma forma fiável de quebrar estes efeitos de eco.
E uma forma de o fazer é jogar Olho por Olho, mas com cerca de 10% mais de perdão.
Assim, em vez de retaliar após cada deserção, retalia-se apenas cerca de 9 em cada 10 vezes.
Isto ajuda a quebrar esses ecos, mantendo capacidade de retaliação suficiente para não ser explorado.
E assim também realizámos o torneio com ruído e generosidade. E correu bastante bem.
O meu exemplo favorito é que o Olho por Olho se sai muito bem, mas nunca poderia ter melhor resultado do que o jogador com quem está a jogar.
Pense nisto: por conceção, tudo o que eles conseguem fazer é perder ou empatar.
E, no entanto, quando os resultados de todas as interações são somados, fica à frente de todas as outras estratégias.
Da mesma forma, Desertar Sempre nunca pode perder um jogo; só pode empatar ou ganhar.
Mas, no geral, tem um desempenho extremamente fraco.
Isto realça um equívoco comum, porque muitas pessoas, quando pensam em vencer, acham que têm de derrotar a outra pessoa.
Em jogos como o xadrez ou o póquer, isto é verdade, já que o ganho de uma pessoa é necessariamente a perda da outra. Portanto, estes jogos são de soma nula.
Mas a maior parte da vida não é de soma nula. Para vencer, não precisa de retirar a sua recompensa ao outro jogador.
Em vez disso, pode obtê-la do banqueiro. Só que, na vida real, o banqueiro é o mundo; é literalmente tudo ao seu redor.
Cabe-nos a nós encontrar essas situações vantajosas para todos e trabalhar juntos para desbloquear essas recompensas.
A cooperação compensa, mesmo entre rivais.
De 1950 a 1986, os EUA e a União Soviética tiveram dificuldades em cooperar, e ambos continuaram a desenvolver armas nucleares.
Mas depois, a partir do final dos anos 80, começaram a reduzir os seus arsenais nucleares.
Eles também aprenderam a resolver o conflito. Em vez de fazerem um acordo para abolir todas as armas nucleares de uma só vez, transformando-o num único dilema do prisioneiro,
desarmaram lentamente, um pequeno número de ogivas nucleares a cada ano.
Depois inspecionavam-se mutuamente para confirmar que ambos tinham cooperado e repetiam no ano seguinte,
e no ano a seguir, sempre a verificar para garantir a cooperação mútua.
Nos mais de 40 anos desde os torneios de Axelrod, os investigadores continuaram a estudar que estratégias têm melhor desempenho numa variedade de ambientes.
Ao fazê-lo, variaram tudo, desde estruturas de recompensas até estratégias e...
erros e mais. Alguns até permitiam que as estratégias mutassem.
Embora o 'olho por olho' ou o 'olho por olho generoso' nem sempre saiam por cima,
as principais conclusões de Axelrod ainda se mantêm: seja simpático, perdoador,
mas não seja um capacho.
Posso perguntar-lhe, por que é que Anatol Rapoport submeteu o 'Olho por Olho'?
Bem, a razão foi porque eu lhe pedi.
(risos)
E ele escreveu a dizer, sim, vou fazer isso, mas quero deixar claro que não tenho a certeza de que esta seja realmente uma boa ideia.
Não, ele era um investigador da paz.
E acho que as suas próprias inclinações eram para ser muito mais perdoador e talvez não ser tão provocável.
O que acho fascinante é que uma das principais coisas que distingue a vida das coisas não-vivas é que a vida pode tomar decisões.
Podemos fazer escolhas, escolhas que não só mudam o nosso futuro, mas também o futuro daqueles com quem interagimos.
Vejam, a curto prazo, é muitas vezes o ambiente que molda o jogador, que determina quem se sai bem.
Mas a longo prazo, são os jogadores que moldam o ambiente.
Então, vamos jogar um jogo, o jogo da vida,
e façam as vossas escolhas com sabedoria, porque o seu impacto pode ir mais longe do que pensam.
(música/transição)
Usar a estratégia certa importa.
Mas descobrir a melhor estratégia não é fácil.
Exige pensamento crítico e soluções inovadoras, como os torneios de Axelrod.
Se procura uma forma fácil de desenvolver as suas capacidades de resolução de problemas, então veja o patrocinador deste vídeo, Brilliant.
Brilliant irá ajudá-lo a ser um pensador melhor em tudo, desde matemática e ciência de dados a programação, tecnologia, o que quiser.
Pode começar agora mesmo, gratuitamente, diretamente do seu dispositivo, o dispositivo em que está a ver isto.
Tudo o que precisa de fazer é definir o seu objetivo de aprendizagem, e o Brilliant irá conceber o caminho perfeito para si, equipando-o com todas as ferramentas de que precisa para o alcançar.
Gostou das ideias de hoje da teoria dos jogos?
Então, o novo curso do Brilliant, Introdução à Probabilidade, é o próximo passo perfeito.
A Introdução à Probabilidade é a sua porta de entrada para dominar as ferramentas do acaso, risco e previsão.
Aprenderá a construir e analisar modelos de situações do mundo real,
desde eletrões e decisões de negócios até ao Campeonato do Mundo Feminino de 2023.
Quer seja um estatístico em ascensão ou apenas queira aprender sobre aleatoriedade e acaso,
este curso irá equipá-lo com as competências de que precisa para tomar decisões em situações incertas.
Até tirará uma página do manual de Axelrod e aprenderá a construir simulações de computador para testar as suas estratégias.
Além da probabilidade, o Brilliant tem uma vasta biblioteca de conteúdo que abrange tudo, desde matemática a ciência de dados e programação a tecnologia.
O que adoro no Brilliant é que cada lição é prática, por isso desenvolverá uma verdadeira intuição.
E a melhor parte é que pode aprender com o Brilliant em qualquer lugar.
Para experimentar tudo o que o Brilliant tem para oferecer gratuitamente durante 30 dias, visite brilliant.org/veritasium.
E os primeiros 200 de vocês a inscreverem-se terão 20% de desconto na subscrição premium anual do Brilliant.
Então, quero agradecer ao Brilliant por patrocinar este vídeo, e quero agradecer-vos por assistirem.
Comentários(0)
Entra ou cria conta para comentar. Os comentários são públicos.
A carregar comentários…