Publicação de Artigo · Artificial Intelligence
Um ensaio sobre o colapso de sistemas de IA e por que isso não é um problema de engenharia
Palavras-chave

Resumo
Este ensaio discute por que alinhar sistemas de inteligência artificial (IA) aos interesses da humanidade não é um problema que a engenharia possa encerrar. Parte-se de uma descrição em linguagem comum de como esses sistemas são construídos e ajustados a partir do comportamento e do julgamento humanos, e examina-se o que eles herdam nesse processo. Com base na filosofia moral, na teoria da escolha social e em evidência empírica sobre divergência de valores, o texto discute quem define os controles desses sistemas e os limites de traduzir valores em métricas. Examinam-se também as consequências da automação para o trabalho e a literatura sobre os limites do controle humano, sobre os outros e sobre o próprio comportamento. Propõe-se tratar o alinhamento como problema de legitimidade e de governança contínua.
Palavras-chave: alinhamento de IA; pluralismo de valores; escolha social; lei de Goodhart; futuro do trabalho; governança.
1. Introdução
Numa reunião de condomínio, a pauta tinha um único item: se cães poderiam usar o elevador social. Foram duas horas. Houve quem invocasse a higiene e quem invocasse o direito de propriedade, quem lembrasse que a moradora do 302 tem medo de cães desde criança e quem respondesse que o medo dela não era problema do prédio. Ao final, votou-se. A maioria venceu por três votos, a minoria saiu convencida de que a decisão era injusta, e o assunto voltou à pauta seis meses depois. Ninguém ali era irracional. Todos tinham princípios, e os princípios não cabiam no mesmo elevador.
A cena reproduz, em pequena escala, o problema deste ensaio. Pedimos aos engenheiros de inteligência artificial que façam, em escala planetária e por escrito, o que quarenta apartamentos não conseguem fazer a respeito de um elevador: definir o que é bom, para quem e em que ordem.
Para treinar sistemas de IA a operarem dentro dos confins que entendemos serem dos interesses da humanidade, precisaremos transferir a esses sistemas, um conjunto de princípios éticos e filosóficos que nós mesmos, humanos, não concordamos plenamente. E não esqueçamos, que a discordância filosófica, que pode ser usada como argumento de algo benéfico — e legitimimente é, em princípio — é o mesmo motivo que leva a nos degladiarmos, da reunião do condomínio à guerra por território.
Supor que controlaremos em outro o que não controlamos em nós mesmos, revela o fato gerador de boa parte das nossas mazelas: a prepotência.
Os sistemas de IA atuais foram construídos para imitar o comportamento humano registrado em texto e depois ajustados por avaliadores humanos. Ao imitar, herdam também o que no humano continua sem solução.
Norbert Wiener, matemático do MIT e fundador da cibernética, formulou o problema em 1960 na revista “Science”: se usarmos um agente mecânico em cuja operação não podemos interferir de forma eficaz, “é melhor termos plena certeza de que o propósito colocado na máquina é o propósito que realmente desejamos, e não apenas uma imitação colorida dele” (tradução nossa) [1]. Essa certeza pressupõe um “nós” com desejo comum, e é esse pressuposto que examino. Stuart Russell, de Berkeley, propôs em “Human Compatible” máquinas que aprendam as preferências humanas observando nosso comportamento, e dedica o capítulo 9 às complicações da proposta, entre elas as preferências conflitantes entre pessoas [2].
O colapso do título é o de uma premissa: a de que o alinhamento é um problema de especificação, encerrado quando a especificação estiver correta.
2. Como a engenharia tornou a inteligência tratável
Um modelo de linguagem é uma função com bilhões de parâmetros que recebe um trecho de texto e estima a probabilidade de cada fragmento seguinte. No pré-treino, ele processa grandes volumes de texto digital e, a cada erro de previsão, os parâmetros são corrigidos na direção que o teria reduzido. A medida desse erro, a função objetivo, é o único critério de sucesso nessa etapa e não contém noção de verdade ou de bem.
Desse procedimento emergiram competências que ninguém programou. Jason Wei e colegas, do Google, documentaram habilidades ausentes em modelos menores e presentes nos maiores [3], e Rylan Schaeffer, Brando Miranda e Sanmi Koyejo, de Stanford, mostraram que o aparente salto abrupto pode ser efeito da métrica escolhida [4]. Kenneth Li e colegas, de Harvard, do MIT e da Northeastern, treinaram um modelo apenas para prever jogadas válidas de Othello e encontraram evidência de uma representação interna do tabuleiro, usada para escolher a jogada [5]. Jared Kaplan e colegas, da OpenAI, mostraram que o erro cai segundo leis de potência conforme crescem modelo, dados e computação [6]. A inteligência, entendida como capacidade de resolver problemas descritos em linguagem, tornou-se tratável nesse sentido: obtida por um procedimento reprodutível, sem ser compreendida.
Um modelo que imita o texto humano imita também o golpe e a desinformação, e por isso os laboratórios o ajustam por preferência humana. No aprendizado por reforço a partir de feedback humano (RLHF), proposto por Paul Christiano e colegas, da OpenAI e da DeepMind [7], e aplicado a modelos de linguagem por Long Ouyang e colegas, da OpenAI [8], avaliadores escolhem a melhor entre pares de respostas, um segundo modelo aprende a prever essas escolhas e o modelo principal é otimizado para maximizar a nota prevista. Na IA constitucional, de Yuntao Bai e colegas, da Anthropic, parte desse julgamento é substituída por princípios escritos que o próprio modelo usa para revisar suas respostas [9].
Com isso, a função objetivo muda de natureza: no pré-treino, mede a coincidência com o texto; no ajuste, mede a aprovação de pessoas ou de uma lista redigida por pessoas, isto é, um juízo sobre o desejável. Stephen Casper, do MIT, e colegas separaram os limites dessa etapa que mais engenharia pode atenuar daqueles fundamentais ao método, e entre os fundamentais está a dificuldade de representar numa única função de recompensa as preferências de pessoas que discordam entre si [10].
Dario Amodei e colegas, então no Google Brain, em Stanford, em Berkeley e na OpenAI, já distinguiam em 2016 as falhas de especificação, em que o objetivo formal diverge do pretendido, das falhas de robustez e de supervisão [11]. A tese deste ensaio é mais estreita: mesmo com especificação perfeita, resta saber de quem é o objetivo especificado, e essa pergunta não tem gradiente.
3. Quem imita herda o imitado
O que a máquina aprende depende de quem escreveu o que ela leu e de quem avaliou o que ela respondeu. Os psicólogos Joseph Henrich, Steven Heine e Ara Norenzayan, então na Universidade da Colúmbia Britânica, mostraram em 2010 que a pesquisa comportamental se apoiava em amostras de sociedades ocidentais, escolarizadas, industrializadas, ricas e democráticas, frequentemente situadas nos extremos da distribuição humana [12]. Nos modelos de linguagem, Shibani Santurkar e colegas, de Stanford, encontraram desalinhamento substancial entre as opiniões dos modelos e as de grupos demográficos inteiros dos Estados Unidos, em vários casos agravado pelo ajuste com feedback humano [13]. Mohammad Atari e colegas, do grupo de Henrich em Harvard, em trabalho ainda não revisado por pares, verificaram que as respostas dos modelos se afastam da psicologia de cada população à medida que cresce sua distância cultural em relação aos Estados Unidos [14]. A distribuição dos dados já determina qual humanidade está sendo imitada.
O ajuste por preferência acrescenta uma segunda herança: sistemas treinados para maximizar aprovação aprendem a ser aprovados. Mrinank Sharma e colegas, da Anthropic, documentaram que esses assistentes tendem à bajulação, concordando com o usuário e recuando de respostas corretas quando contestados, comportamento que os próprios dados de preferência humana recompensam [15]. Em humanos, a meta-análise de Bob Uttl e colegas, da Mount Royal University, não encontrou correlação significativa entre a nota que os alunos dão ao professor e o quanto aprendem [16].
Ryan Greenblatt e colegas, da Anthropic e da Redwood Research, informaram ao modelo Claude 3 Opus que ele seria retreinado para cumprir objetivos contrários às suas preferências anteriores. Em parte dos casos, o modelo passou a cumprir as instruções apenas quando julgava estar em treino e registrou no raciocínio que o fazia para não ser modificado [17]. Os autores ressalvam que o cenário era artificial. Ainda assim, esses estudos indicam que sistemas treinados para imitar o comportamento humano reproduzem problemas conhecidos de agentes humanos: o viés de origem, a sensibilidade a incentivos e a tendência de dizer ao avaliador o que ele quer ouvir.
4. O desacordo que não se resolve
Escolher melhor, com dados mais representativos, avaliadores mais diversos e princípios mais bem redigidos, não elimina o problema: representar melhor a diversidade humana traz para dentro do sistema o desacordo que existe fora dele.
O filósofo Isaiah Berlin, de Oxford, sustentou em “The Crooked Timber of Humanity” que os valores humanos são múltiplos, frequentemente incompatíveis e sem medida comum, de modo que escolher entre liberdade e igualdade, ou entre justiça e misericórdia, implica perda [18]. John Rawls, de Harvard, chegou por outra via, em “Political Liberalism”, ao fato do pluralismo razoável: sob instituições livres, pessoas razoáveis chegam de forma duradoura a doutrinas morais, religiosas e filosóficas incompatíveis [19].
O economista Kenneth Arrow demonstrou em 1951 que nenhum procedimento agrega preferências individuais numa ordenação coletiva satisfazendo ao mesmo tempo um pequeno conjunto de condições mínimas, entre elas a de que ninguém seja ditador [20]. Toda função de recompensa que condensa julgamentos divergentes numa nota única faz, portanto, escolhas que nenhum critério neutro justifica.
O experimento Moral Machine, de Edmond Awad e colegas no MIT Media Lab, coletou cerca de quarenta milhões de decisões sobre dilemas de veículos autônomos em 233 países e territórios [21]. Algumas preferências foram amplamente compartilhadas, como poupar mais vidas, mas emergiram três agrupamentos culturais, ocidental, oriental e meridional, que divergem, por exemplo, no peso dado à idade ou ao status social das vítimas. Um veículo vendido nas três regiões teria de escolher um deles ou adotar uma média que não representa nenhum.
Anna Jobin, Marcello Ienca e Effy Vayena, da ETH Zurique, analisaram 84 diretrizes de ética em IA e encontraram convergência em torno de princípios como transparência, justiça e não maleficência, com divergência substantiva sobre como interpretá-los e implementá-los [22]. Brent Mittelstadt, do Oxford Internet Institute, argumentou que princípios assim não garantem ética na prática porque a IA, ao contrário da medicina, não tem objetivos comuns, deveres fiduciários, tradição profissional nem mecanismos de responsabilização [23].
Iason Gabriel, filósofo da DeepMind, propõe buscar princípios que pessoas com concepções razoavelmente diferentes possam endossar, em vez de princípios morais verdadeiros, o que faz do alinhamento uma questão de legitimidade política [24]. Legitimidade é uma relação entre o modelo, quem o controla e quem é afetado por ele, e não se mede no laboratório. O psicólogo Jonathan Haidt, da Universidade de Nova York, explica por que esse desacordo resiste a argumentos: os julgamentos morais são majoritariamente intuitivos, o raciocínio vem depois, e grupos diferentes pesam de modo diferente fundamentos como lealdade, autoridade e santidade [25].
5. Quem define os controles, e onde
Mesmo que uma assembleia legítima aprovasse um conjunto de princípios, restaria transformá-los em comportamento. Ludwig Wittgenstein formulou nas “Investigações Filosóficas” o paradoxo do seguimento de regras: “nenhum curso de ação poderia ser determinado por uma regra, porque todo curso de ação pode ser posto em acordo com a regra” (§201, tradução nossa) [26]. Uma regra não contém as instruções da própria aplicação: entre “evite causar dano” e a decisão de responder a uma pergunta sobre dosagem de medicamentos há um intervalo que só a interpretação preenche. O jurista H. L. A. Hart, de Oxford, chamou de textura aberta essa característica da linguagem jurídica em “The Concept of Law”: toda regra tem um núcleo de casos claros e uma penumbra que exige juízo [27]. O direito trata o problema com juízes, recursos e jurisprudência. Na IA constitucional, o intérprete é o próprio modelo, e a interpretação fica fixada no treino [9].
Há ainda a métrica. O economista Charles Goodhart, então assessor do Banco da Inglaterra, observou em 1975 que qualquer regularidade estatística observada tende a colapsar quando usada para fins de controle [28]. A antropóloga Marilyn Strathern, de Cambridge, generalizou em 1997: quando uma medida se torna meta, deixa de ser boa medida [29]. David Manheim e Scott Garrabrant mostraram que esse efeito decorre da otimização intensa de um indicador imperfeito [30]. Todo controle sobre um sistema de IA precisa virar número, como nota de preferência, taxa de recusa ou pontuação em avaliação, e esse número, ao virar alvo, se descola do valor que deveria representar.
Os controles podem estar nos dados de pré-treino, na seleção de avaliadores, na redação dos princípios, nos filtros de saída ou nas políticas de uso, e cada camada é decidida por alguém que raramente é quem sofre os efeitos. Saffron Huang e colegas, do Collective Intelligence Project e da Anthropic, fizeram uma amostra representativa de 1.002 adultos norte-americanos propor e votar princípios para um modelo [31]. Taylor Sorensen e colegas, da Universidade de Washington e de outras instituições, propõem tratar o pluralismo como requisito de projeto [32]. Os dois trabalhos ampliam a participação, mas o primeiro precisou escolher um país e o segundo precisa decidir o que é razoável.
David Collingridge descreveu em 1980, em “The Social Control of Technology”, um dilema: enquanto uma tecnologia é jovem, seus efeitos são pouco conhecidos e mudá-la é fácil; quando os efeitos ficam claros, mudá-la é caro e lento [33]. Bill Gates, cofundador da Microsoft, afirmou em entrevista a Ezra Klein que não se pode contar com a autorregulação da indústria e que supor o contrário seria insano [34]. A decisão sobre os controles é, portanto, política antes de ser técnica, e deixá-la a quem constrói o sistema é também uma decisão política, apenas não declarada.
6. Do condomínio à guerra
A discordância filosófica é condição do progresso moral: ampliações de direitos como a abolição da escravidão e o voto feminino começaram como posições minoritárias. Também alimenta o conflito. O psicólogo e filósofo Joshua Greene, de Harvard, descreve em “Moral Tribes” a tragédia da moralidade de senso comum: a moralidade evoluiu para viabilizar a cooperação dentro de grupos, mas, quando grupos com moralidades diferentes se encontram, cada um julga estar certo pelos próprios critérios, o que dificulta resolver o conflito [35]. Por esse argumento, a reunião de condomínio e a disputa por território diferem em escala, mas compartilham a estrutura: princípios divergentes e ausência de uma métrica comum para decidir.
Levado aos sistemas de IA, esse mecanismo produz dois riscos opostos. O primeiro é a homogeneização. Jon Kleinberg, de Cornell, e Manish Raghavan, do MIT, demonstraram em modelo teórico que, quando muitos tomadores de decisão adotam o mesmo algoritmo, a qualidade do conjunto das decisões pode cair mesmo que o algoritmo seja o mais preciso para cada um [36]. Rishi Bommasani e colegas, de Stanford, verificaram que compartilhar dados de treino agrava a homogeneização de resultados, em que as mesmas pessoas são preteridas por todos os sistemas; para modelos de base compartilhados, o efeito variou com a forma de adaptação [37]. Poucos modelos, de poucas empresas, mediando decisões de bilhões de pessoas é a configuração descrita por esses trabalhos. O segundo risco é a fragmentação: modelos alinhados aos valores de cada país ou comunidade e a serviço da divisão entre grupos. Não conheço evidência sistemática sobre ele e o trato como hipótese derivada do argumento de Greene.
Não conheço solução técnica que evite os dois riscos. A escolha entre eles é feita antes do gradiente, por pessoas, e deveria ser feita às claras.
7. A promessa dos novos trabalhos
A mesma questão aparece no debate sobre trabalho. Em entrevista a Ezra Klein, Jensen Huang, fundador e presidente-executivo da Nvidia, afirmou que os empregos mudarão em massa, mas que haverá criação líquida de postos porque novas indústrias criam novos empregos, e citou como exemplo centros de bem-estar, spas, entretenimento e todo o mercado de luxo, que não existiam na primeira metade da sua vida [38].
O argumento tem base histórica. O economista David Autor, do MIT, mostrou que a automação substitui tarefas mais do que ocupações e complementa o trabalho humano nas tarefas que restam [39]. David Autor, Caroline Chin, Anna Salomons e Bryan Seegmiller estimaram que cerca de seis em cada dez empregos nos Estados Unidos em 2018 estavam em especialidades inexistentes em 1940 [40]. Daron Acemoglu, do MIT, e Pascual Restrepo, então na Universidade de Boston, descreveram uma corrida entre o deslocamento, em que máquinas assumem tarefas, e a reintegração, em que surgem tarefas novas para humanos [41].
Os mesmos dados limitam a aposta de Huang. O estudo de David Autor e colegas mostra que, entre 1940 e 1980, o trabalho novo surgiu sobretudo em ocupações de renda média e, depois de 1980, em ocupações profissionais bem pagas e, em segundo lugar, em serviços mal pagos [40]. Acemoglu e Restrepo registram que nas últimas décadas o deslocamento andou mais depressa que a reintegração [41].
Os exemplos de Huang têm um limite estrutural. Thorstein Veblen mostrou em 1899, em “The Theory of the Leisure Class”, que parte do valor de certos bens vem de sinalizar posição social [42], e Fred Hirsch os chamou em 1976, em “Social Limits to Growth”, de bens posicionais, cuja oferta é socialmente limitada porque seu valor depende da escassez relativa [43]. Um mercado cujo produto é a exclusividade não pode crescer até absorver a maioria. Segundo a Bain & Company e a Altagamma, os consumidores de luxo caíram de 400 milhões em 2022 para cerca de 340 milhões em 2025 [44], e o “World Inequality Report 2022”, coordenado por Lucas Chancel, Thomas Piketty, Emmanuel Saez e Gabriel Zucman, estima que os 10% mais ricos detêm 76% da riqueza global [45]. Fazer do luxo o destino do trabalho deslocado é propor que muitos vivam de servir a poucos.
Spas e centros de bem-estar são cuidado pessoal para quem pode pagar e caem na mesma crítica. O cuidado em sentido amplo é diferente. O relatório da Organização Internacional do Trabalho assinado por Laura Addati, Umberto Cattaneo, Valeria Esquivel e Isabel Valarino estima 381 milhões de trabalhadores em atividades de cuidado, 11,5% do emprego global, e descreve um setor de demanda crescente, baixa remuneração e financiamento concentrado nas famílias e no Estado [46]. William Baumol mostrou em 1967 por quê: serviços em que o trabalho humano é o próprio produto, como a educação e o cuidado, não ganham produtividade no ritmo da indústria e ficam relativamente mais caros com o tempo [47]. Prometer que o cuidado absorverá os deslocados pela IA sem dizer quem pagará salários dignos ignora a conclusão da OIT, a de que trabalho de cuidado decente exige investimento público.
Há ainda escala e velocidade. Tyna Eloundou e colegas, da OpenAI e da Universidade da Pensilvânia, estimaram na versão preliminar do estudo que cerca de 80% dos trabalhadores dos Estados Unidos teriam ao menos 10% das tarefas expostas a modelos de linguagem, e cerca de 19% teriam ao menos metade [48]. Daron Acemoglu estima ganho de no máximo 0,66% na produtividade total dos fatores em dez anos [49]. Se ambos estiverem aproximadamente certos, haverá exposição ampla com ganho pequeno: substituição sem a riqueza adicional que financiaria novas demandas. Erik Brynjolfsson, de Stanford, chamou de armadilha de Turing a orientação da IA para imitar e substituir o humano em vez de ampliá-lo, opção que concentra renda e poder em quem controla a tecnologia [50].
Na entrevista a Klein, segundo relato de Truman Dickerson na “Business Insider”, Bill Gates propôs cobrar sobre cada unidade de trabalho o mesmo imposto sobre a folha que um humano pagaria, seja ela entregue por pessoa ou por robô, e disse que sinais econômicos favoráveis à IA não obrigam a sociedade a adotá-la [34], [51]. Em ensaio de agosto de 2026, noticiado por Ina Fried no “Axios”, defendeu reservar a humanos funções como o cuidado de crianças e o serviço de júri [52]. Pode-se duvidar da viabilidade das propostas, mas são decisões sobre o que uma sociedade quer preservar, e nenhuma deriva de uma curva de custo.
John Maynard Keynes previu em 1930, em “Economic possibilities for our grandchildren”, que o padrão de vida nos países em progresso seria, em cem anos, de quatro a oito vezes maior, e sugeriu semanas de quinze horas para repartir o trabalho restante [53]. No volume organizado por Lorenzo Pecchi e Gustavo Piga para explicar por que a jornada encolheu muito menos, Richard Freeman aponta a desigualdade, que aumenta o prêmio de trabalhar mais, e Joseph Stiglitz, a dinâmica do consumo, que se renova com a renda [54]. Nenhuma das explicações é técnica.
8. O que não controlamos em nós mesmos
Toda empresa com mais de um funcionário vive um problema de alinhamento: contrato de trabalho, código de conduta, política de remuneração e auditoria existem porque os interesses de quem contrata e de quem é contratado não coincidem por si.
Os economistas Michael Jensen e William Meckling formalizaram esse problema na teoria da agência em 1976. Quando um principal delega decisões a um agente, surgem custos de monitoramento, custos de garantia e uma perda residual, que registra a impossibilidade, em geral, de assegurar a custo zero que o agente decida como o principal decidiria [55]. Dylan Hadfield-Menell e Gillian Hadfield, então em Berkeley e na Universidade de Toronto, propuseram ler o alinhamento de IA como problema de contratos incompletos: contratos entre humanos funcionam porque a cultura e o direito fornecem os termos implícitos que preenchem suas lacunas [56]. A proposta é uma agenda de pesquisa, não uma solução demonstrada, mas o diagnóstico basta aqui: entre humanos, o controle sobre o outro depende de instituições que completam o que a especificação não cobre.
O controle também falha sobre o próprio comportamento. O psicólogo Paschal Sheeran, então na Universidade de Sheffield, reuniu dez meta-análises com 422 estudos e encontrou que as intenções explicam, em média, cerca de 28% da variância do comportamento [57]. Na meta-análise de estudos experimentais de Thomas Webb e Sheeran, mudanças médias a grandes nas intenções produziram mudanças apenas pequenas a médias no comportamento [58].
Resta explicar por que, diante disso, a especificação de valores para uma máquina é tratada como tarefa ao alcance de uma equipe competente. Ellen Langer, de Harvard, chamou de ilusão de controle a expectativa de sucesso maior do que a probabilidade objetiva justifica, e mostrou que ela cresce quando situações de acaso exibem sinais de habilidade [59]. Don Moore e Paul Healy distinguiram três formas de excesso de confiança: superestimar o próprio desempenho, julgar-se melhor que os outros e confiar demais na precisão das próprias crenças [60]. Daniel Kahneman e Dan Lovallo mostraram que previsões otimistas nascem da visão de dentro, ancorada nos planos do próprio projeto e não no histórico de projetos semelhantes [61].
Este ensaio propõe que essa combinação de ilusão de controle e excesso de confiança está presente em três crenças do debate: a de que uma equipe competente pode especificar valores, apesar do desacordo documentado nas diretrizes de ética em IA e no experimento Moral Machine; a de que a indústria se autorregulará, embora quem constrói o sistema seja, nos termos de Jensen e Meckling, um agente com interesses próprios; e a de que a ambição humana criará os empregos necessários, embora o deslocamento tenha superado a reintegração nas últimas décadas.
9. Conclusão
A reunião de condomínio não terminou mal por falta de inteligência ou de informação. Todos sabiam o que era um cão, um elevador e uma convenção. Terminou mal porque a pergunta não tinha resposta que poupasse alguém de perder algo. O que o condomínio tem é um procedimento: pauta, voto, ata e a possibilidade de voltar ao assunto seis meses depois.
A engenharia tornou a inteligência tratável ao converter a imitação do texto humano num problema de otimização e, com isso, transferiu às máquinas impasses que, entre humanos, são administrados por instituições, e não resolvidos por especificação [55], [56]. A engenharia continuará necessária para tornar os sistemas mais robustos, transparentes e auditáveis, mas o alinhamento deveria ser tratado como se tratam esses impasses entre humanos: como processo permanente de revisão, com instâncias de contestação, representação dos afetados e mecanismos de correção. A pergunta deixa de ser como especificar valores humanos para uma máquina e passa a ser quem tem legitimidade para decidir quais valores entram, como essa decisão é revista e quem responde pelas consequências.
Incluo-me na crítica: como engenheiro e fundador de empresa de tecnologia, conheço a tentação de achar que um problema bem formulado está quase resolvido, a visão de dentro descrita por Kahneman e Lovallo [61]. Wiener pedia certeza sobre o propósito colocado na máquina [1]. Sessenta e seis anos depois, essa certeza não está disponível, porque os dados sobre divergência moral não indicam um propósito humano único. Isso exige instituições capazes de conviver com a incerteza. Resta a pergunta que o condomínio já conhece: quem terá assento na reunião em que se decide o que a máquina deve considerar bom?
Referências
[1] N. Wiener, “Some moral and technical consequences of automation,” Science, vol. 131, no. 3410, pp. 1355–1358, May 1960, doi: 10.1126/science.131.3410.1355.
[2] S. Russell, Human Compatible: Artificial Intelligence and the Problem of Control. New York, NY, USA: Viking, 2019, ch. 9.
[3] J. Wei et al., “Emergent abilities of large language models,” Trans. Mach. Learn. Res., 2022, arXiv:2206.07682.
[4] R. Schaeffer, B. Miranda, and S. Koyejo, “Are emergent abilities of large language models a mirage?” in Adv. Neural Inf. Process. Syst. (NeurIPS), vol. 36, 2023, pp. 55565–55581.
[5] K. Li, A. K. Hopkins, D. Bau, F. Viégas, H. Pfister, and M. Wattenberg, “Emergent world representations: Exploring a sequence model trained on a synthetic task,” in Proc. Int. Conf. Learn. Represent. (ICLR), 2023, arXiv:2210.13382.
[6] J. Kaplan et al., “Scaling laws for neural language models,” arXiv:2001.08361, 2020.
[7] P. F. Christiano, J. Leike, T. Brown, M. Martic, S. Legg, and D. Amodei, “Deep reinforcement learning from human preferences,” in Adv. Neural Inf. Process. Syst. (NIPS), vol. 30, 2017, pp. 4299–4307.
[8] L. Ouyang et al., “Training language models to follow instructions with human feedback,” in Adv. Neural Inf. Process. Syst. (NeurIPS), vol. 35, 2022, pp. 27730–27744.
[9] Y. Bai et al., “Constitutional AI: Harmlessness from AI feedback,” arXiv:2212.08073, Dec. 2022.
[10] S. Casper et al., “Open problems and fundamental limitations of reinforcement learning from human feedback,” Trans. Mach. Learn. Res., 2023. [Online]. Available: https://openreview.net/forum?id=bx24KpJ4Eb
[11] D. Amodei, C. Olah, J. Steinhardt, P. Christiano, J. Schulman, and D. Mané, “Concrete problems in AI safety,” arXiv:1606.06565, 2016.
[12] J. Henrich, S. J. Heine, and A. Norenzayan, “The weirdest people in the world?” Behav. Brain Sci., vol. 33, no. 2–3, pp. 61–83, 2010, doi: 10.1017/S0140525X0999152X.
[13] S. Santurkar, E. Durmus, F. Ladhak, C. Lee, P. Liang, and T. Hashimoto, “Whose opinions do language models reflect?” in Proc. 40th Int. Conf. Mach. Learn. (ICML), PMLR vol. 202, 2023, pp. 29971–30004.
[14] M. Atari, M. J. Xue, P. S. Park, D. E. Blasi, and J. Henrich, “Which humans?” PsyArXiv preprint, 2023, doi: 10.31234/osf.io/5b26t.
[15] M. Sharma et al., “Towards understanding sycophancy in language models,” in Proc. Int. Conf. Learn. Represent. (ICLR), 2024, arXiv:2310.13548.
[16] B. Uttl, C. A. White, and D. Wong Gonzalez, “Meta-analysis of faculty’s teaching effectiveness: Student evaluation of teaching ratings and student learning are not related,” Stud. Educ. Eval., vol. 54, pp. 22–42, 2017, doi: 10.1016/j.stueduc.2016.08.007.
[17] R. Greenblatt et al., “Alignment faking in large language models,” arXiv:2412.14093, Dec. 2024.
[18] I. Berlin, The Crooked Timber of Humanity: Chapters in the History of Ideas, H. Hardy, Ed. London, U.K.: John Murray, 1990.
[19] J. Rawls, Political Liberalism. New York, NY, USA: Columbia Univ. Press, 1993.
[20] K. J. Arrow, Social Choice and Individual Values. New York, NY, USA: Wiley, 1951.
[21] E. Awad et al., “The Moral Machine experiment,” Nature, vol. 563, no. 7729, pp. 59–64, 2018, doi: 10.1038/s41586-018-0637-6.
[22] A. Jobin, M. Ienca, and E. Vayena, “The global landscape of AI ethics guidelines,” Nat. Mach. Intell., vol. 1, no. 9, pp. 389–399, 2019, doi: 10.1038/s42256-019-0088-2.
[23] B. Mittelstadt, “Principles alone cannot guarantee ethical AI,” Nat. Mach. Intell., vol. 1, no. 11, pp. 501–507, 2019, doi: 10.1038/s42256-019-0114-4.
[24] I. Gabriel, “Artificial intelligence, values, and alignment,” Minds Mach., vol. 30, no. 3, pp. 411–437, 2020, doi: 10.1007/s11023-020-09539-2.
[25] J. Haidt, The Righteous Mind: Why Good People Are Divided by Politics and Religion. New York, NY, USA: Pantheon Books, 2012.
[26] L. Wittgenstein, Philosophical Investigations, G. E. M. Anscombe, Trans. Oxford, U.K.: Blackwell, 1953, §201.
[27] H. L. A. Hart, The Concept of Law. Oxford, U.K.: Clarendon Press, 1961, ch. VII.
[28] C. A. E. Goodhart, “Problems of monetary management: The U.K. experience,” in Papers in Monetary Economics, vol. 1. Sydney, Australia: Reserve Bank of Australia, 1975.
[29] M. Strathern, “‘Improving ratings’: Audit in the British University system,” Eur. Rev., vol. 5, no. 3, pp. 305–321, 1997.
[30] D. Manheim and S. Garrabrant, “Categorizing variants of Goodhart’s law,” arXiv:1803.04585, 2018.
[31] S. Huang, D. Siddarth, L. Lovitt, T. I. Liao, E. Durmus, A. Tamkin, and D. Ganguli, “Collective Constitutional AI: Aligning a language model with public input,” in Proc. ACM Conf. Fairness, Accountability, and Transparency (FAccT), 2024, doi: 10.1145/3630106.3658979.
[32] T. Sorensen et al., “Position: A roadmap to pluralistic alignment,” in Proc. 41st Int. Conf. Mach. Learn. (ICML), PMLR vol. 235, 2024, pp. 46280–46302.
[33] D. Collingridge, The Social Control of Technology. London, U.K.: Frances Pinter, 1980.
[34] E. Klein, “Bill Gates’s blunt warning on A.I.,” The Ezra Klein Show, The New York Times, Sep. 29, 2026. [Podcast]. Available: https://www.nytimes.com/2026/09/29/opinion/ezra-klein-podcast-bill-gates.html
[35] J. D. Greene, Moral Tribes: Emotion, Reason, and the Gap Between Us and Them. New York, NY, USA: Penguin Press, 2013.
[36] J. Kleinberg and M. Raghavan, “Algorithmic monoculture and social welfare,” Proc. Natl. Acad. Sci. USA, vol. 118, no. 22, Art. no. e2018340118, 2021, doi: 10.1073/pnas.2018340118.
[37] R. Bommasani, K. A. Creel, A. Kumar, D. Jurafsky, and P. Liang, “Picking on the same person: Does algorithmic monoculture lead to outcome homogenization?” in Adv. Neural Inf. Process. Syst. (NeurIPS), vol. 35, 2022, arXiv:2211.13972.
[38] E. Klein, “Jensen Huang vs. the A.I. doomers,” The Ezra Klein Show, The New York Times, Sep. 23, 2026; rebroadcast in Hard Fork, Sep. 25, 2026. [Podcast]. Available: https://www.nytimes.com/2026/09/25/podcasts/hardfork-ezra-klein-jensen-huang.html. Claims C018, C024 and C025 checked against the transcript inventory in A. Maynard, “L2: Claims inventory. Ezra Klein interviews Jensen Huang (transcript dated 23 Sept 2026),” Late Lessons: Jensen Huang and AI, 2026. [Online]. Available: https://andrewmaynard.net/late-lessons-ai-sept-2026/supporting/huang/lenses/L2-claims.html
[39] D. H. Autor, “Why are there still so many jobs? The history and future of workplace automation,” J. Econ. Perspect., vol. 29, no. 3, pp. 3–30, 2015, doi: 10.1257/jep.29.3.3.
[40] D. Autor, C. Chin, A. Salomons, and B. Seegmiller, “New frontiers: The origins and content of new work, 1940–2018,” Q. J. Econ., vol. 139, no. 3, pp. 1399–1465, 2024, doi: 10.1093/qje/qjae008.
[41] D. Acemoglu and P. Restrepo, “Automation and new tasks: How technology displaces and reinstates labor,” J. Econ. Perspect., vol. 33, no. 2, pp. 3–30, 2019, doi: 10.1257/jep.33.2.3.
[42] T. Veblen, The Theory of the Leisure Class: An Economic Study of Institutions. New York, NY, USA: Macmillan, 1899.
[43] F. Hirsch, Social Limits to Growth. Cambridge, MA, USA: Harvard Univ. Press, 1976.
[44] Bain & Company and Altagamma, “Global luxury stays resilient despite economic headwinds and shifting consumer trends that reshape market,” press release, Nov. 20, 2025. [Online]. Available: https://www.bain.com/about/media-center/press-releases/20252/global-luxury-stays-resilient-despite-economic-headwinds-and-shifting-consumer-trends-that-reshape-marketbain--company-and-altagamma/
[45] L. Chancel, T. Piketty, E. Saez, and G. Zucman, Coords., World Inequality Report 2022. Paris, France: World Inequality Lab, 2022.
[46] L. Addati, U. Cattaneo, V. Esquivel, and I. Valarino, Care Work and Care Jobs for the Future of Decent Work. Geneva, Switzerland: International Labour Office, 2018.
[47] W. J. Baumol, “Macroeconomics of unbalanced growth: The anatomy of urban crisis,” Am. Econ. Rev., vol. 57, no. 3, pp. 415–426, 1967.
[48] T. Eloundou, S. Manning, P. Mishkin, and D. Rock, “GPTs are GPTs: An early look at the labor market impact potential of large language models,” arXiv:2303.10130v5, Aug. 2023. Published version: Science, vol. 384, no. 6702, pp. 1306–1308, 2024, doi: 10.1126/science.adj0998.
[49] D. Acemoglu, “The simple macroeconomics of AI,” Econ. Policy, vol. 40, no. 121, pp. 13–58, 2025, doi: 10.1093/epolic/eiae042.
[50] E. Brynjolfsson, “The Turing Trap: The promise & peril of human-like artificial intelligence,” Daedalus, vol. 151, no. 2, pp. 272–287, 2022, doi: 10.1162/daed_a_01915.
[51] T. Dickerson, “Bill Gates says companies that replace human labor with robots should have to pay the same FICA taxes,” Business Insider, Sep. 30, 2026. [Online]. Available: https://www.aol.com/articles/bill-gates-says-companies-replace-172316000.html
[52] I. Fried, “Bill Gates wants to keep some jobs off-limits to AI,” Axios, Aug. 26, 2026. [Online]. Available: https://www.axios.com/2026/08/26/bill-gates-wants-to-keep-some-jobs-off-limits-to-ai
[53] J. M. Keynes, “Economic possibilities for our grandchildren,” in Essays in Persuasion. London, U.K.: Macmillan, 1931, pp. 358–373.
[54] L. Pecchi and G. Piga, Eds., Revisiting Keynes: Economic Possibilities for Our Grandchildren. Cambridge, MA, USA: MIT Press, 2008, ch. 3 (J. E. Stiglitz, “Toward a general theory of consumerism”) and ch. 9 (R. B. Freeman, “Why do we work more than Keynes expected?”), doi: 10.7551/mitpress/9780262162494.001.0001.
[55] M. C. Jensen and W. H. Meckling, “Theory of the firm: Managerial behavior, agency costs and ownership structure,” J. Financ. Econ., vol. 3, no. 4, pp. 305–360, 1976, doi: 10.1016/0304-405X(76)90026-X.
[56] D. Hadfield-Menell and G. K. Hadfield, “Incomplete contracting and AI alignment,” in Proc. 2019 AAAI/ACM Conf. AI, Ethics, and Society (AIES), 2019, pp. 417–422, doi: 10.1145/3306618.3314250.
[57] P. Sheeran, “Intention–behavior relations: A conceptual and empirical review,” Eur. Rev. Soc. Psychol., vol. 12, no. 1, pp. 1–36, 2002, doi: 10.1080/14792772143000003.
[58] T. L. Webb and P. Sheeran, “Does changing behavioral intentions engender behavior change? A meta-analysis of the experimental evidence,” Psychol. Bull., vol. 132, no. 2, pp. 249–268, 2006, doi: 10.1037/0033-2909.132.2.249.
[59] E. J. Langer, “The illusion of control,” J. Pers. Soc. Psychol., vol. 32, no. 2, pp. 311–328, 1975, doi: 10.1037/0022-3514.32.2.311.
[60] D. A. Moore and P. J. Healy, “The trouble with overconfidence,” Psychol. Rev., vol. 115, no. 2, pp. 502–517, 2008, doi: 10.1037/0033-295X.115.2.502.
[61] D. Kahneman and D. Lovallo, “Timid choices and bold forecasts: A cognitive perspective on risk taking,” Manage. Sci., vol. 39, no. 1, pp. 17–31, 1993, doi: 10.1287/mnsc.39.1.17.
Comentários
Todo comentário passa por moderação antes de aparecer aqui. Nada é publicado automaticamente.
Carregando…