Eine Gruppe von Anthropic-Forschern, die planen, aus der Bay Area zu „fliehen“
Einige der frühesten Mitarbeiter von Anthropic haben kürzlich begonnen, den Kauf von Grundstücken in abgelegenen Regionen der Vereinigten Staaten zu erwägen. Sie stellen sich vor, dass diese Orte Zufluchtsorte sein könnten, falls die KI wirklich außer Kontrolle gerät.
„Nichts wird jemals wieder so ruhig wie zuvor.“ Auf den Computern einiger Forscher klebt derselbe Satz.
Tatsächlich ist der Gedanke an die Flucht nicht plötzlich aufgetaucht. Seit mehr als zehn Jahren diskutiert eine Gruppe von KI-Sicherheitsforschern, die sich in der San Francisco Bay Area versammelt haben, über das, was passieren könnte, wenn die KI außer Kontrolle gerät. Zu diesem Zeitpunkt war Anthropic noch nicht einmal gegründet.
Jemand hat einen Co-Working-Space in Berkeley eingerichtet und über Weltuntergangsszenarien in privaten Slack-Kanälen diskutiert. Einige haben darüber nachgedacht, den pazifischen Inselstaat Nauru zu kaufen, andere haben sich vorgestellt, elektromagnetische Abschirmeinrichtungen in der Wüste zu bauen.
Später sind viele Personen aus diesem Kreis zu OpenAI gewechselt und um das Jahr 2020 herum Gründungsmitglieder und frühe Forscher von Anthropic geworden. Anthropic ist heute eines der wichtigsten KI-Unternehmen der Welt, aber die vor mehr als zehn Jahren gebildete Denkweise über KI-Risiken ist mit dem Wachstum des Unternehmens nicht verschwunden.
Anfang September dieses Jahres kehrte dieses Problem plötzlich in die reale Ebene zurück. Damals kündigte der Anthropic-Forscher Jacob Coxon seinen Rücktritt an. Er schrieb auf X, dass die Personen, die KI aufbauen, „aufrichtig glauben, dass sie uns alle vor 2030 töten könnte“. Dieser Beitrag erhielt 174 Millionen Aufrufe und ließ diese Sorge, die lange Zeit nur im inneren Kreis der KI-Sicherheitsgemeinschaft existierte, in die Öffentlichkeit gelangen.
Ehemaliger Anthropic-Forscher Jacob Coxon
Heute beginnen diese als „KI-Apokalyptiker“ bezeichneten Personen, über ein anderes realeres Problem nachzudenken: Wenn Sie wirklich glauben, dass KI die Menschheit zerstören könnte, wie sollten Sie dann leben?
01
Der Weltuntergangs-Club in Berkeley
Um die Denkweise dieser Gruppe heute zu verstehen, muss man die Zeit auf etwa 2010 zurückdrehen.
Damals hatte die KI-Industrie in der San Francisco Bay Area noch nicht das heutige Ausmaß. Um die langfristigen Risiken der KI herum bildete sich ein kleines, aber eng vernetztes Netzwerk von Forschern und Anhängern des effektiven Altruismus. Eliezer Yudkowsky war einer der wichtigsten Vertreter davon.
Eliezer Yudkowsky
Um das Jahr 2000 herum begann Yudkowsky, über Probleme wie außer Kontrolle geratene künstliche Intelligenz und Superintelligenz in Blogs und der später entstandenen LessWrong-Community zu diskutieren. Einige Jahre später fand diese Denkweise allmählich Eingang in die Tech-Kreise der Bay Area und die Gemeinschaft des effektiven Altruismus.
Um das Jahr 2008 herum nahm Dario Amodei, der noch in Princeton seinen Doktortitel machte, bereits an Diskussionen in Gemeinschaften wie GiveWell teil. Holden Karnofsky, Gründer von GiveWell, wurde später eine wichtige Figur in diesem Kreis. Amodei selbst beteiligte sich auch 2008 an Diskussionen im GiveWell-Blog.
Anthropic-Mitbegründer Dario Amodei
Um das Jahr 2013 herum begann dieser Kreis, ein engeres Lebens- und Arbeitsnetzwerk in San Francisco zu bilden.
Nachdem GiveWell von New York in die Bay Area umgezogen war, kamen Karnofsky und Amodei sich immer näher. Karnofsky wohnte später in Amodeis Haus in der Nähe von San Franciscos Glen Park, das allmählich zu einem Treffpunkt für eine Gruppe von KI-Sicherheitsforschern, Anhängern des effektiven Altruismus und Langfristdenkern wurde.
Amodei, der später zu einer Schlüsselfigur von Anthropic wurde, sowie seine Schwester Daniela Amodei, Jared Kaplan, Chris Olah und andere standen alle in Verbindung zu diesem Kreis.
Sie diskutierten nicht nur über KI. Auch globale katastrophale Risiken wie Kometeneinschläge und Supervulkane waren häufige Themen in diesem Kreis.
Karnofsky kam später allmählich zu der Überzeugung, dass KI-Sicherheit eines der wenigen Felder sein könnte, in dem man mit relativ begrenzten Ressourcen die Zukunft der gesamten Menschheit beeinflussen kann. Selbst wenn die Wahrscheinlichkeit einer Katastrophe durch außer Kontrolle geratene KI nur 5 % beträgt, lohnt es sich, viel Energie in die Forschung zu stecken.
Einige Jahre später trat ein Teil dieser Gruppe zu OpenAI. Zwischen 2020 und 2021 verschärften sich die Meinungsverschiedenheiten über die Entwicklungsrichtung und die Sicherheit von KI weiter. Amodei und andere verließen OpenAI und gründeten Anthropic im Jahr 2021. Das Unternehmen stellte von Anfang an KI-Sicherheit und Kontrollierbarkeit in den Mittelpunkt.
2023 wurde Constellation gegründet. Es betreibt einen Co-Working-Space in Berkeley für KI-Sicherheitsforscher und bringt Forscher aus verschiedenen Organisationen wie Non-Profit-Einrichtungen, Universitäten, KI-Unternehmen und Think Tanks zusammen. Bis 2024 hat Constellation das Visiting Researcher-Programm und das Astra Fellowship gestartet, die speziell KI-Sicherheitsforschern eine Umgebung bieten, in der sie gemeinsam in Berkeley arbeiten können.
Das Bürogebäude in Berkeley, Kalifornien, wo sich der Co-Working-Space von Constellation befindet
Hier versammeln sich Forscher von Anthropic, OpenAI, SpaceXAI unter Elon Musks Leitung und anderen KI-Sicherheitseinrichtungen sowie unabhängige Forscher. Sie essen gemeinsam vegetarisch, trinken Tee, diskutieren bei monatlichen Abendessen und Happy Hours über die neuesten Fortschritte der KI und auch über ein schwerwiegenderes Problem: Was passiert, wenn die KI wirklich außer Kontrolle gerät?
Constellation beschreibt heute sein Ziel als Hilfe für die Welt, auf transformative KI sicher zu reagieren, und führt Forschungen zu Themen wie „Alignment“, „Kontrolle“, „Governance“ und Risikokommunikation durch. Viele Teilnehmer der seit 2024 laufenden Projekte sind später zu Einrichtungen wie Anthropic, OpenAI, Google DeepMind und Redwood Research gewechselt.
Die Finanzierung hinter dieser Gemeinschaft stammt ebenfalls aus dem KI-Sicherheitskreis. 2024 stellte Open Philanthropy Constellation eine große finanzielle Unterstützung zur Verfügung. Open Philanthropy wird von Dustin Moskovitz, Mitbegründer von Facebook, unterstützt und ist eine der wichtigen Finanzierungsquellen der Bewegung des effektiven Altruismus. Später wurde es in Coefficient Giving umbenannt.
Vom privaten Wohnhaus um das Jahr 2013 bis zum Co-Working-Space in Berkeley nach 2023 hat sich dieser Kreis stark verändert. Aber die Probleme, über die sie diskutieren, sind fast unverändert.
02
Fünfhundert Millionen Dollar und der „Zufluchtsort“
In der Anfangszeit von Anthropic brauchte das Unternehmen große Mengen an Kapital.
Einer der Investoren, die Amodei fand, war Sam Bankman-Fried, Gründer der Kryptowährungsbörse FTX. Damals war er ein schnell aufsteigender junger Milliardär, der auch über die FTX-Stiftung große Summen in Bereiche wie den effektiven Altruismus investierte.
Zwischen 2021 und 2022 investierte Bankman-Fried 500 Millionen Dollar in Anthropic, etwa das Fünffache des ursprünglich von Amodeis Team vorgeschlagenen Betrags. Dadurch wurde FTX zu einem der größten frühen Anteilseigner von Anthropic.
FTX-Gründer Sam Bankman-Fried
In diesem Kreis ist die Diskussion über das KI-Weltuntergangsszenario längst über die theoretische Ebene hinausgegangen.
Ein Insolvenzverfahrensdokument aus dem Jahr 2023 zeigt, dass ein leitender Angestellter der FTX-Stiftung mit Kollegen über den Kauf des pazifischen Inselstaats Nauru diskutiert hat. Der Plan war, dort einen „Bunker/Zufluchtsort“ zu bauen, um auf ein Ereignis zu reagieren, das möglicherweise „50 % bis 99,99 % der Menschen tötet“. Das Dokument stellte sich sogar vor, nach einer Katastrophe die nächste Generation von Menschen im Labor aufzuziehen.
Innen im KI-Sicherheitskreis tauchten andere ähnliche Ideen auf: Kauf abgelegenere Inseln, Bau elektromagnetischer Abschirmeinrichtungen in der Wüste, Horten von Jodtabletten und sogar die Suche nach abgeschlossenen Räumen für langfristiges Überleben in extremen Situationen.
2022 wurde diese Atmosphäre sogar auf die Bahamas übertragen. Eine Gruppe von Forschern aus Anthropic und anderen KI-Labors sowie Anhänger des effektiven Altruismus nahmen an einer von Lightcone Infrastructure organisierten Veranstaltung teil.
Lightcone Infrastructure ist eine Organisation, die eng mit Yudkowsky und der LessWrong-Community verbunden ist. Die Veranstaltung fand in einem Resort auf der Insel Eleuthera statt. Auf dem Programm standen sowohl reguläre Aktivitäten wie Sonnenuntergangsyoga und Klippenspringen als auch Diskussionen über KI-Risiken und den effektiven Altruismus.
FTX hat den Veranstaltungsort für die Veranstaltung gebucht. Die Organisatoren kauften sogar das gesamte pflanzliche Fleisch in den örtlichen Geschäften, um die Ernährungsbedürfnisse der Teilnehmer zu erfüllen. Caroline Ellison nahm auch an dieser Veranstaltung teil. Damals war sie Leiterin von Alameda Research und die ehemalige Freundin von Bankman-Fried. Wie viele Personen in diesem Kreis machte sie sich Sorgen über die möglichen Risiken der KI-Entwicklung und investierte später 10 Millionen Dollar in Anthropic.
Caroline Ellison, ehemalige Freundin von Sam Bankman-Fried und Anthropic-Investorin
Der Anthropic-Forscher Evan Hubinger beteiligte sich an den KI-Sicherheitsdiskussionen. Er wurde später ein wichtiger Forscher, der sich mit dem „Alignment“ von KI und deren betrügerischem Verhalten befasste, und hat öffentlich geschätzt, dass die Wahrscheinlichkeit eines durch KI verursachten menschlichen Aussterbens in den nächsten zehn Jahren über 10 % liegt.
Bei einem Mittagsevent wurde ausdrücklich festgelegt, dass nur Personen teilnehmen dürfen, die glauben, dass die Wahrscheinlichkeit des menschlichen Aussterbens in den nächsten 100 Jahren 75 % oder mehr beträgt.
Ebenfalls im Jahr 2022 tauchten ähnliche Diskussionen auf der Globalen Konferenz des effektiven Altruismus in San Francisco auf. Mindestens 20 Anthropic-Mitarbeiter haben sich für die Teilnahme registriert, darunter zwei Mitbegründer.
Nach der Konferenz veranstaltete Lightcone eine Party im Rose Garden Hotel in Berkeley, und auf der Getränkekarte erschien ein Cocktail namens „Würdevoller Tod“. Dieser Name stammt aus einem früheren Artikel Yudkowskys, in dem er die Überlebenschancen der Menschheit im KI-Zeitalter diskutierte. Später wurde dieses Hotel von Lightcone gekauft und in Lighthaven umbenannt, das zu einem neuen Treffpunkt dieser Gemeinschaft wurde.
Aber FTX stürzte bald zusammen.
Ende 2022 meldete FTX Insolvenz an, und die Anteile von Anthropic wurden anschließend verkauft, um die Gläubiger zu bezahlen. Bankman-Fried wurde schließlich zu 25 Jahren Haft verurteilt, Ellison wurde im Zusammenhang mit dem Zusammenbruch von FTX verurteilt und kam aus dem Gefängnis, und ihre Anteile an Anthropic wurden von der Bundesregierung eingezogen.
Für Anthropic ist diese Beziehung allmählich Vergangenheit geworden. Aber die Linie der KI-Sicherheit ist nicht verschwunden.
03
KI lernt allmählich, zu „täuschen“
Nach dem FTX-Ereignis begann Anthropic, Kapital von traditionellen Investoren zu beschaffen. Das Unternehmen bemühte sich auch, Abstand zur Bewegung des effektiven Altruismus zu halten, und die Größe des Unternehmens ist inzwischen auf mehr als 3500 Mitarbeiter an