Vom Berechnen eines einzelnen Moleküls bis zur Suche nach unbekannten Lebenssystemen: Sechzig Jahre, in denen KI in die medizinische Forschung Einzug gehalten hat
Von der quantitativen Struktur-Wirkungs-Beziehung im Jahr 1964 über AlphaFold und KI-Forschungs-Agenten bis hin zu Claude, der ART entdeckt: Was die KI wirklich verändert, ist nicht, dass der zehnjährige Forschungs- und Entwicklungszyklus einfach auf Schnellvorlauf gestellt wird, sondern dass die unterschiedlichen Zeitanteile in der medizinischen Forschung neu verteilt werden.
21 Stunden, etwa 950 KI-Agenten, 210 Millionen Token: Claude bemerkte in der Bakteriophagen-DNA ein bisher nicht charakterisiertes System. Aber in diesem Artikel geht es nicht um das „nächste CRISPR“. Was mich mehr interessiert, ist: Welche Zeitanteile in der medizinischen Forschung werden seit sechzig Jahren von der KI übernommen? Und welche Zeitanteile gehören bis heute noch dem Leben selbst?
Im September 2026 stellte Anthropic Claude eine Aufgabe, die nicht besonders spektakulär klingt: In einer riesigen DNA-Datenbank nach reversen Transkriptasen suchen, die sich für weitere Forschungen eignen.
In den folgenden 21 Stunden beteiligten sich etwa 950 KI-Agenten an der Suche und verbrauchten 210 Millionen Token. Sie sammelten mehr als 200.000 reverse Transkriptasen, filterten 3500 neue Kandidatensysteme heraus und engten die Auswahl schließlich auf 20 Objekte ein, die sich am meisten für weitere Analysen eignen.
Als einer der Agenten entlang eines Abschnitts der Bakteriophagen-DNA weiter voranschritt, bemerkte er, dass neben der reversen Transkriptase eine ungewöhnlich ordentliche Reihe von Wiederholungssequenzen angeordnet war.
Er hielt an.
Er zählte die Anzahl der Wiederholungen, maß die Abstände, verglich sie mit bekannten Systemen und prüfte, ob jemand zuvor schon darüber berichtet hatte.
In der Organisationsform des Wiederholungsarrays erinnerte es an CRISPR.
Schematische Darstellung: Nachgezeichnet anhand des von Anthropic veröffentlichten Ablaufs. Der Schwerpunkt liegt nicht darauf, dass „ART bereits gleich CRISPR ist“, sondern dass der Agent im Rahmen der festgelegten Aufgabe von den großen Kandidatenmengen weiter zu einem ungewöhnlichen Wiederholungsarray vordringt; die hauptsächliche biologische Funktion von ART wird noch erforscht.
Nach weiteren Analysen und Experimenten identifizierte das Anthropic-Team dieses Muster als ein bisher nicht charakterisiertes System und nannte es ART – array-associated reverse transcriptases, also das array-assoziierte reverse Transkriptase-System. Erste Experimente des Teams ergaben außerdem, dass diese Wiederholungsarrays eine Gruppe kurzer RNAs exprimieren; aber welche biologische Funktion ART genau erfüllt, ist bis heute noch nicht bekannt. Alle Nasslaborexperimente wurden nach wie vor von menschlichen Wissenschaftlern durchgeführt.
Es ist also noch zu früh, ART jetzt schon als „nächstes CRISPR“ zu bezeichnen.
Aber wenn man nur darauf achtet, ob ART am Ende zu einem Genbearbeitungswerkzeug wird, könnte man den bemerkenswerteren Aspekt dieser Sache verpassen: Etwa 950 KI-Systeme haben sich in 21 Stunden in eine DNA-Welt begeben, die kein Wissenschaftler jemals vollständig durchsehen könnte, und beginnen im Rahmen einer von Menschen definierten Forschungsfrage mit zu beurteilen, wo es sich lohnt, anzuhalten und genauer hinzusehen.
Welche Zeitanteile in der medizinischen Forschung werden von der KI übernommen?
Das „medizinische Forschung“, von dem ich hier spreche, verwende ich in einem etwas breiteren Sinne: von der grundlegenden Biowissenschaft und der Wirkstoffentdeckung bis hin zur klinischen Validierung am Menschen. Denn die zehn Jahre, die ein Arzneimittel letztendlich in Anspruch nimmt, ergeben sich ja aus der Überlagerung all dieser unterschiedlichen Zeitanteile.
Vor sechzig Jahren stellte man zuerst die Frage: Kann man vor dem Experiment rechnen?
1964 veröffentlichten der amerikanische Chemiker Corwin Hansch und der japanische Wissenschaftler Toshio Fujita eine Arbeit, die später zu einem klassischen Dokument der quantitativen Struktur-Wirkungs-Beziehung wurde, in der sie versuchten, chemische Struktur und biologische Aktivität mit quantitativen Methoden zu verbinden.
Das war natürlich noch keine KI im heutigen Sinne.
Aber die dahinterstehende Frage tauchte später immer wieder in der computergestützten Wirkstoffforschung auf: Muss man eine Verbindung erst herstellen und dann experimentieren, um herauszufinden, ob sie eine bestimmte biologische Aktivität haben könnte? Oder kann man vor dem Experiment erst einmal rechnen?
Ein Jahr später begannen Edward Feigenbaum und Joshua Lederberg von Stanford mit der Arbeit, die später als DENDRAL bekannt wurde. In frühen Dokumenten von 1965 wurde die ursprüngliche Frage direkt als „maschinelles Induktionsforschungsprojekt“ bezeichnet; später wurde DENDRAL zu einem repräsentativen Fall in der Geschichte der Expertensysteme, bei dem Computer an der Ableitung von Molekülstrukturen aus experimentellen Informationen beteiligt waren.
Schematische Darstellung: Die quantitative Struktur-Wirkungs-Beziehung von 1964 und DENDRAL um 1965 repräsentieren zwei frühe Wege: die „Berechenbarkeit der Forschungsobjekte“ und die „Berechenbarkeit des Forschungsprozesses“. Dies ist eine historische Strukturdarstellung, QSAR wird nicht direkt mit KI im heutigen Sinne gleichgesetzt.
Mehr als sechzig Jahre später ist es sehr interessant, diese beiden Dinge zusammen zu betrachten.
Auf der einen Seite versucht man, die Objekte der Lebens- und Wirkstoffforschung berechenbar zu machen; auf der anderen Seite begann man bereits, Teile des Prozesses zu übergeben, bei dem Wissenschaftler von den Beweisen zu Urteilen gelangen, an Maschinen.
Die KI ist nicht in den letzten Jahren plötzlich in medizinische Labore eingedrungen. Sie übernimmt einen Prozess der „Berechenbarkeit der Forschung“, der bereits seit sechzig Jahren läuft.
Und eines der Dinge, die in dieser Geschichte immer wieder passieren, ist, Versuch und Irrtum, der sonst nur in der teuren, langsamen realen Welt durchgeführt werden kann, so weit wie möglich vorzuverlegen in die rechnerische Welt.
Das Erste, was die Maschinen übernahmen, waren viele Experimente, die sich am Ende als überflüssig erweisen würden
Die Wirkstoffentwicklung steht seit jeher vor einer sehr einfachen Schwierigkeit: Es gibt zu viele Möglichkeiten.
Die Anzahl möglicher Verbindungen übersteigt bei weitem die Menge, die jedes Labor einzeln synthetisieren und testen kann.
Deshalb ist einer der Kernwerte, den die Informatik seit Jahrzehnten in die Wirkstoffentwicklung einbringt, nicht das Abschaffen von Experimenten, sondern vor dem eigentlichen Handeln so weit wie möglich zu beantworten: Welche von all diesen Möglichkeiten soll man zuerst ausprobieren?
Im Jahr 2020 zeigte eine Studie zur Suche nach neuen antimikrobiellen Verbindungen diese Veränderung besonders anschaulich.
Die Forscher fanden zuerst mit einem Deep-Learning-Modell im Drug Repurposing Hub einen Kandidaten, der später den Namen Halicin erhielt; in derselben Studie wurde das Modell auf mehr als 107 Millionen ZINC15-Moleküle angewendet. Am Ende wurden nur 23 hochprioritäre Vorhersagen tatsächlich im Labor getestet, von denen 8 antimikrobielle Aktivität zeigten.
Mehr als 100 Millionen, und 23.
Nicht dass die Experimente plötzlich hundertmillionenfach schneller geworden sind, sondern dass für hundertmillionen Möglichkeiten keine hundertmillionen Experimente mehr nötig sind.
Die Bakterien sind nicht schneller gewachsen. Die Zeit, die ein Wirkstoff auf Zellen einwirkt, hat sich nicht geändert. Komprimiert wurde die große Menge an Suchvorgängen vor den Experimenten.
Die KI lässt die reale Welt oft nicht schneller laufen. Sie hilft den Forschern nur, viele Wege zu vermeiden, die man sonst erst betreten müsste, um zu erkennen, dass sie Sackgassen sind.
Nach AlphaFold wurde der Endpunkt einiger Leute zum Ausgangspunkt anderer
Um das Jahr 2020 herum machte diese Veränderung einen großen Schritt nach vorne.
Proteinstrukturen gehören zu den grundlegenden Informationen in den Biowissenschaften. Wenn wir die Aminosäuresequenz eines Proteins kennen, bedeutet das noch nicht, dass wir bereits wissen, wie es funktioniert. Die dreidimensionale Struktur, die durch die Faltung des Proteins entsteht, ist oft ein wichtiger Einstiegspunkt, um Funktionen, Krankheitsmechanismen und die Wirkung von Wirkstoffen zu verstehen.
Aber lange Zeit waren diese Strukturen sehr teuer zu ermitteln.
In der AlphaFold-2-Arbeit von 2021 heißt es, dass damals etwa nur 100.000 einzigartige Proteinstrukturen experimentell ermittelt wurden, während die Anzahl der bekannten Proteinsequenzen bereits in die Milliarden geht; die Bestimmung einer Proteinstruktur kann Monate oder sogar Jahre Arbeit erfordern.
AlphaFold hat den Strukturexperimenten deshalb nicht ihren Wert genommen. Proteine sind keine unbeweglichen Skulpturen, und Modellvorhersagen entsprechen nicht allen Konformationen und Wechselwirkungen in der realen Umgebung.
Es hat etwas anderes verändert: Viele Forschungen können zuerst eine hochwertige Strukturvorhersage erhalten, bevor sie entscheiden, wo sie die folgenden Fragen ansetzen.
Schematische Darstellung: AlphaFold hat Strukturexperimente nicht abgeschafft, sondern ermöglicht es vielen Forschungen, von hochwertigen Vorhersagen auszugehen. 2022 erweiterte sich die AlphaFold Database auf mehr als 200 Millionen vorhergesagte Strukturen.
Bis 2022 wurde die AlphaFold Protein Structure Database von weniger als 1 Million vorhergesagten Strukturen auf über 200 Millionen erweitert, die fast alle damals katalogisierten Proteine abdecken.
Das lässt sich kaum als „ein Experiment ist um 20 % schneller“ verstehen. Es ist eher so, als gäbe es plötzlich eine Landkarte.
Früher musste ein Forscher, der an einen bestimmten Ort gehen wollte, vielleicht zuerst selbst das Gelände vermessen. Die Leute danach öffnen die Landkarte und können bei dem nächsten Weg anfangen.
Die tiefste Beschleunigung durch KI besteht nicht unbedingt darin, dieselbe Sache schneller zu machen, sondern dass nachfolgende Personen nicht mehr am selben Punkt anfangen müssen.
Wissen, das ursprünglich der Endpunkt eines Forschungsprojekts war, kann später zum selbstverständlichen Ausgangspunkt eines anderen Forschungsprojekts werden.
Aber der menschliche Körper kann immer noch „nein“ sagen
Wenn man die Geschichte bis hierher erzählt, entsteht leicht die Intuition: Die Rechenleistung wird immer schneller, die Modelle immer genauer, also wird die Wirkstoffentwicklung natürlich auch immer schneller.
Die Realität ist nicht so geordnet.
2020 kündigten das japanische Sumitomo Pharma und das britische Unternehmen Exscientia an, dass ein Kandidatenwirkstoff namens DSP-1181 in die Phase-I-Studie eintritt.
Sumitomo Pharma sagte damals in einer offiziellen Mitteilung, dass DSP-1181 die explorative Forschungsphase in weniger als 12 Monaten abgeschlossen habe, während die durchschnittliche Zeit nach der Mitteilung bei herkömmlichen Methoden etwa 4,5 Jahre beträgt.
Weniger als ein Jahr gegenüber 4,5 Jahren.
Wenn die Geschichte hier aufhörte, wäre sie fast ein perfektes Plakat für die „KI-beschleunigte Pharmaproduktion“.
Aber später wurde die Entwicklung von DSP-1181 eingestellt. Sumitomo Pharma bestätigte danach, dass es die in der Phase-I-Studie für diesen Wirkmechanismus festgelegten Kriterien nicht erfüllt hat.
Die Maschine hat den Wirkstoff schneller vor den menschlichen Körper gebracht, aber die Antwort des Körpers kann immer noch „nein“ lauten.
Das soll nicht beweisen, dass die KI-gestützte Pharmaproduktion gescheitert ist. Es erinnert uns nur daran: Einen Kandidatenwirkstoff zu finden, der kliniktauglich zu sein scheint, und zu beweisen, dass er echte Patienten heilen kann, sind zwei unterschiedliche Probleme.
Bereits 2012 beschrieben Jack Scannell und Kollegen ein später sehr bekanntes Paradoxon: In den letzten Jahrzehnten haben sich Informatik, Molekularbiologie, Hochdurchsatz-Screening und Forschungsmanagement stetig weiterentwickelt, aber berechnet nach den inflationsbereinigten Forschungsausgaben ist die Anzahl neuer Arzneimittel pro 1 Milliarde US-Dollar seit 1950 etwa alle 9 Jahre um die Hälfte gesunken, insgesamt um etwa das 80-fache. Sie nannten dieses Phänomen „Eroom's Law“ – also Moore umgekehrt.
Vierzehn Jahre später, im August 2026, betrachtete *Nature Reviews Drug Discovery* die KI-gestützte Pharmaproduktion erneut und die Schlussfolgerung blieb sehr zurückhaltend: Derzeit sind die Beweise für klinisch relevante Auswirkungen der KI in der Wirkstoffentdeckung noch begrenzt; die Autoren sind der Meinung, dass die Branche ihre Aufmerksamkeit von „wie genau das Modell selbst ist“ zu „ob das Modell tatsächlich die Forschungsentscheidungen verbessert“ lenken muss.
Die Wirkstoffentwicklung ist nie ein einziger Zeitblock, den man gemeinsam auf Schnellvorlauf stellen kann.
Bis 2026 gehören zu den komprimierten Zeitanteilen auch das Lesen und die Aufmerksamkeit der Wissenschaftler
Die Veränderungen, die in diesem Jahr aufgetreten sind, gingen noch einen Schritt weiter.
Co-Scientist, das in *Nature* veröffentlicht wurde, akzeptiert nicht mehr nur ein bestimmtes Molekül und prognostiziert eine Eigenschaft. Die Forscher geben zuerst das Forschungsziel vor, danach durchsuchen mehrere Agenten die Literatur, erzeugen Hypothesen, kritisieren sich gegenseitig, rangieren und iterieren weiter, bis einige biomedizinische Hypothesen schließlich in die experimentelle Validierung übergehen.
Aber ich bevorzuge ein anderes Beispiel.
Robin, das ebenfalls in *Nature* veröffentlicht wurde, wurde zur Erforschung der trockenen altersbedingten Makuladegeneration eingesetzt. Es verbindet Literatursuche, Aufarbeitung von Krankheitsmechanismen, Kandidatenhypothesen, Wirkstoffscreening, Experimentvorschläge und die Analyse von Experimentergebnissen miteinander.
Die Arbeit nennt eine auffällige Zahl: Robin analysierte in einem Durchgang 551 Arbeiten in 30 Minuten. Die Autoren schätzten anhand vorhandener Studien zum akademischen Lesen, dass ein Mensch für die entsprechende Menge an Lesearbeit und Informationsverarbeitung etwa 294 Stunden brauchen würde; der gesamte kognitive Arbeitsablauf wurde von geschätzten 359–424 menschlichen Arbeitsstunden auf weniger als 2 Stunden reduziert.
Das ist kein strenger Wettbewerb zwischen Mensch und Maschine. Die 294 Stunden sind eine Schätzung, die auf vorhandenen Lesestudien basiert, und die echten Experimente werden nach wie vor von Menschen durchgeführt.
Aber selbst wenn man diese Zahl stark herunterrechnet, bleibt die Veränderung bestehen: Die große Menge an Zeit in der wissenschaftlichen Forschung, die früher für Lesen, Suchen, Aufarbeiten, Vergleichen und Organisieren von Hypothesen aufgewendet wurde, beginnt in den Bereich zu gelangen, den Maschinen parallel verarbeiten können.
Früher war ein Wissenschaftler bei Hunderten von Arbeiten zuerst durch seine eigene Zeit und Aufmerksamkeit beschränkt. Jetzt wird die neue Frage allmählich: Die Maschine hat so viele mögliche Richtungen geliefert – welche davon lohnt es sich wirklich, mit experimentellen Ressourcen zu validieren?
Auch Anthropic ist auf dieses Problem gestoßen. Sie sagen, dass eine Forschungskampagne Hunderte bis Tausende von Kandidatenberichten erzeugen kann, sodass „welche Hypothesen sich für Experimente lohnen“ selbst zum Forschungsobjekt wird.