Wenn du diese 5 KI-Begriffe verstehst, übertriffst du 90 % der Menschen.
Shenyi ist ein Übersetzungsteam unter 36Kr, das sich auf Bereiche wie Technik, Wirtschaft, Berufsleben und Alltag konzentriert und vor allem neue Technologien, neue Ansichten und neue Trends aus dem Ausland vorstellt.
Anmerkung der Redaktion: Die Verbreitung von künstlicher Intelligenz nimmt derzeit stetig zu, aber die meisten Nutzer bleiben auf der Ebene grundlegender Operationen und verstehen die zugrunde liegenden Kernkonzepte nur unvollständig. Dieser Artikel hilft Ihnen, schnell ein grundlegendes Verständnis aufzubauen, Nutzungsfehler zu vermeiden und KI-Tools wissenschaftlicher und effizienter einzusetzen. Dieser Artikel stammt aus einer Übersetzung und hofft, Sie zu inspirieren.
KI-generiertes Bild
Ehrlich gesagt, wenn die meisten Menschen über künstliche Intelligenz sprechen, rezitieren sie entweder steif die schriftliche Definition oder sind völlig verwirrt, wenn sie auf Begriffe wie große Sprachmodelle oder neuronale Netze stoßen.
Sie müssen nicht zu diesen beiden Gruppen gehören. Ich bin der Ansicht, dass Sie, solange Sie die folgenden 5 Begriffe und 5 Kernkonzepte wirklich beherrschen, unabhängig davon, ob Sie in der Technik-, Wirtschafts- oder Bildungsbranche tätig sind oder einfach nur neugierig auf die Entwicklung der Welt sind, ein weitaus besseres Verständnis haben werden als die überwiegende Mehrheit der Menschen in Ihrer Umgebung.
Im Folgenden beginnen wir mit der Erläuterung.
I. Tokens
Zuerst müssen Sie ein grundlegendes Allgemeinwissen merken: KI-Modelle lesen keine vollständigen Wörter direkt und erkennen nicht einmal einzelne Buchstaben. Die kleinste Einheit, mit der sie Informationen verarbeiten, sind Tokens.
Was sind dann Tokens?
Sie können sich vorstellen, dass Sie ein Buch lesen, aber nicht wortweise, sondern in segmentierte Teile aufgeteilt. Einige Segmente sind vollständige Wörter, z. B. „Katze“; andere sind nur Teile von Wörtern, z. B. das Präfix „un-“; auch Satzzeichen werden separat als Tokens gezählt. Diese aufgeteilten Textsegmente sind Tokens.
Zum Beispiel wird der Satz „Ich liebe Pizza essen“ in 3 Tokens aufgeteilt: „Ich“, „liebe essen“, „Pizza“.
Warum ist dieses Konzept wichtig?
Alle KI-Produkte wie ChatGPT und Gemini zählen im Hintergrund ständig die Anzahl der Tokens. Je mehr Tokens Ihre eingegebene Frage enthält, desto größer ist der Arbeitsaufwand, den das Modell verarbeiten muss; je mehr Tokens die KI zur Generierung der Antwort erzeugt, desto höher sind die Betriebskosten.
Das sogenannte Context Window des Modells misst die Gesamtzahl der Tokens, die das Modell einmalig im „Gedächtnis“ speichern kann. Frühere alte Modelle konnten nur 4000 Tokens verarbeiten, während neuere Modelle bereits eine Million Tokens unterstützen.
Dies erklärt auch, warum KI in langen Gesprächen den vorherigen Inhalt vergisst: Sobald der Gesprächsinhalt das Kontextfenster ausfüllt, werden die zuerst eingegebenen Tokens gelöscht, genau wie wenn der Arbeitsspeicher des Computers voll ist und er langsam läuft.
Tokens sind die kleinste grundlegende Einheit des Sprachsystems der künstlichen Intelligenz. Wenn Sie sie verstehen, können Sie nachvollziehen, warum einige Prompt-Wörter besser wirken, warum KI in langen Gesprächen leicht „Gedächtnisverlust“ hat und warum die Abrechnungsstandards für Schnittstellen pro tausend Tokens berechnet werden.
II. Kontextfenster (Context Window)
Stellen Sie sich vor, Sie unterhalten sich mit einer Person, deren Gedächtnis eine klare Obergrenze hat: Sie kann sich nur an den Gesprächsinhalt der letzten Zeit erinnern, und alle früheren Inhalte werden vollständig gelöscht und vergessen. Das ist das Kontextfenster.
Es bezieht sich auf die gesamte Textmenge, die ein KI-Modell einmalig lesen und als Referenz verwenden kann. Die Maßeinheit sind Tokens, einschließlich Ihrer Anweisungen, des vollständigen Chat-Protokolls, aller hochgeladenen Dokumente und aller Antworten, die das Modell zuvor generiert hat.
Sie können es mit einer weißen Tafel vergleichen: Das Kontextfenster ist die Größe der Tafel. Sie können beliebige Inhalte darauf schreiben, aber sobald sie voll ist, müssen Sie alte Inhalte löschen, um neue Inhalte schreiben zu können.
Ein weiterer interessanter Punkt: Ein kleines Kontextfenster (z. B. 4000 Tokens) bedeutet, dass die KI nur eine kleine Textmenge auf einmal verarbeiten kann. Wenn Sie ihr ein langes Dokument geben, kann sie es nur abschnittsweise lesen. Bei einem sehr großen Kontextfenster (z. B. 200.000 Tokens) können Sie direkt ein ganzes Buch einfügen und das Modell dann bitten, es zu interpretieren.
Das ist auch der Grund, warum die Branche begeistert war, als Claude die Unterstützung für 200.000 Tokens Kontext ankündigte und Gemini die Obergrenze auf eine Million Tokens erweiterte. Denn diese Fähigkeit erweitert die Anwendungsgrenzen von KI grundlegend.
Wenn Sie wichtige Arbeiten wie die Zusammenfassung langer Dokumente oder Datenanalyse durchführen, müssen Sie sich bewusst sein, dass KI den Inhalt des früheren Gesprächs vergessen kann. Das ist kein Programmfehler, sondern nur, dass der Platz dieser „weißen Tafel“ aufgebraucht ist.
III. Temperaturparameter (Temperature)
Das ist das Konzept, das ich am liebsten erkläre – sobald Sie es einmal gehört haben, werden Sie es sich merken können.
Wenn Sie die KI dazu auffordern, Text zu generieren, gibt es einen Parameter namens Temperatur, der speziell die Zufälligkeit und Vorhersehbarkeit des Ausgabeinhalts bestimmt.
Niedrige Temperatur (Wert nähert sich 0): Der Ausgabestil der KI ist konservativ und sicher. Sie wählt jedes Mal das wahrscheinlichste und üblichste Vokabular aus. Der Inhalt ist einheitlich und korrekt, aber etwas langweilig, genau wie eine Person, die immer dieselbe E-Mail-Vorlage verwendet.
Hohe Temperatur (Wert nähert sich 1 oder sogar höher): Die KI ist eher bereit, aus dem Üblichen auszubrechen, und wählt neuartiges Vokabular, einzigartige Satzstrukturen und kreative Ideen. Die erzeugten Inhalte sind manchmal sehr hervorragend, aber die Stabilität ist nicht garantiert.
Ein anschauliches Beispiel: Lassen Sie die KI den Satz „Die kleine Katze sitzt auf …“ vervollständigen.
Im Modus mit niedriger Temperatur wird sie fast nur „auf dem Kissen“ oder „auf dem Boden“ ausgeben – sicher und ohne Überraschungen;
Im Modus mit hoher Temperatur kann sie schreiben „auf dem philosophischen Dilemma“ oder „auf dem Gipfel des zusammenbrechenden Imperiums“.
Das ist sehr kreativ, aber für das Verfassen von Rechtsdokumenten völlig ungeeignet.
Hier verbergen sich die impliziten Nutzungsregeln, die die meisten Menschen nicht kennen:
1. Bei faktenbasierten Arbeiten (Inhaltszusammenfassung, Codeerstellung, Informationsextraktion): Senken Sie die Temperatur, um die Genauigkeit zu priorisieren, keine überflüssige Kreativität erforderlich;
2. Bei kreativen Arbeiten (Romanverfassung, Brainstorming, Marketingtexte): Erhöhen Sie die Temperatur, um unerwartete Inspirationen zu erhalten.
Öffentliche Clients wie ChatGPT bieten diesen Einstellknopf nicht an und sind standardmäßig auf einen Mittelwert eingestellt. Wenn Sie jedoch KI-Schnittstellen oder Entwicklungstools verwenden, können Sie diesen Parameter sehen – jetzt wissen Sie auch, wie Sie ihn anpassen.
IV. Halluzination
Jeder hat dieses Wort gehört, aber nur wenige Menschen verstehen die zugrunde liegende Ursache – und die Ursache ist genau der entscheidende Punkt.
KI-Halluzination bedeutet, dass die künstliche Intelligenz sehr überzeugt falsche Informationen ausgibt, ohne zu zögern, und völlig unwahre Inhalte als objektive Tatsachen darstellt.
Zum Beispiel, wenn Sie die KI nach einem Buch fragen, kann sie den Buchtitel, den Autor, das Erscheinungsjahr und die Handlung vollständig erfinden, und dieses Buch existiert in der Realität überhaupt nicht – aber die KI erzählt es so überzeugend, als hätte sie es aus Wikipedia abgeschrieben.
Die Kernursache für Halluzinationen wird von vielen Menschen übersehen:
Große Sprachmodelle sind keine Datenbanken und durchsuchen keine echten Informationen aktiv. Sie sagen nur das plausibelste nächste Token basierend auf den Textmustern voraus, die sie in der Trainingsphase gelernt haben. Im Wesentlichen sind sie ein riesiges Tool zum automatischen Vervollständigen.
Wenn die KI also etwas nicht weiß, sagt sie nicht direkt „Ich weiß das nicht“, sondern generiert eine logisch klingende Antwort – das ist genau die Betriebslogik, die ihr während des Trainings zugewiesen wurde.
Das eigentliche Risiko besteht nicht darin, dass KI Fehler macht – alle Tools können Fehler machen. Das Beängstigende ist, dass die KI bei der Ausgabe falscher Informationen genauso überzeugt ist wie bei der Ausgabe richtiger Inhalte und einfach eine Antwort gibt.
Zur Erinnerung: In Szenarien, in denen Fehler zu tatsächlichen Verlusten führen, wie bei objektiven Tatsachen, statistischen Daten, medizinischen Ratschlägen oder Rechtsvorschriften, sollten Sie KI niemals vollständig vertrauen. Sie können sie als Ausgangspunkt für Informationen verwenden, aber Sie müssen die Glaubwürdigkeit der Inhalte unbedingt gegeneinander prüfen.
Personen, die das Konzept der Halluzination wirklich verstehen, werden die Nutzung von KI nicht aufgeben, sondern lernen, sie klüger zu nutzen.
V. Retrieval-Augmented Generation (RAG)
Von diesen fünf Konzepten wird es am häufigsten missverstanden, aber wenn Sie es verstanden haben, werden Sie feststellen, dass es fast überall zu finden ist.
RAG ist die Abkürzung für Retrieval-Augmented Generation, und die Kernlogik ist eigentlich sehr einfach. Es löst ein zentrales Problem: Die Trainingsdaten gewöhnlicher KI-Modelle haben ein Ablaufdatum, und sie können keine internen Unternehmensdokumente, Nachrichten der letzten Woche oder hochgeladene PDF-Dokumente lesen.
Die Tools auf dem Markt für „PDF-Fragen und Antworten“ oder „Dokumenteninterpretation“ basieren im Kern auf der RAG-Technologie.
Der vollständige Ablauf:
1. Nachdem Sie das Dokument hochgeladen haben, lädt das System nicht den gesamten Inhalt direkt in das KI-Modell. Stattdessen teilt es das Dokument in mehrere Segmente auf und speichert sie in einer speziellen Datenbank – der Vektordatenbank, die die Semantik von Text erkennt, anstatt nur Schlüsselwörter abzugleichen;
2. Wenn Sie eine Frage stellen, durchsucht das System zuerst die Vektordatenbank nach den Textsegmenten mit der höchsten Übereinstimmung und ruft die Inhalte ab;
3. Die abgerufenen relevanten Segmente werden zusammen mit Ihrer Frage an die KI übergeben, mit der Anweisung an das Modell: „Hier sind die entsprechenden Referenzmaterialien, antworten Sie bitte basierend auf diesen Materialien.“
Kurz gesagt, die drei Schritte: Abrufen relevanter Materialien, Eingabe in das Modell und Generieren der Antwort – zusammen als RAG bezeichnet.
Warum ist diese Technologie so wichtig?
Die meisten praktischen KI-Produkte der letzten zwei Jahre basieren im Kern auf RAG: Kundenservice-Roboter, die auf Unternehmensregelwerke zugreifen können, KI-Assistenten, die Rechtsdokumente interpretieren können, und Tools zur Zusammenfassung von wissenschaftlichen Arbeiten – alle sind auf dieser Architektur aufgebaut.
Das Verständnis von RAG wird Ihre Sichtweise auf KI-Produkte vollständig verändern: Dass KI Ihre internen Dokumente lesen kann, bedeutet nicht, dass sie die Inhalte aktiv gelernt und gespeichert hat. Sie hat nur eine genaue Suche durchgeführt und die Materialien an das Sprachmodell zur Beantwortung übergeben. Das Modell selbst hat sich nicht geändert – es hat nur zusätzlichen Kontext als Referenz erhalten.
Wozu dient das Verständnis dieser Konzepte?
Künstliche Intelligenz wird das Leben der breiten Öffentlichkeit nicht verlassen. In den nächsten Jahren wird die Wissenslücke zwischen Menschen, die KI nur oberflächlich nutzen, und denen, die die zugrunde liegende grundlegende Logik wirklich verstehen, stetig größer werden.
Wenn Sie Tokens verstehen, können Sie effizientere Prompts schreiben;
Wenn Sie das Kontextfenster verstehen, erkennen Sie die Ursache für die oft unlogischen KI-Antworten in Gesprächen;
Wenn Sie den Temperaturparameter verstehen, können Sie den Ausgabestil je nach Arbeitsszenario präzise anpassen;
Wenn Sie Halluzinationen verstehen, werden Sie keine von KI ausgegebenen Tatsachen ungeprüft übernehmen;
Wenn Sie RAG verstehen, kennen Sie die tatsächliche Funktionsweise verschiedener KI-Tools zur Dokumenteninterpretation.
Das sind die fünf Kernbegriffe. Wenn Sie ihre zugrunde liegende Logik beherrschen, reicht das aus, um mehr als 90 % der Nutzer zu übertreffen.
Willkommen in der Gruppe der 10 % mit dem höchsten Verständnis.
Übersetzerin: Teresa