Die-Handschelle

ExplainingComputers – Running Gemma 4 Local AI

  • AFD (12)
  • Bündnis 90/Die Grünen (1)
  • CDU (2)
  • CSU (2)
  • Die Linke (1)
  • FDP (5)
  • SED (1)
  • SPD (1)

ExplainingComputers – Running Gemma 4 Local AI

ExplainingComputers – YouTube Kanal-Aufrufe 0 Kanal https://www.youtube.com/channel/UCbiGcwDWZjz05njNPrJU7jA 🔗 https://www.youtube.com/watch?v=U6_ZbW97-GY How to run Gemma 4 open local AI models in LM Studio on a computer with integrated graphics (like most laptops and mini PCs). Although everything here will also work just fine on a system with a dedicated graphics card. You can download LM Studio here:…

, , ,

ExplainingComputers – YouTube

Kanal-Aufrufe 0
Kanal https://www.youtube.com/channel/UCbiGcwDWZjz05njNPrJU7jA

Running Gemma 4 Local AI

🔗 https://www.youtube.com/watch?v=U6_ZbW97-GY

How to run Gemma 4 open local AI models in LM Studio on a computer with integrated graphics (like most laptops and mini PCs). Although everything here will also work just fine on a system with a dedicated graphics card.

You can download LM Studio here: https://lmstudio.ai/download Note that, in the days since the video was made, the download links on the LM Studio homepage are now for LM Studio Bionic. This is an "Agent for Open Models", which I may well cover in another video! 🙂

If you enjoy this video, you may also like my episode on Agentic AI: https://www.youtube.com/watch?v=Gvt4TwGpqOs

CONFIGURATION NOTES
There are lots of settings that you can experiment with when running LLMs like Gemma 4 locally, especially if you have a powerful dedicated GPU with a lot of VRAM. But on my system with integrated graphics, I experimented with the following changes:

CONTEXT LENGTH: Go to “My Models”, click on the gear icon to access the settings for a particular model, and then click on the

🤖 Zusammenfassung

Das Video zeigt, wie Googles lokales KI-Modell Gemma 4 über die kostenlose Software LM Studio auf einem bescheidenen Rechner (Ryzen 5 5600G, 16 GB RAM, integrierte Grafik) genutzt werden kann. Der Sprecher installiert LM Studio und lädt das 4-Bit-QAT-Modell Gemma 4 12B (ca. 7 GB). Er demonstriert Chat-Funktionen, Bildanalyse, Textzusammenfassung und Python-Code-Generierung, wobei das System vollständig offline arbeitet. Besonders auffällig: Der integrierte Denkmodus verlangsamt Antworten erheblich; ohne ihn läuft Gemma merklich schneller. Der Vergleich mit dem kleineren E4B-Modell zeigt etwa doppelt so hohe Tokenrate, aber deutlich schlechtere Ergebnisse bei komplexeren Bildern. Kritisch bleibt, dass die Leistung weit hinter cloudbasierten Diensten wie Gemini oder ChatGPT zurückfällt und größere Dokumente das Kontextfenster belasten. Für Experimente und datenschutzbewusste Nutzer ist die Lösung dennoch praktikabel.

Summary created by "LinkBuster-KI HAL8999 – Status READY!!"

📜 Transkript

[Musik] Willkommen zu einem weiteren Video von explainingcomputers.com . Dieses Mal zeige ich Ihnen, wie Sie das Gemma 4 Local AI-Modell in einer Anwendung namens LM Studio ausführen. Beide sind kostenlos und ermöglichen es uns, KI privat auszuführen, ohne auf die Cloud zugreifen zu müssen. Für optimale KI-Leistung benötigt ein Computer eine leistungsstarke Grafikkarte. Die meisten Menschen besitzen diese Art von Hardware jedoch nicht. In diesem Video werden wir Gemma 4 auf einem Computer mit ähnlicher Ausstattung wie viele Laptops und Mini- PCs ausführen. Gemma 4 ist eine Familie von Open-AI-Modellen von Google DeepMind. Es sind fünf verschiedene Größen erhältlich, die als E2B, E4B, 12B, 26B und 31B bezeichnet werden. Hierbei steht B für Milliarden Parameter, wobei die größeren Modelle leistungsfähiger sind, aber auch mehr Rechenressourcen benötigen . Wie wir sehen können, sind die Modelle E2B und E4B für den Einsatz auf mobilen Geräten und IoT- Hardware konzipiert, eignen sich aber auch für weniger leistungsstarke Laptops und Desktop- Computer mit bescheidenem Arbeitsspeicher. Die Modelle 12B, 26B und 31B sind hingegen für PCs konzipiert. Von diesen wurde 12B im Juni 2026 veröffentlicht und ist für Laptops konzipiert. Und wie dies nahelegt, kann es auch auf Hardware ohne dedizierte GPU ausgeführt werden. Alle Gemma 4-Modelle sind in verschiedenen Präzisionsstufen erhältlich, von einer Standardauflösung von 16 Bit bis hin zu 4-Bit- Versionen, die mit einer Methode namens Quantisierung komprimiert werden. Im Juni 2026 veröffentlichte Google außerdem Modelle, die mit quantisierungsbewusstem Training (QAT) optimiert wurden. Anstatt ein vollständig trainiertes Modell zu komprimieren, was die Genauigkeit beeinträchtigen kann, integriert QAT die Quantisierungssimulation in den Trainingsprozess selbst, wodurch das Modell lernt, den Präzisionsverlust auszugleichen. Wir werden uns hier daher für eine QAT-Version unseres Gemin-Modells entscheiden. Allerdings wurden einige Probleme bei der Textanalyse oder Codierung gemeldet. Wenn Ihnen also ein QAT-Modell Probleme bereitet, versuchen Sie, auf ein Modell umzusteigen, das auf Post-Training-Quantisierung oder PTQ basiert. Um uns bei der Auswahl der passenden Modellgröße zu helfen, stellt Google diese Tabelle zur Verfügung. Beachten Sie, dass hier der freie Speicherplatz angezeigt wird, der zum Laden der sogenannten Basisgewichte eines KI-Modells benötigt wird . Darüber hinaus wird Arbeitsspeicher (RAM) für das Betriebssystem des Computers, die KI-Software, die zum Ausführen des Modells verwendet wird, und den Arbeitsspeicher bzw. das Kontextfenster des KI-Modells benötigt. Wenn Sie Gemma 4 auf einem Computer ohne dedizierte Grafikkarte ausführen möchten, müssen Sie in der Regel mindestens 4 GB zu diesen Zahlen addieren, wenn Sie sie mit Ihrem System-RAM vergleichen. Die genaue Zahl hängt jedoch von mehreren Faktoren ab. In diesem Video werden wir Gemma 4 auf diesem Ryzen 55 5600G PC mit 16 GB RAM ausführen. Ich habe dieses Testsystem gewählt, weil es wie die meisten Laptops über eine integrierte Grafikeinheit und nicht über eine dedizierte GPU verfügt. Daher erhalten wir durch seine Verwendung einen guten Eindruck von der Leistung von Gemma 4 auf typischer Mittelklasse-Hardware. Für einen Computer wie diesen mit integrierter Grafik würde ich ein 4-Bit Gemma 4-Modell empfehlen. Angesichts unserer 16 GB RAM und unter Berücksichtigung des Betriebssystems und anderer Overheads werden wir zunächst Gemma 4 12B 4bit ausprobieren und sehen, wie schnell es läuft. Und falls 12b4bit zu langsam ist, wäre E4B 4bit eine weitere Option, die zwar weniger leistungsfähig ist, aber eine höhere Geschwindigkeit bietet. Um Gemma 4 oder ein anderes lokales KI- Modell auszuführen, benötigen wir eine Ausführungssoftware. Und hier werden wir LM Studio verwenden. Dies ist für den privaten und beruflichen Gebrauch kostenlos und bietet eine grafische Benutzeroberfläche zum Herunterladen und Interagieren mit lokalen KI-Modellen. LM Studio ist sowohl für Windows als auch für Mac und Linux verfügbar. Und hier arbeiten wir unter Windows. Hallo. Und so laden wir es für Windows herunter. Anschließend installieren wir die Software, wofür eine Lizenzvereinbarung akzeptiert werden muss . Wir installieren LM Studio für alle Benutzer dieses Computers und teilen Windows mit, dass die Installation zulässig ist. Danach gelangen wir scheinbar wieder zu einer Lizenzvereinbarung, nach der wir endlich auf „Installieren“ klicken können. Und da sind wir nun. Wir haben jetzt LM Studio auf unserem Computer. Ich schließe jetzt einfach den Browser, um Ordnung zu schaffen, und klicke dann auf „Fertigstellen“, wodurch, wie wir sehen können, die Software ausgeführt wird. Und hier sagt es Hallo. Gut zu wissen ist auch, dass man die Größe der Benutzeroberfläche mit den Tasten Strg + und Strg – ändern kann. Wir werden also ein bisschen davon machen, wodurch die Schaltfläche „Los geht’s“ hier unten erscheint, die ich anklicken werde. Anschließend haben wir die Möglichkeit, unser erstes KI-Modell zu installieren. Es gibt keinen Grund, warum Sie das nicht tun sollten, aber ich werde diesen Schritt vorerst überspringen, da ich Ihnen die vollständige Modellsuchfunktionalität zeigen möchte . Ich werde also einfach die Option " Lokales LLM beim Anmelden starten" deaktivieren. Das will ich nicht unbedingt. Und wir klicken, um zu LM Studio zu gelangen. Und hier befinden wir uns nun in der Benutzeroberfläche zur Installation eines neuen Modells. Wir gehen nun zum vierten Symbol von oben , das die Modellsuche ist. Und darauf klicken wir. Und schau mal, es gibt eine große Auswahl an Modellen. Dazu gehören auch einige Empfehlungen der Mitarbeiter. Das oberste davon ist jamm 12b QAT, das wir bereits früher installiert haben. Und hier können wir die verfügbaren Dateien sehen. Wenn wir hier klicken, sehen wir, dass es nur eine Datei gibt, Gemma 42B QAT, und zwar die 4-Bit- Version. Hier unten haben wir aber auch die Standardversion Gemma 412B, bei der es, wenn wir auf die verfügbaren Downloads klicken, 4-Bit-, 6-Bit- und 8-Bit-Versionen gibt, die auf der Post-Training-Quantisierung oder PTQ basieren. Und sehr hilfreich ist, dass LM Studio uns mitteilt, dass diese beiden letztgenannten Dateien zu groß sind, um auf unserem Computer verwendet zu werden. Wir haben uns aber für Gemma 412B QAT entschieden. Und wohlgemerkt: Wäre dieses Schwein nicht hier als Mitarbeiterschwein vorhanden gewesen, hätten wir es mithilfe der Suchleiste finden können. Das ist aber nicht nötig. Wir können jetzt einfach auf „Herunterladen“ für die 7,15 GB große Datei klicken. Und da es sich um eine ziemlich große Datei handelt, nutzen wir die Magie des Filmemachens, um schnell voranzukommen. Und da sind wir nun. Wir haben jetzt LM Studio und ein Gemma 4 KI-Modell lokal auf unserem Computer installiert. Es gibt, wie Sie sich vorstellen können , verschiedene Einstellungen, die wir anpassen könnten. Aber nun lasst uns gleich mit unserem ersten Gespräch beginnen. Dazu klicken wir einfach auf „In neuem Chat verwenden“. Und das Modell wird geladen, was, wie wir sehen können, erfolgreich geschehen ist. Und wir können uns jetzt mit unserer neuen lokalen KI unterhalten. Zuvor werde ich die Benutzeroberfläche mit Control Plus vergrößern. So, jetzt haben wir's. Und stellen wir eine höfliche Frage. Wie geht es dir heute? Was veranlasst die KI zum Denken? Ich nehme mir ein wenig Zeit. Vielleicht hält es das für eine komplizierte Frage, aber so ist es nun mal. Und es ist offensichtlich, dass Gemma 412B auf diesem System mit den Standardeinstellungen nicht blitzschnell ist . Aber keine Sorge, wie wir gleich sehen werden, gibt es Dinge, die wir anpassen können, um den Prozess zu beschleunigen. Und da sind wir nun. Wir haben eine Antwort. Es heißt: „Mir geht es gut. Danke der Nachfrage. Wie geht es Ihnen heute? Kann ich Ihnen irgendwie helfen?“ Um unsere erste Frage zu beantworten, brauchte Gemma etwa 18 Sekunden zum Nachdenken. Und wenn wir mit dem Mauszeiger über diese Uhr fahren, können wir sehen, dass sie eine Geschwindigkeit von 5,46 46 Token pro Sekunde erreicht hat . Ein Token ist die Grundeinheit der KI- Sprachverarbeitung und entspricht typischerweise etwa vier Zeichen oder 3/4 eines Wortes. Und natürlich wollen wir, dass die Anzahl der Token pro Sekunde so hoch wie möglich ist. An dieser Stelle im Video hatte ich daher vor, viele verschiedene Leistungseinstellungen durchzugehen, aber ehrlich gesagt ist LM Studio sehr gut darin, Standardeinstellungen festzulegen, insbesondere bei Systemen wie diesem mit integrierter Grafik. Deshalb werde ich jetzt nicht 5 Minuten damit verbringen, alle Einstellungen durchzugehen, denn es gibt eine Möglichkeit, die Sache zu beschleunigen, ohne sie zu benötigen. Es sei jedoch darauf hingewiesen, dass es ratsam ist, in den Einstellungen den Entwicklermodus zu aktivieren, der es Ihnen ermöglicht, auf Hardware zu klicken und zu überprüfen, ob Ihr System korrekt erkannt wurde und Ihre GPU eingeschaltet ist , was hier der Fall ist. Und es gibt Einstellungen für einzelne Modelle. Sie können auf das Zahnradsymbol neben einem Modell klicken. Es gibt viele Einstellungsmöglichkeiten, aber ich werde nicht auf alle eingehen, da dies ein Anfängervideo ist und LM Studio die Standardeinstellungen ehrlich gesagt schon sehr gut voreingestellt hat. Ich habe stundenlang herumprobiert und dabei nur eine sehr, sehr geringe Leistungsverbesserung erzielt. Ich werde also einige Hinweise zu den Modelleinstellungen in der Videobeschreibung hinterlassen und dann zu dem Punkt übergehen, der einen dramatischen Unterschied für die Leistung der Gemma 4 ausmacht . Ach ja, und nur zur Info: Unsere Statistiken werden jetzt permanent auf dem Bildschirm angezeigt, da wir uns im Entwicklermodus befinden. Worauf ich mich jetzt konzentrieren werde, ist, dass Gemma über einen sogenannten Denkmodus verfügt. Dabei wird eine Kette von Gedankengängen durchgeführt, um jede Anfrage mithilfe eines internen Modells aufzuschlüsseln. Wir können es von hier oben sehen. Folgendes ging dem System durch den Kopf, als es sich die erste Anfrage ansah. Und dies geschieht, um das Endergebnis zu verbessern. Dieser Denkprozess ist jedoch auch sehr zeitaufwändig. Für diese erste Abfrage benötigte man 18 Sekunden . Und ratet mal, was dann passiert ist? Wir schalten den Denkmodus aus, indem wir den Schalter so nach unten drücken. Bei einfachen Aufgaben sollte dies nur geringe Auswirkungen auf die Ergebnisse haben. Für Dinge wie Programmierung oder ästhetisches Rechnen sollten Sie vielleicht wieder in den Denkmodus wechseln. Aber wenn es ausgeschaltet ist, haben wir ein sauberes Fenster. Lass uns einen neuen Chat starten und genau dieselbe Frage stellen wie zuvor. Wie geht es dir heute? Und das, bevor es eine Sekunde dauerte. Diesmal geht es so gut wie direkt zur Beantwortung. Es ist wesentlich schneller als zuvor. Allerdings ist Gemma 4 auf diesem System eindeutig nicht so schnell wie Googles Gemini oder Chat GPT. Es hat jedoch den Vorteil, dass es vollständig offline funktioniert. Es ist wichtig zu betonen, dass Gemma 4 nichts hochlädt oder Informationen aus dem Internet bezieht. Und um dies zu beweisen: Wenn wir das Fenster minimieren, sehen Sie, dass dieser Computer jetzt offline ist. Wir haben keinen Internetanschluss. Und ich wollte euch das zeigen, weil wir Gemma jetzt eine praktische Aufgabe geben werden, nämlich diese. Schreiben Sie etwa 100 Wörter über Süditalien. So, jetzt haben wir's. Und da es keinen Denkmodus hat, geht es direkt zur Antwort über. Und das ist, glaube ich, ziemlich schnell. Und ich finde es erstaunlich, dass es diese Antwort ausschließlich auf der Grundlage des Wissens generiert, das in seinem 12 Milliarden Parameter umfassenden großen Sprachmodell enthalten ist . Das finde ich erstaunlich. Hier haben wir diesen Datenblock, den wir geladen haben, ungefähr 7 oder 8 Gigabyte, wie groß er auch immer war. Und es kann alle möglichen Fragen beantworten. Und das sieht für mich ziemlich gut aus . Es ist unter Umständen nützlich, das können zu können . Erwähnenswert ist auch, dass Gemma 4 mehrsprachig ist und standardmäßig über 35 Sprachen unterstützt. Das bedeutet, dass wir auch so etwas machen können . Übersetzen Sie Ihre letzte Antwort ins Französische. So, jetzt haben wir's. Es übersetzt seine letzte Antwort ins Französische. Man muss sich ein wenig Zeit zum Nachdenken nehmen, aber es ist eine nützliche praktische Aufgabe. Und da haben wir's . Es gibt uns die Antwort auf Französisch. Ist noch nicht online gegangen. Auch hier stützt es sich auf das Wissen, das in seinem LLM, seinem großen Sprachmodell, enthalten ist. Ich weiß nicht, ob das richtig ist oder nicht, weil ich kein Französisch spreche. Ich habe in der Schule versucht, Französisch zu lernen , aber ich war nie gut in Sprachen. Ich konnte Naturwissenschaften, Mathematik und Wirtschaftswissenschaften, solche Sachen, machen, aber mit Sprachen kam ich nie so richtig zurecht. Jedenfalls scheint es etwas zu produzieren, das korrekt sein könnte. Ich bin sicher, jemand in den Kommentaren wird uns sagen, ob das stimmt oder nicht. Aber nun ja, so ist es eben. Wir haben demonstriert, was, wie ich glaube, viele als praktische Anwendung für Gemma 4 ansehen würden. Neben der direkten Texteingabe kann Gemma 4 auch mit Bildern und Textdateien arbeiten. Testen wir das also, indem wir ein Bild laden. Wir laden das mysteriöse Tier AA. Und äh, das ist das mysteriöse Tier aa. Und ich bin sicher, Sie können erraten, was ich tun werde . Ich werde fragen: Was ist das für ein Tier? Und es wird darüber nachdenken. Und währenddessen werden wir im Eiltempo weiterfahren. Und da sind wir nun. Das Tier ist eine Giraffe. Es ist richtig. Aber wir geben ihnen eine etwas schwierigere Aufgabe. Ein weiteres Bild. Das mysteriöse Tier BB, das ist äh dieses hier. Und noch einmal fragen wir uns: Was ist das für ein Tier? Mal sehen, was es diesmal macht. Und da sind wir nun. Das stimmt auch . Es weiß, dass dieses Tier eine Kopie ist. Testen wir nun die Arbeit mit einer Textdatei. Und so habe ich hier im Editor den Text eines Kapitels aus einem meiner alten Bücher eingefügt. Wir werden es also laden. Datei anhängen. Es ist außerdem erwähnenswert, dass Gemma 4 zwar nativ keine anderen Dateiformate als reine Textdateien unterstützt, aber wenn Sie es hier in ADM Studio verwenden, können Sie PDFs und Dokumente importieren, was sehr praktisch ist. Nun gut , fürs Erste werden wir einfach eine Standard-Textdatei importieren. Da ist es ja . Und ich werde nun versuchen, dieses Dokument in etwa 200 Wörtern zusammenzufassen. Und dann wird es damit anfangen. Es signalisiert uns, dass der gesamte Inhalt, der vollständige Inhalt, eingefügt wird und dass der gesamte Inhalt in den Kontext passt. Und ich komme gleich darauf zurück, was das bedeutet . Aber zuerst machen wir schnell weiter. Und da sind wir. Es ist vollbracht. Es ist eine Art recht anständige Zusammenfassung eines ursprünglich 3.900 Wörter umfassenden Dokuments entstanden, das auf 200 Wörter gekürzt wurde. Um auf die Aussage zum Kontext zurückzukommen: Gemeint ist die Kontextlänge des Modells , auch Kontextfenster genannt . Und dies ist die maximale Anzahl an Tokens, mit denen ein großes Sprachmodell arbeiten kann. Und hier unten können wir sehen, dass derzeit 65,9 % des Kontextes des Modells im Kurzzeitspeicher genutzt werden, wenn mit Textdateien gearbeitet wird. Dies sollten Sie ebenfalls berücksichtigen, da Sie möglicherweise den Kontext erweitern müssen, um mit größeren Dokumenten arbeiten zu können. Dies können Sie in den Einstellungen tun, die wir vorhin gesehen haben, oder wir gehen einfach hier oben auf das Zahnradsymbol, wo wir sehen können, dass ein Standardwert von 8192 Tokens festgelegt wurde, was ungefähr 6000 Wörtern entspricht. Wenn Sie also ein 10.000 Wörter langes Dokument zusammenfassen möchten , müssen Sie die Länge Ihres Kontextes erhöhen. Beachten Sie jedoch, dass eine längere Kontextlänge mehr Speicher verbraucht und die Leistung verringert. Erhöhen Sie ihn also nur, wenn es unbedingt notwendig ist. Ach ja, und noch etwas möchte ich erwähnen: Wenn Sie eine Kopie des von der KI generierten Textes erstellen möchten, können Sie hier unten auf „Kopieren“ klicken und den Text dann in eine beliebige Anwendung einfügen . Rechts. Eine weitere Fähigkeit von Gemma 4 ist das Schreiben von Code. Um die Grundlagen zu demonstrieren, habe ich mir die Python IDE besorgt. Und wir wechseln nun zu LM Studio, wo ich eine Aufgabe gestellt habe, die lautet: Schreiben Sie ein Python-Programm, das nach Größe und Gewicht einer Person fragt und ihren BMI berechnet. So, da sind wir also beim Schreiben unseres Programms. Und es wird wieder ein wenig Zeit in Anspruch nehmen. Also, lassen wir es einfach durchlaufen. Und da sind wir nun. Nach etwa 1 Minute und 50 Sekunden hat es auf unsere Anfrage reagiert. Es hat uns mitgeteilt, was es tun wird . Es hat den Code geschrieben. Da ist es ja . Und es hat uns erklärt, wie es funktioniert und uns einige Beispielausgaben gegeben. Wir müssen also nur hierher zum Code zurückkehren und auf Kopieren klicken. Da sind wir also. Um zu unserer IDE zurückzukehren und den Code dort einzufügen . Und äh, scrollen wir der Einfachheit halber mal ganz nach oben. Und speichere einfach so . Und jetzt können wir den Code ausführen. Wir könnten F5 drücken, aber wir werden das Modul so ausführen . Und dort steht, man solle sein Gewicht in Kilogramm eingeben. Nehmen wir an, ich weiß es nicht, 72, Höhe in Metern 1,76. Und da sind wir nun. BMI 23,4 Kategorie Normalgewicht. Und ich finde es immer noch erstaunlich, dass wir heutzutage Computer zum Programmieren nutzen können. Ich weiß, es ist umstritten. Es wirft allerlei Fragen auf, aber es ist beeindruckend. Dies ist mit einem lokalen KI-Modell möglich, das auf einem Computer ohne dedizierte GPU läuft. Wie bereits erwähnt, läuft ein kleineres Modell auf derselben Hardware schneller. Ich habe mir jetzt also eine 4-Bit E4B Gemma 4 heruntergeladen, damit wir sie mit der 4-Bit 12B vergleichen können, die wir bisher verwendet haben. Im Chat haben wir nun die Wahl, welches Modell wir verwenden möchten. Und hier laden wir nun Gemma 4 E4B. Stellen wir ihr also einige der gleichen Fragen. Wie geht es dir heute? Ich habe wie zuvor schon darüber nachgedacht, und wie wir sehen können, kam das Thema sehr schnell auf. Es liefert uns ein völlig anderes Ergebnis und hat eine Geschwindigkeit von 11,75 Token pro Sekunde ergeben, verglichen mit 6,0 beim letzten Durchlauf in 12b. Das kleinere E4B-Modell ist also etwa doppelt so schnell auf den Markt gekommen. Wiederholen wir also unsere Tieridentifizierungen. Auf geht's . Kann es eine Giraffe identifizieren? Vergessen Sie nicht, dass es sich um ein weniger leistungsfähiges Modell handelt. Wir werden sehen. Wir werden das in Echtzeit erledigen, weil wir jetzt ein schnelleres System haben. Das dauert immer noch ein bisschen, nicht wahr? Wird es sein Ziel erreichen? [räuspert sich] Da sind wir ja. Sie gibt uns eine längere Antwort als zuvor, aber sie weiß, dass sie eine Giraffe ist. Und es liefert uns viele Informationen über die Giraffe, was sehr nett von ihm ist. Und es hat ungefähr 11 Token pro Sekunde geschafft, verglichen mit 6,45 in E12B. Wiederholen wir also die Identifizierung des anderen Tieres, bei dem es sich, wie Sie sich vielleicht erinnern, um ein weniger häufig vorkommendes Tier handelte. Mal sehen, ob wir das identifizieren können. Um welches Tier handelt es sich? Los geht's! Es könnte einen Unterschied geben. Ich habe das noch nicht ausgeführt. Es ist sehr aufregend zu sehen, denn wir haben ein kleineres Modell, und das muss ja bedeuten, dass es weniger Leistung bietet. Wird es das Karpfentier erkennen? Oh, die Spannung bringt uns um, nicht wahr ? Und äh, was bekommen wir dann? Ich kann auf dem von Ihnen bereitgestellten Bild kein Tier identifizieren. Das Bild zeigt anscheinend einen abstrakten, strukturierten Hintergrund mit horizontalen Linien usw. Nun ja, ich kann eindeutig an die richtige Stelle scrollen. Das stimmt nicht. Es ist dasselbe Bild, das wir schon vorher hatten. Es kann dieses Tier einfach nicht identifizieren . Und ich denke, dies verdeutlicht gut den übergeordneten Punkt, dass kleinere KI-Modelle zwar auf derselben Hardware mehr Token pro Sekunde liefern, aber zwangsläufig weniger genaue Ergebnisse erzeugen können. Wie wir gesehen haben, können kostenlose Gemma 4 lokale KI- Modelle auch auf relativ einfacher Hardware effektiv ausgeführt werden. Ob das tatsächlich nützlich ist, hängt davon ab, wofür man einen Computer benutzt, aber ich finde es immer toll, auf einem neuen Gebiet zu experimentieren. Das war’s dann aber für dieses Video. Wenn Ihnen gefallen hat, was Sie hier gesehen haben, drücken Sie bitte den „Gefällt mir“-Button. Falls Sie noch nicht abonniert haben, abonnieren Sie bitte. Und ich hoffe, wir sprechen schon bald wieder miteinander . [Musik]


📊 Link-Infos

URL https://www.youtube.com/watch?v=U6_ZbW97-GY
Titel Running Gemma 4 Local AI
Kategorien BulkNews, ExplainingComputers
Hinzugefügt 2026-07-26 18:23:09
Mediendatei Original-Medium ansehen · Lokale Kopie