IONOS CLOUD Partner Podcast

Transkript

Zurück zur Episode

00:00:03:

00:00:05: Willkommen beim IONUS Cloud Partner Podcast, dem Podcast für alle die die Cloud nicht nur nutzen sondern gemeinsam gestalten wollen.

00:00:13: Hier sprechen wir über Technologien, Partnerschaften und echte Lösungen!

00:00:17: Ich bin Rafaela.

00:00:18: schön dass ihr dabei seid.

00:00:23: Herzlich willkommen zurück zu unserer aktuellen Podcast Folge.

00:00:27: heute geht es um KI-Agenten, die Zukunft von KI und vor allem auch um GPUs.

00:00:33: Ich habe mir heute den Ennis Mikahra mitgebracht von Marlinda Ai-Ai und Benjamin Schmidt, von mir.

00:00:40: Von uns?

00:00:41: Von Aijonos?

00:00:42: Claut!

00:00:42: Und ich selbst bin Rafaela wieder hier in der Folge und freue mich dass ich hier zwei super kluge Köpfe bei mir habe.

00:00:50: Benjamin, magst du dich vielleicht einmal vorstellen als Erstes?

00:00:53: Ja erstmal natürlich lieben Dank das du mich ja eingeladen hast und dann ist das Thema für mich persönlich auch super spannend.

00:00:59: also das passt Extrem gut.

00:01:02: Ich bin Cloud Solution Architect bei der Aionas im Team Cloud Enablement, nennt sich das, das ist ein hauptsächlich Pre-Sales Team.

00:01:10: Das bedeutet ich berate unsere Kunden wie sie unsere Cloud Produkte sind von einsetzen können Von der ersten Evaluierung bis zu einer tatsächlichen Produktiv Umgebung aber ich mir natürlich auch in Post Sales mit unseren bestehenden Kunden immer beraten stehe ich da zur Seite.

00:01:25: Und zum Thema GPU bin ich eigentlich auch tatsächlich über das Thema KI gekommen.

00:01:30: Als wir intern im Team ein Subject Matter Expert für unseren AI-Model Hub gesucht haben, da habe ich mich gemeldet weil ich fand das Thema mega spannend.

00:01:39: Ich hab' mich persönlich für KI schon immer interessiert Auch wenn ich jetzt keinen praktischen Bezug dazu hatte Aber ich fand's einfach spannend und so wollte ich diesen neuen Challenge dann annehmen.

00:01:48: Wenn man mit Kunden über das AI Model Hub spricht kommt man zwangsläufig auch irgendwann zu GPU Servern, GPU VMs und so bin ich bei dem Thema gelandet.

00:01:58: Und Ennis?

00:01:59: Magst du kurz erzählen wer Du bist und was Du machst?

00:02:02: Ja erstmal danke für die Einladung.

00:02:04: Ich bin Ennis der Gründer von Malinda AI ein KI Agent, die alles für Dich automatisieren kann ohne irgendwas einrichten zu müssen.

00:02:14: Was spannender an Malinda ist wird komplett hundert Prozent auf Jonas Claude trainiert!

00:02:19: Auf ihre GPU's.

00:02:21: Das ist wirklich toll und das ist auch der Grund, warum du heute hier bist.

00:02:23: tatsächlich zum Thema KI-Agenten.

00:02:25: Ich habe es mir ja zum Hobby gemacht allen die hierher kommen in meinen Podcast einen oder eher genau allen einen Stück Kuchen anzubieten.

00:02:34: ich hoffe ihr habt auch einen bekommen dort in Karlsruhe.

00:02:37: Ja vielen Dank.

00:02:38: Schmeckt euch der?

00:02:40: Ist lecker!

00:02:41: Sehr schön.

00:02:42: unser Benjamin hat auch einen Kuchen bekommen und den hab' ich mal Spaßes halber versucht mit KI herzustellen.

00:02:48: ich zeige dir hier Anführungsstriche weil KI kann den natürlich nicht backen.

00:02:52: Aber ich habe mir das Rezept ausgeben lassen und habe gestern gelernt, dass hat mich so richtig gut funktioniert.

00:02:56: also er schmeckt gut.

00:02:58: in der Produktion hätte ich mir ein paar mehr Anweisungsschritte gewünscht aber vielleicht ist es auch meine fehlende Erfahrung beim Backen.

00:03:07: Das könnte natürlich auch sein.

00:03:08: Genau da sollte der Einstieg in die KI sein für mich gestern Abend beziehungsweise heute Morgen Heute.

00:03:15: Wir haben jetzt schon gelernt, was Benjamin und Ennis machen Und ich steig direkt rein.

00:03:22: fangen wir mal an mit den GPUs selbst.

00:03:24: Was ist denn die häufigste Frage von Unternehmen?

00:03:28: Die du Benjamin so im Laufe deines Arbeitsalltages bekommst wenn sie beginnen sich mit GPU Infrastruktur zu beschäftigen?

00:03:35: Ja, also eigentlich gibt es drei Arten von Fragen die ich regelmäßig bekomme.

00:03:39: Die erste oder die häufigste Frage ist eine Vertrauensfrage.

00:03:43: Wer hat Zugriff auf meinen System?

00:03:45: Bleiben meine Daten in Europa?

00:03:47: Kann Aionos als Anbieter zur Herausgabe der Daten gezwungen werden?

00:03:50: Also das ist so der erste Themenblock und dann natürlich auch die technische Fragen.

00:03:56: In den meisten Fällen wird die GPU-Infrastruktur für Infarenz Dienst benötigt für das Betreiben von Large-Language-Modellen.

00:04:03: Und hier ist natürlich die Kernfrage, passt das Modell auf die Karte tatsächlich?

00:04:08: Die Frage ist gar nicht so leicht zu beantworten weil es eben nicht nur auf die Modellgröße tatsächlich ankommt sondern auch auf jede Menge weitere Metrigen zum Beispiel die Anzahl der gleichzeitigen Anfragen oder Input Output Tokens all diese Dinge.

00:04:21: und da das Thema durchaus für viele Kunden auch recht neu ist können die wenigsten auf irgendwelche Erfahrungswerte zurückgreifen.

00:04:30: Und dann noch eine weitere technische Frage ist, wie vielen anderen Kunden teile ich mir so eine GPU-Karte?

00:04:37: Wenn ich die in einer VM habe.

00:04:39: Oder was ist ne VGPU, ne virtuelle GPU oder PCI Pass?

00:04:44: Du, wenn man das vielleicht aus unserem Produktkortfolie schon gelesen hat... Ja, das sind so die Fragen wo die meisten Kunden auch keine klare Vorstellung haben.

00:04:51: Ich

00:04:51: auch nicht!

00:04:52: Da bin ich ehrlich.

00:04:53: Aber da gehen wir gleich nochmal tiefer rein.

00:04:55: Gibt es Missverständnisse?

00:04:57: Also die so im Raum stehen, die Menschen aufnehmen oder...

00:05:00: Ich glaube dazu kommen wir auch.

00:05:02: Also tatsächlich der Unterschied zwischen VGPU und PCI-PaaS through das ist etwas was tatsächlich aufgeklärt werden muss.

00:05:10: Das gucken wir uns dann gleich noch mal an.

00:05:12: Genau, da frage ich dich gleich nochmal ganz genau dazu Woran merkt man denn dass es eine GPU Power braucht?

00:05:17: Also wann weiß man, dass man sie braucht Und wann stößt Sie an ihre Grenzen?

00:05:23: Also das klare Signal ist natürlich die Performance, wenn irgendwas zu lange dauert und LLM braucht Minuten für eine Antwort wo es eigentlich Sekunden kommen sollte oder es skaliert einfach nicht.

00:05:33: Wenn mehrere Nutzer eben gleichzeitig drauf sind dann bricht die Antwortzeit ein.

00:05:37: Das sind so klassische Beispiele.

00:05:39: Die CPU Workloads können KI Workload tatsächlich auch generell können KI Works grundsätzlich auch ausführen, aber sie sind sequenziell optimiert.

00:05:50: Dagegen haben GPUs eben tausende von Kernen die Parallelarbeit und das ist genau das was in einer Matrix-Operation in Neuronalen tatsächlich Neuronalenetzwerken auch gebraucht wird.

00:06:00: Und wenn man eben diesen Unterschied in der Praxis spürt, ist der Punkt erreicht wo eine GPU keine Option mehr ist sondern eben tatsächlich auch ne Notwendigkeit.

00:06:09: Wobei ich aber Ehrlich sagen muss die meisten Kunden, die zu uns kommen.

00:06:13: Die haben diesen Punkt bereits selbst identifiziert.

00:06:16: also sie haben selber eben schon vorab getestet Sie kennen ihren Use Case oder die Technologie bleibt es schlicht vor eben auf GPUs aufgebaut zu werden.

00:06:25: und dann ist unsere Aufgabe nicht zu erklären ob sie eine GPU benötigen sondern welche Infrastruktur sich für ihren konkreten Anwendungsfall tatsächlich auch der richtige ist.

00:06:36: Und gibt das den Moment wo eine GPU an ihre Grenzen stößt?

00:06:40: Auch das gibt es sicherlich, also wir haben hier natürlich immer mit der Physik zu tun.

00:06:45: Dann gibt es natürlich Möglichkeiten wie man über die Anzahl der GPUs skaliert und wenn man darüber dann noch mal weiter skaliert natürlich auch über die anzahl der Server mit den GPU Karten.

00:06:56: Okay welche typischen Workloads liegen da so vor?

00:06:59: Das ist ganz unterschiedlich.

00:07:02: Die use cases gucken wir uns gleich auch nochmal an.

00:07:05: ja vielfältig

00:07:07: Kann man so

00:07:09: pauschal sagen?

00:07:10: Das meiste ist tatsächlich für Inferenz, also für den Betrieb oder das Hausten von Modellen die man eventuell im AI-Model habe eben nicht so findet.

00:07:20: Und wie funktioniert jetzt die Virtualisierung von GPUs?

00:07:24: Den nennt man dann VGPUS.

00:07:26: Das ist eine Möglichkeit, genau.

00:07:29: VGPUs das bedeutet dass die physische GPU-Karte in mehrere Slices aufgeteilt wird ähnlich wie man das vielleicht von VCPUs virtuellen CPUs kennt.

00:07:40: und diese Slicest können dann auch auf mehrere Kunden aufgeteilt werden.

00:07:44: Das hat klare Vorteile in der Auslastung aber auch ganz klarer.

00:07:47: Klerenzen, weil man sich eben den Speicher und die Bandbreite teilt mehreren Kunden.

00:07:52: Und bei rechneintensiven Workloads merken wir dann das sind dann die Nachbarschaftseffekte, die man hat.

00:07:58: Dann gibt es im Gegensatz zu VGPU auch noch PCI-PaaSTube was eigentlich so genau das der Gegenteil ist.

00:08:05: Die physische GPU wird nicht mehr in einzelnen Slices unterteilt sondern dass einzige oder die GPU-Karte steht dediziert und exklusiv für die virtuelle Maschine.

00:08:18: zur Verfügung.

00:08:18: Das heißt, man hat da die volle Leistung einer GPU-Karte.

00:08:21: Man teilt sie nicht und es gibt keine Nachbarschaftseffekte.

00:08:25: Das sind so die zwei Arten wie man eben GPU's in VMs anbieten kann.

00:08:30: Und dann gibt das natürlich auch noch Bermetalserver oder BermettleGPU'S

00:08:34: d.h.,

00:08:35: dass sind GPU Karten, die in dedizierten Bermettelservern eingebaut sind.

00:08:39: Da ist auch keine Virtualisierungsschicht drüber.

00:08:42: D.h.

00:08:42: man hat dort maximale Kontrolle über den kompletten Hardware Stack als mit einer VRM.

00:08:50: Wenn ich jetzt ein KI-Unternehmen wäre und Ernest kann uns das bestimmt nachher noch mal bestätigen, ich würde mich jetzt fragen wann weiß ich denn ob ich eine VGPU brauche oder einen Pass zu...

00:09:02: Richtig genau also.

00:09:04: da sind Konvier natürlich auch als beratendes Team im Spiel.

00:09:08: das Cloud Enablement Team berät dann natürlich was die richtige Technologie für den jeweiligen Use Cades auch wäre.

00:09:15: Ich weiche jetzt mal ein bisschen vom Script-Up.

00:09:17: Ennis, wie war das bei euch?

00:09:19: Woher wusstet ihr was ihr braucht?

00:09:20: Wir wussten schon dass wir unsere eigene KI Modellen trainieren müssen also beiden meisten Unternehmen launchen scheskanisch Also sie können einfach einer der Open Source Modellen nehmen.

00:09:30: Unsere Workload ist aber komplett anders als jede andere Workload worauf die öffentlicher Modellen Trainiert wurden.

00:09:38: Deswegen wüssten wir dass wir komplett eigene Modellen trainen müssen Und dafür braucht man voller Kontrolle über die GPUs.

00:09:46: Also da kann man keine GPU mit anderen Leuten teilen, da brauchst du am besten eigentlich direkte Hardwarezugriff auf deine GPUs nur für dich dann reserviert

00:09:55: und

00:09:56: wir verbrauchen auch also immer hundert Prozent der GPU Leistung beim Training.

00:10:08: Da läuft unsere aktuelle Pre-Training drauf.

00:10:11: Eigentlich jetzt läuft gerade die neue Generation von Marlinda, also da wird es trainiert.

00:10:18: Wir sind in der Pre-Training Phase aktuell und das dauert ja natürlich auch... wir haben zwei Wochen bis ein Monat bei uns weil Nicht jetzt die, das ist kein OpenAI-Modell.

00:10:32: Also das sind keine Trillion Parameter Modellen.

00:10:33: Das sind kleine wenige Billion Parameters Modellen.

00:10:36: aber dafür brauchen wir dann dedizierte GPUs für ein längerer Zeitraum wo unsere Modelle ohne einschränken dann da trainieren kann.

00:10:46: Ja super spannend!

00:10:48: Wenn wir jetzt H.A.R.T.SW gehört haben wenn ihr mir magst du das nochmal kurz erklären und zusätzlich sagen was wir als Aionos Cloud zu also darüber hinaus anbieten?

00:10:57: Genau, ja.

00:10:58: Also wir haben zwei Produktlinien bei den Cloud-GPU-VMs.

00:11:02: da setzen wir aktuell auch schließlich auf die H二hundert.

00:11:06: Da gibt es dann die Konfigurationen der Vms in unterschiedlichen Anzahl von GPUs von einer bis zu acht pro Vm und die V m an sich kommt dann auch im vordefinierten Größen von fünfzehn bis zu hundundzwanzig dedizierten Kurs und etwas über zweit herarbeit Für die dedizierten Server, da ist das Portfolio ein bisschen breiter.

00:11:29: Da haben wir ebenfalls die H-W-Hundert und dann ganz neu die RTX Pro Six Thousand Blackwell und aber auch ein paar ältere Modelle wie A-Xen für weniger rechenintensive Workloads.

00:11:41: Und ja was macht die h-w-hundert vielleicht besonders?

00:11:44: Der entscheidende Faktor ist da der V-RAM, dass es der Speicher auf der GPU Karte drauf ist und die KI mit Modellen, die man eben auf einer GPU Karten treiben will, die müssen vollständig in diesen Speicher passen um effizient zu laufen.

00:11:59: Und so ein klassisches Dance-Modell mit siebzigmal Milliarden Parameter das braucht ungefähr hundertvierzig Gigabyte.

00:12:07: Die GPU hat zweihundert, hat hundredeinundvierzicht Gigabyte an VRAM.

00:12:11: Das passt also genau auf eine Karte drauf.

00:12:14: und dann gibt es aber auch moderne Mixture of Experts Modelle wie DeepSync zum Beispiel.

00:12:21: Die sind effizienter in der Berechnung, können aber trotzdem sehr viel RAM benötigen oder VRAM benötigend.

00:12:27: und dann kommen eben Multi-GPU-Konfigurationen ins Spiel also mehrere Karten pro System.

00:12:34: Und da kommt auch NVLink im Spiel.

00:12:37: das ist eine Nvidia Technologie.

00:12:39: Wenn ein Server jetzt oder eine VM über mehrere VMs benötigt und eingebaut hat zwei vier oder acht zum Beispiel Dann sind diese Karten über NVLink direkt miteinander verbunden.

00:12:50: Das ist keine normale Netzwerkverbindung oder eine PCI-Verbindung, sondern ein entdedizierter Hochgeschwindigkeitsbus zwischen den einzelnen GPUs und das erlaubt es eben noch größere Modelle effizient über mehrere Karten zu verteilen ohne dass die Verbindung zwischen den GPU-Karten als Bottleneck irgendwie in Betracht kommt.

00:13:11: Und ja, in den physischen Servern die dann auf Basis der Cloud GPU VMs laufen.

00:13:18: Da sind bei uns zwei Enwiling-Kruppen eingebaut das heißt jeweils vier GPU Karten sind über diesen High Speed Bustern miteinander verbunden.

00:13:26: Das muss man einfach zur Architektur wissen wenn man so ein System dann aufbaut.

00:13:31: und die Frage nach Optionen, was hat der Kunde für Optionen?

00:13:36: Die Cloud-GPUs sind tatsächlich für die meisten Kunden der richtige Einstieg.

00:13:41: Sie sind relativ flexibel und man kann mit einer GPU starten und dann natürlich jederzeit auch die VRM Größe wechseln.

00:13:48: Es wird Minuten genau abgerechnet.

00:13:51: Sie ist sofort verfügbar.

00:13:52: also all diese Cloud Vorteile spielen da natürlich auch noch mit rein.

00:13:56: und dann im Gegensatz dazu die dedizierten Metal-Server, die man bei uns eben auch bekommen kann.

00:14:02: Die zweite Produktlinie, die ergeben dann eventuell Sinn bei vierundzwanzig sieben Workloads.

00:14:08: Wir haben gerade gehört, tatsächlich unsere Cloud GPUs werden auch für Vierundzwanzig Sieben Einsatz verwendet.

00:14:14: Aber das wäre jetzt zum Beispiel Newcase oder zum Beispiel auch gezielte Anforderungen an die Hardware, die vielleicht mit einer nicht erfüllt sind.

00:14:22: Oder wenn eine vollständige Isolation der Workload und der Maschine gefragt ist Und im Bereich Bermettle können wir dann auch Projekt basiert eben tatsächliche eigene Kunden-Hardware Anforderungen gezielt ausführen.

00:14:37: Also Hardware für den Kunden bestellen, betreiben und das natürlich dann nicht Minuten genau abgerechnet aber über länger Zeit.

00:14:44: Wenn Marlinda jetzt feststellen würde dass Ihnen das was Sie aktuell buchen nicht mehr reicht könnten sie easy switchen?

00:14:51: Im Bereich der Bare Metal Server ja also zumindest aus dem Portfolio heraus.

00:14:56: wie gesagt da könnten wir oder haben wir die Möglichkeit auch über Projekt passierte Konfiguration über unser Standardportfolio hinweg zu gehen.

00:15:04: Hast du schon mal gehört jetzt?

00:15:06: Perfekt.

00:15:08: Weißt du Bescheid, wie ist das denn bei dir?

00:15:10: Ihr nutzt die Cloud GPU richtig?

00:15:14: Genau, also hauptsächlich für Training und für die erste Version von Marlinda.

00:15:18: Die erste Version lief dann auch auf Cloud GPUs statt komplett lokal auf deinem Rechner Und da müssen wir deinen Bildschirm zum Ionis-Cloud übertragen.

00:15:30: Da werden die Daten verarbeitet.

00:15:32: Der Agent-Lokal führt nur die Aktion durch, die von Malinda Cloud gegeben wird.

00:15:38: Mit der neuen Version, die aktuell trainiert wird, läuft alles komplett lokal auf dem Rechner.

00:15:44: Dafür brauchen wir aber trotzdem die Cloud GPUs von IONUS für AI Training und da kommt eigentlich diese Enwilling ins Spiel was Benjamin gerade gesagt hat weil Für Training muss man viele Daten zwischen die GPUs synchronisieren, ob es dann Ways, Gradients und was auch immer.

00:16:03: Und die Geschwindigkeit der Training hängt immer davon ab wie gut die GPU's miteinander verändert sind.

00:16:10: Das heißt also das macht einen Unterschied von statt einer Woche Training dann drei Wochen Training wenn die Verbindung zwischen den GPUs nicht schnell genug ist weil PCIe hat nicht genug Geschwindigkeiten um alle dieser Daten dann zur Übertragung zwischen die GPUs.

00:16:26: Und NVLink ist eigentlich der steppefekte Einsatz dafür und es ist sexy, heißt das glaube ich ja.

00:16:31: Ihr

00:16:33: habt euch ja bewusst für den Betrieb auf Aionos entschieden also unsere Cloud, Aiono's Cloud.

00:16:38: Magst du dazu mal kurz sagen warum ihr das gemacht habt?

00:16:41: Also das war eigentlich eine lustige Geschichte.

00:16:43: Ich habe früher in Hannover gewohnt, jetzt in Heidelberg und ich war auf der Hannover-Messe im April dieses Jahres Und da gab es dann IONUS auf der Messe.

00:16:53: Es gab aber auch viele anderen GPU Cloud Anbieter.

00:16:57: Da war ich tatsächlich direkt auf der Suche nach einem guten Cloud Provider Und mindestens mit einer guten Preisleistungsverhältnis.

00:17:07: Ich hab mit allen gequatscht.

00:17:10: Dann auf Ionis Cloud entschieden, weil erst mal die H.A.T-Zweihundert GPUs waren perfekt für unsere Workload und dann um die Modellgröße und noch dazu die Preise.

00:17:21: also war viel günstiger als jeder andere Anbieter mit dem wir hier gesprochen haben.

00:17:26: Also das war für uns ... no brainer sagt man auf Englisch.

00:17:30: Sehr gut!

00:17:31: Auf dem Preis komme ich noch mal zurück.

00:17:33: Ich habe nämlich auch mal wieder, weil ich das auch gerne mag, ein paar Spicy-Fragen im Vorbereitet.

00:17:37: aber vorher würde ich gerne nochmal auf eine Sache zurückkommen.

00:17:40: wir bei Ionos oder Ionous Cloud stehen ja für Souveränität.

00:17:45: nun ist das Wort ja wirklich oft benutzt.

00:17:47: Aber ihr sagt auch dass der Datenschutz bei euch keine nachgelagerte Pflicht ist sondern schon direkt Datenschutze bei Design.

00:17:56: Was meint ihr denn damit und warum ist es für euch so wichtig?

00:17:59: Genau also Wie man weiß, also es handelt sich jetzt um Bildschirmeaufnahmen.

00:18:05: Da sind hochsensible Daten mit private Informationen und sensibler Informationen drauf.

00:18:13: Ich komme persönlich aus der Cybersecurity-Bereich, ich bin zertifizierter Bandtester Datenverarbeitung und Datensicherheit sehr ernst.

00:18:25: Und deswegen habe ich mich da gesetzt, also seit Tag eins Malinde so zu bauen, damit es hundert Prozent dann sicher ist.

00:18:33: die Daten verlassen eigentlich zum größten Teil.

00:18:36: auch wenn malinder auf cloud läuft verlassen die Daten nie deine lokale Rechner.

00:18:41: und so Lass mal sagen, ich hatte keine großen Vertrauen an amerikanische Anbieter.

00:18:49: Also da hab' ich mit Google Cloud und AWS und vielen anderen geredet und habe mich explizit für ein deutscher Anbiter entschieden und IONUS war perfekter GPU-Anbietern in diesem Fall.

00:19:05: Server HEA in Frankfurt noch dazu Greenhosting und dann volle Unterstützung und Support war auch... Ist immer top bei Jonas, ich ruf immer gerne um so in zwanzig Uhr an.

00:19:17: Sie gehen direkt ran.

00:19:19: Also Support auf Deutsch und dann ... Ich bin also für diese Thema Souveränität sehr interessiert Und für mich heißt es Wir müssen alles lokal machen wir können uns nicht auf anderen verlassen.

00:19:35: Das klingt nach einem richtig guten Fit Also auf beiden Seiten Richtig gut Seid ihr oder kannst du eine Abschätzung abgeben?

00:19:43: Seit ihr auf der Ionos Cloud GPU seid, hat sich da was verändert im Vergleich zu.

00:19:49: wahrscheinlich habt ihr vorher irgendwo anders trainiert entwickelt in der Entwicklung.

00:19:54: In den Kosten beim Produkt gab es irgendwas was auffällig war oder was du uns gerne erzählen möchtest

00:20:00: hundertprozent die Entwicklungszyklus.

00:20:03: also Da wir researchheavy sind und eigenacker i-Modellen forschen, haben wir immer diese Gebrauch neue Modelle auf kleine Datenmengen zu trainieren.

00:20:13: Das ist unser Entwicklungszyklus WF!

00:20:15: ändern die Architektur vom Modell und testen es direkt.

00:20:19: Und dann machen neue Architekteure, diese Entwicklungszyklus braucht immer dann GPUs.

00:20:24: Was wir früher gemacht haben war den kompletten Entwicklung zum größtem Teil lokal zu machen auf einer RTX Pro Six Thousand, die wir gekauft haben und dann für Esther Training Cloud GPUs dann zu buchen.

00:20:39: Es gab zwei Möglichkeiten eine der günstigen Anbieter also On-Demand günstige anbietet zu nehmen wie Runport oder Westerai, oder eine der großen Hyperscalers also wie AWS Google Cloud und so was.

00:20:52: Bei beiden gab es Probleme.

00:20:53: Google Cloud & AWS die Kosten sind einfach zu absurd.

00:20:58: Also das ist manchmal das Vierfache an Runport- oder IONUS kosten pro Stunde.

00:21:05: Und bei den anderen Anbietern wie RunPort oder Wess AI Da findest du nicht immer die GPU, sie du suchst.

00:21:12: Also das heißt... Du machst eine komplette Entwicklung dann kann es sein dass du bis zwei Tagen warten musst bist du die GPUs findest um deine Training also mindestens dieser Modell zu testen und das macht die komplette Entwicklungszyklus zu langsam.

00:21:27: und das heißt also jedes mal müssen wir zwei drei Tagen warten, wo wir eigentlich nicht direkt experimentieren und testen können.

00:21:34: Bei IONUS haben wir jetzt die GPUs für uns, also auf der Erfälzung von dem ZYP.

00:21:40: Sie lassen mal sagen sie werden gut gebraucht!

00:21:44: Wir können jetzt statt einer Woche ein Modell testen.

00:21:48: Wir können pro Tag fast fünf, sechs Modellen und Experimente durchführen weil wir können einfach mit fünf Milliarden Parameter mehrere Instanzen testen auf kleine Datenmengen und das heißt die Entwicklung kann sich extrem beschleunig sein seitdem wir die Cloud-Ibues haben.

00:22:08: eigentlich deswegen waren wir auch auf der Suche nach einem Cloud Anbieter.

00:22:12: Das klingt nach einer richtigen Success Story und ich glaube, mein Kollege kommt dann im Nachgang nochmal direkt auf dich zu.

00:22:17: Das müssen wir definitiv noch mal verschriftlichen.

00:22:20: Auf jeden Fall!

00:22:21: Was mich jetzt ganz stark interessieren würde... Ich habe nämlich auch meinen Start-up gearbeitet.

00:22:25: Was war der Moment als ihr gemerkt habt dass Marlinda tatsächlich funktioniert?

00:22:29: Also gab es da so ein Schlüsselmoment.

00:22:31: das ist jetzt quasi kein Proof of Concept sondern ein richtiges Produkt ist?

00:22:35: Da kommen sicher mehrere Momente.

00:22:40: Der erste war ersten Kunden das getestet haben.

00:22:44: Das waren keine normalen Kunden, sondern das waren junge Gründe die sich mit KI sehr gut auskennen.

00:22:51: Die Clotco-Work und OpenClaw und alle mögliche andere AI Agent Harnesses probiert haben.

00:22:57: Und dann zum ersten Mal mal in der AI probiert habe und sie waren überrecht.

00:23:02: also das ist weil an sich man erwartet nicht dass die Modelle einfach so eine Aufgabe nimmt und direkt Kontrolle über deinen Recheneinglick nach dem anderen macht.

00:23:11: Cloud Co-Work und vielen anderen sind dann funktioniert, aber sind extrem langsam.

00:23:15: Und wenn du das mit Open Cloud oder anderen versuchst zu automatisieren, dann kostet es dir gerne so fünf Euro pro Aufgabe an API-Kost bei Melinda.

00:23:23: Das waren also kosten günstig im Sinne von Pro ganz normale Aufgabe.

00:23:28: Kostet das Ding drei Cent statt ein Prozent sieben Euro?

00:23:31: Und ja, diese diese Response, also diese ihre Gesichte beim ersten Test war meine Schlüsse Da wusste ich schon, ah ok, Marlinda würde hundert Prozent funktionieren.

00:23:44: Moa das klingt nach einem Gänsehautmoment!

00:23:47: Zweiter Tester, als ich Marlinde gefragt habe einfach die Nachrichten von meiner Frau zu beantworten und meine Frau hat es einfach gar nicht bemerkt.

00:23:56: und ja dann hab' ich Ärger bekommen.

00:23:59: aber da hab ich bemerk... Ah ok, das funktioniert doch

00:24:03: Ich weiß jetzt gar nicht was ich darauf sagen soll.

00:24:06: Hm, das war ein koninzielles

00:24:07: Zukunfts-Szenario sein.

00:24:09: Das ist auch nur ein kleiner Test.

00:24:13: Es gab früher diese Turing-Tests oder?

00:24:15: Also da wussten wir ob wir AGI haben oder nicht.

00:24:18: Das war eine echte Turing test.

00:24:20: also Marlinda sollte Nachrichten von einer anderen Person wie antworten ohne dass sie dieser Person das merkt.

00:24:25: Hast du gewusst was geantwortet wird?

00:24:27: Ja ja ich habe Marlinde gefragt die Nachrichten meiner Frau zu beantworten und Marlinder hat einfach WhatsApp geöffnet auf ihre Nachrichten gewartet, gelesen und dann antwortet.

00:24:40: Mit meiner Stimme auch also was komisch war.

00:24:43: Also sie hat Nachrichten ähnliches zu meinen geschrieben.

00:24:46: Das waren nicht viele das waren nur ein paar Nachrichten.

00:24:48: aber da wusste man schon ah okay so einen Tool kann für richtig coole Sachen verwendet werden Aber auch für richtig dass mal sagen nicht so ethische Sachen verendete.

00:25:00: Ja wirklich spannend Benjamin, was sagst du denn dazu?

00:25:05: Ja ich bin auch gerade ein bisschen sprachlos und so etwas hatte ich noch nicht gedacht.

00:25:09: Aber ja wenn das die Bestätigung eine dass das Turing-Test ist

00:25:13: cool einfach also wow!

00:25:15: Ich bin echt gespannt auf das was kommt.

00:25:17: Also wir bleiben definitiv... ich glaube was jetzt als erstes... also ich stelle mir mal vor ich bin Zuhörer unseres Podcasts hier.

00:25:25: ne Und ich glaube viele würden sich jetzt fragen wo kann ich das direkt probieren?

00:25:31: geht das bei euch Kann man das testen?

00:25:33: Genau.

00:25:33: Also bei uns ist es aktuell so, wir testen es nur mit bitter Teste die auf unsere Vaterliste sind damit wir sicher stellen dass die natürlich also malinde lasst mal sagen keine nicht.

00:25:45: row geht also keine schlechte Aufgaben macht oder kein Mercedes für dich bestellt ohne deine Genehmigung.

00:25:51: Deswegen müssen wir das Ganze nur auf Bitter-Tester einschränken, da sind echte Nutzer.

00:25:57: aber und bei uns können einfach die Leute auf unsere Warteliste eintragen und dann kriegen sie direkt ein E-Mail von uns wenn Sie frei geschaltet werden und dann können Sie malende direkt bei Ihnen testen.

00:26:10: Und was schöner dran ist, die Bitter Tester haben dann keine Limit Anfragen oder die Taschen, die sie ausführen können.

00:26:20: Sie können mal in der viel und sonstige Siebenumlaufend haben.

00:26:25: Wohnungssuche auf Jobs bewerben, auf Daten sammeln, Research alles.

00:26:34: Ist schonmal was passiert?

00:26:35: Was nicht hätte passieren sollen?

00:26:38: Ja das war wirklich auch eine lustige Geschichte weil ich habe da Ärger bekommen.

00:26:46: Das war, glaube ich, Dezember dieses Jahres.

00:26:49: Da habe ich dann Marlinda zum Testen einfach gefragt einen Pizza von Dominos zu bestellen.

00:26:55: Für diesen Test habe ich eigentlich gar nicht erwartet dass Marlinde die zum Ende erführt weil bis zu dem Punkt könnte Marlinder das nicht machen.

00:27:03: Ich habe es gar nicht erwartet und habe es am Laufen gelassen mit einem Kollege geredet.

00:27:09: Und dann kam die Pizza!

00:27:11: Also sie hat die Aufgabe wirklich bis zum letzten Schritt durchgeführt.

00:27:14: Marlinda ist dafür trainiert, dass ihr eigentlich immer den letzten Schritt nicht automatisch ausführt sondern macht die Bestellung fertig geht auf dem Warenkorb und dann sagt hey möchtest du jetzt wirklich dein Pinsel bestellen?

00:27:28: Und dann musst du das zusagen damit er damit sieht es aus führt.

00:27:31: Das war aber natürlich zum Internet-Test und so was.

00:27:34: Und da hatte ich diese Sicherheitsmaßnahmen komplett ausgeschaltet, dann hat sie insgesamt siebenundvierzig Euro an Pizza ausgegeben.

00:27:45: Also Sie ist mit kleinen Tadungsdaten verblüfft?

00:27:48: Könnt ihr quasi auch eine Waschmaschine bestellen oder andere Dinge?

00:27:51: Deswegen!

00:27:52: Könnte dir ja auch ein Bugatti oder sowas bestellen.

00:27:55: Das Ding läuft lokal auf deinem Rechner kompletten Zugriff auf deinem Browser, auf deine Daten.

00:28:02: Alles!

00:28:03: Und das heißt also natürlich... Das macht dann die Automation einfacher, die Automatisierung viel einfacher weil du musst nichts verbinden, weil Melinda hat schon die Zugriffe auf alle dieser Daten kann einfach deinen Browser öffnen Gmail, Konto öffen und dann deine E-Mails lesen.

00:28:18: Dann musst du nicht explizit G-Mail damit verbinden.

00:28:21: aber Das heißt auch, wenn deine Paypal im Browser schon eingerichtet ist dann kann Marlinda auch mit deiner Paypal bezahlen.

00:28:30: Und das war dem Fall dann.

00:28:32: Paypal war mit meinem Domino's Konto... Also ja, Dominoskunde!

00:28:37: Das war mit meiner Domino'S Konto verwundet und sie hat dann die Bestellung gemacht und als Paypal als vorgewählte Zahlungsmethode und da hat die Pizza bestellt.

00:28:48: Da kamen dann forty-seven Euro an Pizza nach Hause.

00:28:55: Dominus war, lass mal sagen nicht so glücklich das es aus Versehen ist.

00:29:00: ich wollte da sagen okay das war mein Kind habe kein Kind.

00:29:03: aber ich wollte sagen nein nein mein Kind hat aus Versehen dann fünfzehn Euro und Pizzaus gegeben.

00:29:08: aber ja.

00:29:10: Also du hast sie zurückgehen lassen.

00:29:11: jetzt muss man die Story zu Ende erzählen?

00:29:13: Du hast ihn zurück gehen lassen und nicht gegessen oder eine Party

00:29:16: raus.

00:29:17: Genau, also ich hab ihnen einfach gesagt ja okay das war gar nicht mein Fehler und so.

00:29:21: Sie meinten ja können nichts dafür.

00:29:25: Und dann die Pizza an anderen verteilt.

00:29:28: Ja aber gut.

00:29:30: Das hat mich glücklich gemacht weil bis zu dem Punkt hat meine Linda gar nicht funktioniert!

00:29:34: Und dann auf einmal hat es funktioniert... ...und ein Pizza beschält.

00:29:38: Also das ist für mich mindestens diese Moment also diese Ah ok Jetzt funktioniert das.

00:29:46: Der heurige Moment, da ist nicht der Apfel gefallen, sondern die Pizza gekommen!

00:29:50: Genau, aber man kann sich schon vorstellen, dass Stadt und Pizza jetzt irgendwas teueres bestellen.

00:29:57: Ein H-Hundert GPU bestellen?

00:29:59: Da werden ja sicherlich Sicherheitsmaßnahmen irgendwann drin sein.

00:30:02: also so, sodass man es

00:30:03: überwachen kann.

00:30:04: Sind aktuell schon drin, aber das war auch nur zum Testen komplett deaktiviert diese Sicherheitsmassnahmen.

00:30:12: Meine Ziel war ... Malinda, dass Malinda eine Aufgabe wirklich Ende zu Ende ausführt ohne irgendwelche Genehmigung.

00:30:21: Weil das Ding also Malinda hat einen internen drei Modi einmal du musst jede einzige Aktion dann erlauben und zusagen und dann die zweite ist halb automatisiert.

00:30:34: Dann fragt mal Linda nur beim letzten Schritt hey mich so wirklich dein Pizza bestellen und dann voll automatisiert.

00:30:42: Das war dieses Modus, der eigentlich am Ende die Bisse bestellt hat und das funktioniert genauso wie jeder andere Agent-Halenes Film.

00:30:49: an diese Agent Hallen ist es gerne genau.

00:30:51: Ja Wahnsinn!

00:30:52: Vielen Dank fürs Teilen.

00:30:53: Das ist echt eine witzige Geschichte.

00:30:55: Kommen wir mal weg von den GPUs hier bei uns, bei Jonas Claut und bei euch in der Anwendung.

00:31:02: kommen wir mal hin zu dem KI Markt.

00:31:04: ich würde gern mal das Felten ein bisschen weiter stecken und zwar Benjamin, wer fragt den GPUs gerade an?

00:31:11: Gibt es da Branchen oder Veränderungen?

00:31:14: Hat sich das verändert in letzter Zeit?

00:31:16: Ja.

00:31:17: Also was mich wirklich überrascht ist die Breite der Use Cases.

00:31:21: Wir haben juristische KI-Software wir haben öffentliche IT-Dienstleister die Rack Systeme für Zehntausende Behördenmitarbeiter betreiben Sicherheitssoftware für Strafverfolgung Industrieautomatisierung aus dem Hochschulumfeld, eine spannende Maritime Anwendung die Telemetriedaten von unbemannten Booten in der Nordsee sammelt.

00:31:43: und dann auch zur vorausschauenden Berechnung der Instandhaltung also Stichwort predictive maintenance.

00:31:49: Auch das ist ein Use Case, der bei uns umgesetzt wurde.

00:31:51: Dann haben wir auf der anderen Seite auch Startups, die KI-Agenten bauen oder Sparfassistenten für CRM Systeme.

00:31:58: Und was vielleicht auch da besonders ist, dass es nicht nur Techaffine-Unternehmen, die ganz genau wissen was sie benötigen.

00:32:05: Sondern heute kommen verstärkt auch öffentliche Einrichtungen oder der klassische deutsche Mittelstand Unternehmen, die zum ersten Mal GPU-Infrastruktur evaluieren oft auch getrieben durch konkrete Anforderung an Datensouveränität zB.

00:32:18: Die können oder wollen auch ihre Daten nicht in die USA schicken und bauen deshalb lieber auf europäischer auf lokaler Infrastruktur auf.

00:32:27: ein großer gemeinsame Nenner ist auf jeden Fall Inferenz mit Modellen die man selbst kontrollieren will, entweder weil man eben eigene Modelle hat oder ein Modell benötigt, welches im AI-Modelhub nicht zur Verfügung gestellt wird.

00:32:40: Oder wenn man Daten hat, die zu sensibel für eine geteilte Infrastruktur sind oder weil man auch schlicht die dedizierte Capacity braucht.

00:32:48: und dann wie Melinda AI haben wir tatsächlich auch vereinzelt Kunden, die GPUs zum Training eigener Modelle verwenden.

00:32:56: Spannend!

00:32:57: Man sieht eine Veränderung über die Zeit

00:32:59: Absolut.

00:33:00: Richtig, genau!

00:33:01: Vor allem was auch den Sektor angeht die Interesse an den GPU-Ressourcen haben.

00:33:08: Ich bin echt gespannt wo das hinführt.

00:33:10: Ennis KI-Agenten?

00:33:11: Wo steht das Thema heute?

00:33:14: abseits jeglicher Medienschlagzeilen Ugel und Rubel.

00:33:18: Genau das ist diese Spinde.

00:33:20: ganze Zeit auf Twitter reddit ja okay Reddit und alle mögliche Social Media Und da bekommt man jedes weiten Tag von irgendwelchen neuen Agent-Harness, die veröffentlicht wurde.

00:33:34: Die jetzt alles automatisieren kann.

00:33:36: Am Ende reiten viele einfach die Hypewelle mit.

00:33:40: Sie wollen so viele GitHub-Stars wie möglich haben und bei ihnen geht es eigentlich gar nicht darum irgendwas wirklich vernünftig ist zu bauen oder innovativ wird zu bauen.

00:33:53: Es gibt viele AI Influencers auch heutzutage die ganze Zeit ihre eigene Harnesses veröffentlicht für einen sehr spezifischen Gebrauch.

00:34:02: Es gibt tatsächlich welche, die für den echten Gebrauchs gut funktionieren also für den produktiven Gebrauchen bei großer Unternehmen.

00:34:09: es gibt aber viele anderen, die keine echter Mehrwert anbieten.

00:34:14: Also es gibt immer diese Gems las mal sagen.

00:34:18: in dieser riesigen See von neuer Harness und AI Agents gibt das immer welche die eigentlich gut funktionieren.

00:34:26: Diejenigen, die mindestens für produktive Arbeit, für Enterprises gedacht sind, sind diejenigen, der die Kosten immer im Kopf behalten und die Sachen auch so einfach wie möglich zu gestalten weil es gibt Agent Harnesses, die für einen ganz normalen Aufgabe dann fünfzig Euro an API-Kost brauchen.

00:34:47: Wenn ich jetzt einen Agent für fünfzeig Euro pro Aufgabe bezahlen muss, dann lohnt sich das nicht mehr.

00:34:53: Ich würde lieber ein Mensch anstellen der dieser Aufgabe wahrscheinlich in weniger Zeit mit bessere Performance macht.

00:35:01: und das ist genau diese, lasst mal sagen, diese Edge die Leute die die Harnesses die das gut können, können es gut und es gibt aber viele anderen die keine Mehrwert bringen.

00:35:12: Das sind die Agents.

00:35:13: Ja, ich ziehe jetzt mal eine Frage vor.

00:35:15: Weil das ist etwas was mich tatsächlich sehr interessiert!

00:35:18: Wir haben auf der einen Seite das, wie sage ich das jetzt diplomatisch?

00:35:22: Das spielerische und freudige Beginn- und Staaten von KI-Projekten, KI Agents und das Loslegen, was ja auch so ne schöne Mentalität mitbringt, dass wir was schaffen, was machen, was Neues gehen.

00:35:38: Jeder geht in einer neuen Weg.

00:35:39: aber auf der anderen Seite haben wir eben auch die Kehrseite der Medaille Alles kostet Ressourcen, alles kostet Geld.

00:35:44: Die großen Unternehmen gucken gerade wie sie Energie sparen da die KI-Ressourzen zur Verfügung stellen können.

00:35:51: Wie steht dieses Spannungsverhältnis gegenüber?

00:35:54: Ressorzen versus Loslegen, Aktivität, KI Zukunft und so weiter.

00:36:00: Benjamin, fangen wir mal gerne an.

00:36:02: Ja, gerne.

00:36:03: Also bei dem Preis-Niveau.

00:36:06: also wir reden hier jetzt zum Beispiel von über zweitausend Euro pro GPU pro Monat für die CloudGPU VMs.

00:36:13: da machen sich Kunden natürlich durchaus vorab auch Gedanken dazu ob das wirklich benötigt wird.

00:36:18: Die Frage ist nicht ob man nachdenkt sondern ob man die richtigen Fragen eigentlich sich vorab stellt.

00:36:24: was ich oft empfehle ist bevor man überhaupt eine dedizierte GPU bucht, sollte man prüfen ob es wirklich notwendig ist.

00:36:32: Wir haben zum Beispiel im AI-Model Hub eine ganze Breite Palette an Modellen, die man direkt eben über die API nutzen kann.

00:36:40: Ohne eigene Infrastruktur ohne Setup.

00:36:42: Man zahlt pro eine Million Token.

00:36:45: Die Preise bewegen sich für eine Million token im Scentbereich und das ist für viele Use Cases eigentlich der sinnvollere Einstieg.

00:36:52: Man kann schnell testen, man kann Nutzungsmuster schnell testet um dann auch auf Erfahrungswerte zurückgreifen zu können und dann auf Basis von echter Daten entscheiden die zierte GPU Kapazität, ich denn tatsächlich benötige.

00:37:08: Wenn nicht das wirklich noch benötigte oder wie bereits erwähnt net die Zierte GPU ergibt dann sind wenn man eben eigene oder lizenzierte Modelle betreiben will sie jetzt nicht im AI-Model Hub zur Verfügung stehen oder wenn man spezifische Latents oder Durchsatzanforderungen hat die eben einen geteilten Dienst so nicht erfüllen kann.

00:37:29: aber da sollte eben immer eine bewusste Entscheidung sein.

00:37:33: Ich kann mir nicht vorstellen, dass da jeder wirklich bewusst drüber nachdenkt.

00:37:36: Aber bin da voll bei dir!

00:37:38: Ennis wie ist das bei dir?

00:37:39: Du hattest das Thema Budget schon ein bisschen angekratzt.

00:37:42: Ist es... ich würde jetzt mal sagen halbwegs limitierte Budget gleichzeitig eine Disziplinmaßnahme.

00:37:49: also geht es miteinander einher.

00:37:51: Hundertprozent also.

00:37:52: wir sind Startup das heißt wir arbeiten mit Fundraising mit Investorengeld und Da müssen wir natürlich vorsichtig damit umgehen.

00:38:03: Zum Ersten, man macht eine Runde und dann mit dieser Geld sollte man neue Generationen von Marlinda bauen.

00:38:10: Man sollte neue Kunden bekommen oder so was.

00:38:14: Und das heißt für uns... Wir müssen immer an Kosten denken!

00:38:19: Wir müssen immer die Ressourcen und den Ressouzengebrauch im Kopf behalten, so effizient wie möglich arbeiten.

00:38:27: Deswegen haben wir auch nur dann die dezierte GPUs geholt als wir wussten okay, die Entwicklungszyklus ist jetzt einfach zu langsam um das wirklich zu... neue Generationen zu bauen oder eine neue Generation von Malinde zu entwickeln.

00:38:43: Für Unternehmen, also große Unternehmen, das ist natürlich ein komplett anderer, dass man sagen, eine rechentliche Sache.

00:38:52: Es gibt viele die sagen okay für uns ist Souveränität eher wichtiger als die Kosten und deswegen würden wir trotzdem eigene digitalisierte GPUs holen.

00:39:00: es gibt manche die sagen ok bei uns geht jetzt nur einfach darum Genauso wie Benjamin gerade gesagt hat, ein Lasttest zu machen und dann zu überprüfen ob es sich überhaupt lohnt um eigene GPUs zu haben.

00:39:12: Als Startup sollte man aber komplett anders denken.

00:39:16: Geld und wie viel kostet den GPU pro Stunde ist sehr wichtig für uns.

00:39:20: Und jetzt also das kommt wirklich aus eigener Erfahrung und eigenen Tests.

00:39:26: IONUS ist eine der beste Preis-Leistungsverhältnisse hier in der EU allgemein und da habe ich schon mehrere getestet.

00:39:35: Das machen wir wirklich gern und das geben wir auch gerne weiter.

00:39:37: Ich würde wahrscheinlich werben damit, wenn ich den Podcast bewerbe.

00:39:43: Genau aber was mich da auch interessiert, weil du sprichst ja davon Start-up und Investoren und war das wegen der Technik schon mal finanziell schwierig.

00:39:52: dazu ein bisschen die spicy question hier an der Stelle?

00:39:55: Ja definitiv.

00:39:58: Viele Investoren sind an dem Altmodischen SAS Startup gewöhnt.

00:40:03: Da schreibt man code, lässt das gerne auf einem CPU Server laufen, kostet ihr nicht mehr als dreihundert Euro pro Monat, könnte auch sogar günstigere VCPU Server laufen für ein KI-Startup.

00:40:16: heute ist komplett anders.

00:40:19: Da sind die GPU-Kosten eigentlich oder die Hardware-Kosten viel höher als die Personalkosten.

00:40:26: Also du hast die Top AI Researcher, dann kosten dir ja auch so was.

00:40:31: aber für uns mindestens als Starship sind die GPU Kosten die höchste Ausgabe wie wir aktuell haben.

00:40:37: natürlich brauchen wir Wir müssen eigene Modellen trainieren, also das geht nicht anders.

00:40:44: Wir haben es mit öffentlicher Open Source Modellen getestet mit Fine Tuning nur und so was und das hat nicht so gut funktioniert wie man das gerne hätte.

00:40:53: Und deswegen ja ... Soviel Investoren ist ein bisschen schwieriger zu rechtfertigen, der so viele Ausgaben an GPUs und Hardwarekosten zu haben.

00:41:05: aber das geht echt anders mit einem AI Startup.

00:41:08: Man ist nur ein, lass mal sagen OpenAI-Rapper oder ChatGPT-Rapper.

00:41:14: Dann zahlt man einfach alles an OpenAI und hat nur eine sehr kleine Marge.

00:41:21: Das ist komplett anders als komplett eigene Modellen anzubieten.

00:41:26: Verstehe!

00:41:27: Und da muss es dann offensichtlich auch einen Mindsetwechsel bei den Investoren geben... ...dann alles passt sich an?

00:41:35: Viele haben Viele verstehen es schon, dass bei AI Startups anders ist als bei normaler SES Startups.

00:41:45: Für einen SES startup reichen dann das war hunderttausend Infektionen aus für den Start.

00:41:50: Für Pre-Seat lässt man sagen, für ein AI startup das ist komplett anders weil die GPU kosten... halt hoch sind und so.

00:42:00: Das ist auch nicht bei jedem AI-Startup, wenn man nur im Hintergrund OpenAI, also OpenAI API aufruft dann braucht man auch nicht so viele Investitionen.

00:42:13: aber wenn man wie uns, also wie Marlindern Research Lab erst und viel Research im Hintergrond macht und die ganze Zeit am Forschen, Architektur testen neue Modelltrainieren

00:42:25: usw.,

00:42:27: Ja, dann hat man halt diese Höherkosten an GPUs.

00:42:32: Du hattest vorhin das Thema digitale Souveränität nochmal erwähnt ist quasi Teil eurer DNA.

00:42:39: aber jetzt noch mal eine Frage von mir an euch.

00:42:42: beide Dinge die ich im Markt beobachte wir sagen Ja auch von Jonas Cloud.

00:42:48: Wir sind digital souverän, ihr baut eure Souveränität quasi Inherent mit in das Produkt ein.

00:42:54: Die großen Modelle werden aber in San Francisco trainiert und die rechen Zentren stehen...die großen Rechenzentren stehen in den USA.

00:43:01: Frage an euch!

00:43:02: Denkt ihr wir verlieren als auch Robertas Rennen schon oder sind wir quasi noch irgendwo mit auf der Laufbahn?

00:43:08: Benjamin was denkst

00:43:09: du?!

00:43:10: Also ich denke beim Modelltraining und bei den großen Foundationmodellen, da haben wir den Zug tatsächlich verpasst.

00:43:16: GPT-Vier, Fünf, Lama, Gemini... Die sind alle in den USA entstanden und aktuelle State of the Art Open Weight Modelle kommen gerade aus China.

00:43:26: Da wird sich glaube ich kurzfristig auch nichts ändern.

00:43:29: Aber die Frage ist trotzdem, verlieren wir deshalb das Rennen?

00:43:32: Und ich glaube eben nicht!

00:43:34: Weil erstens sind viele der leistungsfähigen Modelle tatsächlich auch open weight Modelle.

00:43:40: Die kann sich jeder herunterladen und eben auch auf europäischer Infrastruktur dann betreiben unter europäischem Recht.

00:43:46: Und damit eben auch digital souverän.

00:43:49: Und zweitens kann tatsächlich Europa eine ganze Menge in dem Bereich bieten, nämlich Datensouveranität oder DSGVO-Konformität um keine Abhängigkeit zum AI oder zum US Cloud zu haben.

00:44:03: Und drittens, und das ist mir persönlich auch wichtig.

00:44:07: Ich glaube, dass Rennen um KI nicht ein einziges Rennen.

00:44:11: Bei den großen Allzweckmodellen liegen andere Formen aber Deutschland ist traditionell ein Industrieland und für die wirklich relevanten Modelle der Zukunft werden spezialisierte Modelle dann benötigt Für Fertigungsprozesse, für die Logistik, für Medizin, für Recht, für öffentliche Verwaltung Und da findet dann eben das Training auf deutschen Daten für deutsche Prozesse und unter europäischem Recht statt.

00:44:37: Da ist das Rennen noch lange nicht entschieden, und da sehe ich tatsächlich in Deutschland auch einen großen Heimvorteil.

00:44:43: Ennis!

00:44:44: Wie ist es bei dir?

00:44:45: Datensouveränität mein Lieblingsthema als Pentester.

00:44:51: Ich bin dafür dass wir für alle mögliche Die Dienste, also jetzt nicht nur wegen AI alle mögliche Softwaredienste die wir brauchen komplett souverän werden.

00:45:02: Ob es dann Betriebssysteme, Office-Tools oder irgendwelche andere beliebige Tools wie wir brauchen sollten wir uns komplett auf Souveränität stellen weil sonst geht das nicht.

00:45:18: man kann immer von einem anderen Land abhängig sein.

00:45:23: Egal, ob es jetzt China oder USA ist und deswegen glaube ich auch dann wenn das um KI geht wir haben einfach die richtig schlaue Menschen hier.

00:45:36: Das kann ich mit Sicherheit sagen.

00:45:38: also ich rede die ganze Zeit in diesem Startup-Szene redet die ganze zeit mit irgendwelche andere startup Founders Doktoranden und so.

00:45:49: Ja,

00:45:49: also

00:45:50: ein Wissen fehlt es halt uns gar nicht hier.

00:45:53: Das ist auch bestimmt jetzt nicht an Infrastruktur weil wir haben Jonas Wir haben andere Cloud Provider Und die Entwicklung von LLIMS ist auch dann viel, viel günstiger geworden.

00:46:08: Also mit der ersten GPT-III-Modell hat keine Ahnung, also so war ich hundertfünfzig mehr Millionen oder sowas gekostet.

00:46:16: DeepSeek R-One kam dann und sagen ja wir haben auch den gleichen Performance für fünf Millionen nur trainiert... Das wird alles immer günstiger.

00:46:25: Neue Optimizers, neue Architekturen werden gebaut.

00:46:30: Datensätze werden die ganze Zeit jetzt komplett kostenlos und öffentlich gemacht für Training.

00:46:38: Ich glaube nicht dass wir das Rennen verloren haben.

00:46:41: Wir brauchen nur einfach die Wille dazu machen Mehr Startups mehr Geld rein investieren Forschung in dem Bereich unterstützen, fördern und so was.

00:46:59: Programme vom Land, vom Stadt dann noch dazu auch... Ich halte es eigentlich für wichtig dass die EU auf EU eben sagt okay jetzt bei der also bei der Suche nach einem Softwareprodukt immer erst mal die lokalen Anbieter überprüfen, statt direkt zu den bekanntesten zu springen.

00:47:20: Weil wir haben für die einfachste Sachen wie Project Management uns als komplettes Land auf eine amerikanische Anbiete angesetzt und obwohl wir hier in Deutschland schon mehrere andere Alternativen haben, die genauso gute Funktionalität aber für ein günstiger Preis anbieten?

00:47:39: Warum dann?

00:47:40: Wir haben die Möglichkeit, uns komplett souverän zu gestalten dass wir dann in den nächsten zehn bis dreißig Jahren zu machen.

00:47:47: Nicht abhängig von China, nicht abhängiger von der USA oder irgendwelche andere Länder?

00:47:51: Absolut!

00:47:52: Und Benjamin hat es ja schon gesagt, dass wir in spezifischen KI-Agenten wachsen können und mithalten können.

00:48:00: Was mich jetzt gerade noch kurz interessieren würde ist wenn du bist im Startupfeld marktätig mit den Leuten in Interaktion.

00:48:08: beobachtest du diesen Trend?

00:48:09: auch?

00:48:09: bei denen das da Souveränität immer mehr ein Thema wird wird da eigentlich gar nicht so richtig nachgedacht.

00:48:14: Wir haben es ja gehört, öffentliche Institutionen kommen auf uns zu und bei uns beobachten einen Trend.

00:48:20: wie ist das bei dir?

00:48:21: Hundert Prozent.

00:48:22: Es gibt viele Start-ups, die einfach eine Idee von der USA nehmen oder von einer amerikanischen Startup nehmen und dann hier mit Datensouveränität im Kopf neu bauen.

00:48:34: Weil am Ende gibt es für fast jede mögliche Idee der Welt schon ein Start up, das wir versucht zu machen.

00:48:39: Die Sache ist, es muss nicht nur eine Start Up geben sondern in jedem Land solltest du einen ergeben.

00:48:45: Konkurrenz ist nicht nur gut für den Land, sondern für die gesamte Welt für Endkonsumenten.

00:48:51: Und das merke ich auch dann bei vielen deutschen Start-ups sagen, ja wir machen genau das was diese amerikanische Startup macht aber wir machen es hier lokal so Datensovereinitet im Kopf mit GDPR und EUAI Act im Kopf und so.

00:49:06: Das sind Start Ups also sie... Aber nicht nur Sachen nachmachen sondern es gibt unglaublich gute, innovativer Ideen.

00:49:14: Die Starship Gründer finden in manchen Fällen entsteht die Idee so dass sie einfach aus ihrer Berufserfahrung, sie haben irgendwo gearbeitet und festgestellt okay das irgendwas läuft schief da und wir können es tatsächlich besser machen und das freut mich weil In der Statistik sind jetzt so viele Startups wie in den letzten fünf Jahren gegründet.

00:49:44: Also es gibt dann ein Startupverband, sie veröffentlichen diese Statistiken immer gerne und das freut mich wirklich so viele junge Startups zu sehen die versuchen AI hier in Deutschland in der EU zu machen.

00:50:00: also man hat die Kapazität Bestimmt genug Geld hier in Deutschland, um eine bessere GPD zu bauen.

00:50:06: Also GPT-Five point six soll er auch.

00:50:10: Wir können das machen und ich glaube daran dass wir das hinbekommen wenn wir das im Kopf setzen und daraus sitzen komplett souverän zu werden.

00:50:18: Ich kann nur sagen egal ob die Daten hier in der EU gehostet sind oder nicht Wenn es ein Anbieter aus dem Ausland ist, dann sind das halt unter immer die Kontrolle von diesem Anbieten.

00:50:30: Diese Anbiete können jederzeit dazu entscheiden einfach deiner Daten für KI Training zu verwenden oder sowas.

00:50:36: Ja, die Daten werden hier in Frankfurt Server gehostet... Wer hat aber Zugriff auf diese Server?

00:50:41: Das ist ein amerikanischer Anbiter!

00:50:43: Also er kann ja natürlich jederzeit einfach auf die Daten rein kommen und damit einen KI trainieren.

00:50:49: Und deswegen vertrauen ist gut.

00:50:52: Zu sicher ist besser

00:50:53: Absolut, das war eigentlich das perfekte Schlusswort.

00:50:57: Vielen Dank euch beiden!

00:50:58: Ich möchte euch kurz noch die Bühne geben, möchtet ihr noch was loswerden?

00:51:01: Möchtet Ihr noch etwas sagen den Zuhörern noch irgendeine Botschaft mitgeben?

00:51:04: Was habt Ihr heute mitgenommen?

00:51:06: Benjamin!

00:51:06: Ja, ich fand es ein mega interessantes Gespräch auch von Ennis das zu hören.

00:51:12: Vor allem eben auch tatsächlich praktische Beispiele zu finden von deutschen Startups die dann auch deutsche Infrastruktur verwenden.

00:51:20: Da brauchen wir wesentlich mehr davon.

00:51:23: da wollen wir aktiv sein.

00:51:24: und ja auch danke für das Format hier.

00:51:26: Ich glaube auch dieser Wissenstransfer ist absolut notwendig in Deutschland.

00:51:31: Gerne!

00:51:31: Ennis möchtest du noch was sagen?

00:51:34: voll gefreut, also besonders jetzt auch von Benjamin zu erfahren was andere Ionis Kunden machen.

00:51:40: Also ich dachte die ganze Zeit okay alle verwenden diese GPUs zum Training anscheinend eher nicht.

00:51:45: Zum großen Teil wird das für Infrains verwendet und für Hosten von Modellen.

00:51:49: Das war überraschend!

00:51:51: Ich finde es immer gut die Idee von Souveränität zu antreiben weil am Ende das halte ich für äußererst wichtig eigentlich... Wir können es machen und mit der IONUS zusammen das machen zu können, ist natürlich immer cool.

00:52:10: Und die Unterstützung, die wir auch von IONUs bekommen.

00:52:13: Schön!

00:52:13: Wir geben uns große Mühe.

00:52:14: Alle unsere Kolleginnen geben sich Mühe.

00:52:17: Vielen Dank euch beiden dass ihr da wart.

00:52:19: Vielen Dank für die Ausführungen.

00:52:20: vielen dank für die lieben Worte.

00:52:23: Ich nehme mich auf jeden Fall gerne mit.

00:52:24: Wer mehr über Marlinda erfahren möchte, ich pack das alles in die Show-Notes oder unsere Kontaktdaten gerne auch mit in die show notes.

00:52:32: Lasst uns ein Like da voll gerne und empfehlt dem Podcast gerne weiter!

00:52:36: Wenn es euch gefallen hat, lasst mich wissen was ihr gerne in den nächsten Folgen hören wollt.

00:52:39: Vielen Dank euch beiden und bis zum nächsten Mal.

00:52:42: Macht's gut, ciao!

00:52:43: Danke schön, tschüss!

00:52:44: Das war der Aionos Cloud Partner Podcast.

00:52:47: Danke fürs Zuhören und bis zur nächsten Folge.

00:52:50: Wenn euch die Episode gefallen hat, abonniert uns hinterlasst eine Bewertung oder teilt den Podcast mit euren Kollegen und Kolleginnen.