259

Daten & Datenbanken · Machine Learning

ICT-Lösungen mit Machine Learning entwickeln

Du lernst, aus Daten ein Vorhersagemodell zu trainieren, ehrlich zu bewerten und in eine echte Anwendung einzubauen.

Fortgeschritten Fortgeschritten ca. 28 Std. SelbststudiumApplikationsentwicklung: 2. Lehrjahr · üK-WahlpflichtPlattformentwicklung: 2. Lehrjahr · üK-Wahlpflicht
#Machine Learning#scikit-learn#Python#Jupyter#Klassifikation#Regression#Modellbewertung#Datenaufbereitung#KI-Ethik

Überblick

Worum geht es?

Machine Learning heisst: Ein Programm lernt Regeln aus Beispielen, statt dass du sie von Hand schreibst. Du lernst, ein Problem richtig einzuordnen, Daten mit pandas zu erkunden und aufzubereiten und mit scikit-learn Modelle zu trainieren. Du vergleichst sie mit einer einfachen Baseline, bewertest sie mit passenden Kennzahlen und erkennst Overfitting. Zum Schluss stellst du ein Modell über eine API bereit und prüfst, ob es fair, datenschutzkonform und verständlich genug für den Einsatz ist.

Wofür brauchst du das?

Schweizer Unternehmen setzen Machine Learning bereits produktiv ein, etwa für Absatzprognosen im Detailhandel, Betrugserkennung bei Banken oder die Klassifikation von Support-Tickets. Auch wenn du kein Data Scientist wirst, musst du als Informatiker:in verstehen, wie ein Modell entsteht, was seine Kennzahlen bedeuten und wie man es sauber in eine Anwendung einbaut. Das Modul baut auf 162 (Daten analysieren) und 122 (Scripting) auf und passt gut zu 110 (Datenanalyse mit Tools) und 248 (aktuelle Technologien).

Das solltest du schon können

  • Python-Skripte mit Variablen, Schleifen, Funktionen und Listen schreiben (Modul 122)
  • Daten strukturieren und Datentypen sowie Ausreisser erkennen (Modul 162)
  • Grundlagen der Statistik: Mittelwert, Median, Prozentwerte und einfache Diagramme lesen

Typische Tools & Technologien

PythonJupyter / JupyterLabpandasscikit-learnmatplotlib / seabornGoogle ColabFastAPIDocker

Lernziele

Was musst du können?

Das sind die Fähigkeiten, die am Ende des Moduls sitzen sollten. Jedes Ziel mit einem Beispiel aus dem Lehrbetrieb.

  1. 1

    Ein Geschäftsproblem als ML-Aufgabe formulieren und prüfen, ob ML überhaupt passt

    Kompetenz A

    Du erkennst, ob es um eine Kategorie (Klassifikation), eine Zahl (Regression) oder um Gruppen ohne vorgegebene Antwort (Clustering) geht. Und du prüfst ehrlich, ob es genügend Daten gibt und ob eine einfache Regel nicht schon reicht.

    Situation

    Der Support eines Internetanbieters in Bern erhält täglich 400 Tickets, die von Hand den Teams Technik, Rechnung und Vertrag zugewiesen werden.

    Deine Aufgabe

    Formuliere das Problem als ML-Aufgabe und prüfe die Voraussetzungen.

    Gutes Ergebnis

    Klassifikation mit drei Klassen auf Basis von Betreff und Text. Es gibt 25 000 bereits zugewiesene Tickets aus zwei Jahren als Trainingsdaten. Erfolg: mindestens 85 % korrekt zugewiesen, unsichere Fälle gehen weiter an einen Menschen. Eine Schlüsselwortregel schafft nur 61 %, ML lohnt sich also.

    überwachtes / unüberwachtes LernenKlassifikationRegressionClusteringLabelBaseline
  2. 2

    Daten mit pandas erkunden, bereinigen und für ein Modell vorbereiten

    Kompetenz B

    Rohdaten sind nie perfekt. Du findest fehlende Werte, Ausreisser und falsche Datentypen, wandelst Kategorien in Zahlen um und teilst die Daten sauber in Trainings- und Testdaten, bevor du ein Modell anfasst.

    Situation

    Eine Immobilienverwaltung in Luzern will Mietpreise schätzen. Die Excel-Liste mit 3800 Wohnungen hat Lücken und Tippfehler.

    Deine Aufgabe

    Bereite die Daten in einem Jupyter-Notebook für ein Regressionsmodell auf.

    Gutes Ergebnis

    120 Zeilen ohne Fläche werden entfernt, fehlende Baujahre mit dem Median des Quartiers ersetzt, eine Wohnung mit 4000 m² als Tippfehler korrigiert. Ortschaft und Balkon werden per One-Hot-Encoding umgewandelt. Eine scikit-learn-Pipeline mit 80/20-Split stellt sicher, dass die Testdaten nie in die Aufbereitung einfliessen.

    DataFramefehlende WerteAusreisserOne-Hot-EncodingSkalierungTrain-Test-Split
  3. 3

    Modelle mit scikit-learn trainieren und mit einer Baseline vergleichen

    Kompetenz C

    Du trainierst mehrere Algorithmen auf denselben Daten und vergleichst sie mit einer möglichst einfachen Vorhersage. Ein Modell ist nur dann gut, wenn es die Baseline deutlich schlägt.

    Situation

    Für die Mietpreise liegen aufbereitete Daten vor.

    Deine Aufgabe

    Trainiere drei Modelle und vergleiche sie mit einer Baseline.

    Gutes Ergebnis

    Baseline 'Durchschnittsmiete pro Quartier' liegt im Mittel CHF 310 daneben. Lineare Regression CHF 220, Entscheidungsbaum CHF 240, Random Forest CHF 165. Der Random Forest wird weiterverfolgt, die Ergebnisse stehen übersichtlich in einer Tabelle im Notebook.

    fit / predictlineare RegressionEntscheidungsbaumRandom ForestPipelineHyperparameter
  4. 4

    Modelle mit passenden Kennzahlen bewerten und Overfitting erkennen

    Kompetenz D

    Genauigkeit allein kann täuschen, besonders bei seltenen Fällen. Du wählst Kennzahlen, die zum Problem passen, liest eine Konfusionsmatrix und prüfst mit Kreuzvalidierung, ob dein Modell auch auf neuen Daten funktioniert.

    Situation

    Ein Online-Händler will betrügerische Bestellungen erkennen. Nur 1 % aller Bestellungen sind Betrug. Ein erstes Modell hat 99 % Genauigkeit.

    Deine Aufgabe

    Beurteile, ob das Modell wirklich gut ist.

    Gutes Ergebnis

    Die Konfusionsmatrix zeigt: Das Modell sagt immer 'kein Betrug' und findet 0 von 120 Betrugsfällen. Nach Anpassung mit Klassengewichten: Recall 78 %, Precision 41 %. Mit dem Händler wird vereinbart, dass verdächtige Bestellungen von Hand geprüft werden. Die Trainingsgenauigkeit von 100 % bei deutlich tieferem Testwert wird beim Entscheidungsbaum als Overfitting erkannt und mit max_depth begrenzt.

    AccuracyPrecision / RecallKonfusionsmatrixMAE / RMSEKreuzvalidierungOverfitting
  5. 5

    Ein trainiertes Modell über eine API in eine Anwendung einbinden

    Kompetenz E

    Ein Modell im Notebook nützt niemandem. Du speicherst das trainierte Modell inklusive Vorverarbeitung, stellst es über eine kleine API bereit und sorgst dafür, dass Eingaben geprüft und Versionen nachvollziehbar sind.

    Situation

    Das Ticketsystem des Internetanbieters soll für jedes neue Ticket automatisch einen Teamvorschlag erhalten.

    Deine Aufgabe

    Stelle das Klassifikationsmodell als Webdienst bereit.

    Gutes Ergebnis

    Die scikit-learn-Pipeline wird mit joblib als 'ticket-classifier-1.2.joblib' gespeichert. Eine FastAPI-Anwendung mit Endpunkt POST /classify liefert Team und Wahrscheinlichkeit, unter 60 % lautet der Vorschlag 'manuell prüfen'. Das Ganze läuft als Docker-Container und antwortet in unter 50 ms.

    Modell serialisieren (joblib)REST-APIEingabevalidierungModellversionKonfidenz / Wahrscheinlichkeit
  6. 6

    Fairness, Datenschutz und Grenzen eines Modells beurteilen

    Kompetenz F

    Modelle lernen auch Verzerrungen aus den Daten. Du prüfst, ob bestimmte Gruppen benachteiligt werden, ob Personendaten nötig sind und ob Betroffene Entscheidungen nachvollziehen können. Das DSG (oft noch revDSG genannt) verlangt bei automatisierten Einzelentscheidungen mit erheblicher Wirkung eine Information und die Möglichkeit, eine menschliche Prüfung zu verlangen.

    Situation

    Eine Personalabteilung will Bewerbungsdossiers automatisch vorsortieren lassen und hat dafür Daten der letzten 5 Jahre.

    Deine Aufgabe

    Beurteile Risiken und mache einen Vorschlag.

    Gutes Ergebnis

    Analyse zeigt: In den alten Daten wurden Personen über 50 seltener eingeladen, ein Modell würde das übernehmen. Vorschlag: Alter, Geschlecht, Name und Foto werden entfernt, das Modell sortiert nur vor, jede Absage prüft ein Mensch, Bewerbende werden informiert. Ein kurzer Bericht dokumentiert Datenherkunft, Kennzahlen pro Altersgruppe und Grenzen des Modells.

    BiasFairnessErklärbarkeitDatenminimierungautomatisierte EinzelentscheidungHuman in the Loop

Selbsteinschätzung

Wo stehst du?

Die Kompetenzmatrix zerlegt das Modul in Themenstränge und drei Stufen. Für den Kompetenznachweis solltest du überall mindestens Stufe 2 erreichen. Dein Stand bleibt in diesem Browser gespeichert und färbt Lernweg und Übungen ein.

Tippe auf eine Aussage, um deinen Stand zu setzen: offen unsicher sitzt
A

Problem als ML-Aufgabe einordnen

Ziel 1

Grundlagen

Fortgeschritten

Erweitert

B

Daten erkunden und vorbereiten

Ziel 2

Grundlagen

Fortgeschritten

Erweitert

C

Modelle trainieren

Ziel 3

Grundlagen

Fortgeschritten

Erweitert

D

Modelle ehrlich bewerten

Ziel 4

Grundlagen

Fortgeschritten

Erweitert

E

Modell in eine Anwendung integrieren

Ziel 5

Grundlagen

Fortgeschritten

Erweitert

F

Verantwortung und Grenzen

Ziel 6

Grundlagen

Fortgeschritten

Erweitert

Praxisfall

Schadenmeldungen automatisch zuteilen

Leandro ist im 2. Lehrjahr als Informatiker Plattformentwicklung bei der Mobilia Versicherungen AG in Solothurn, einer Versicherung mit 320 Mitarbeitenden. Pro Tag treffen rund 600 Schadenmeldungen über das Online-Formular ein, die ein Team von Hand an die Abteilungen Fahrzeug, Hausrat oder Haftpflicht verteilt. Leandro soll im Data-Team prüfen, ob ein Modell diese Zuteilung zuverlässig vorschlagen kann.

  1. Kapitel 1

    Braucht es dafür wirklich KI?

    Leandro schaut sich zuerst an, wie die Zuteilung heute läuft, und erkennt eine Klassifikation mit drei Klassen. Er prüft, ob eine einfache Stichwortregel reichen würde, und kommt damit auf 71 Prozent korrekte Zuteilungen. Mit der Teamleiterin legt er fest, dass ein Modell mindestens 90 Prozent erreichen muss, damit sich der Aufwand lohnt, und dass unsichere Fälle weiterhin von Hand verteilt werden.

    Ziel 1

  2. Kapitel 2

    18'000 Meldungen aufräumen

    Aus dem Schadensystem erhält Leandro 18'000 anonymisierte Meldungen der letzten zwei Jahre. In pandas findet er 900 Duplikate, leere Beschreibungen und eine Spalte 'Sachbearbeiter', die direkt verrät, welche Abteilung zuständig war. Diese Spalte entfernt er, weil sie im Moment der Vorhersage noch gar nicht bekannt ist. Danach teilt er die Daten zeitlich auf: die ersten 21 Monate zum Trainieren, die letzten drei Monate zum Testen.

    Ziel 2

  3. Kapitel 3

    Die Baseline schlagen

    Leandro wandelt die Texte mit TF-IDF in Merkmale um und trainiert eine logistische Regression und einen Random Forest. Die logistische Regression erreicht im Test 93 Prozent Accuracy, der Random Forest 99 Prozent im Training, aber nur 88 Prozent im Test. Leandro erkennt das Overfitting und wählt die logistische Regression. Die Konfusionsmatrix zeigt, dass Haftpflichtfälle am häufigsten verwechselt werden, deshalb gehen Vorschläge mit tiefer Sicherheit zur manuellen Prüfung.

    Ziel 3Ziel 4

  4. Kapitel 4

    Der Vorschlag im Schadensystem

    Leandro speichert das Modell mit joblib und stellt es über eine FastAPI-Schnittstelle bereit, die eine Meldung entgegennimmt und Abteilung und Sicherheit zurückgibt. Die API läuft in einem Docker-Container im internen Netz. Beim ersten Test schickt das Schadensystem Texte mit 20'000 Zeichen, worauf Leandro eine Längenprüfung ergänzt. Jede Vorhersage wird mit der Modellversion protokolliert, damit die Trefferquote im Betrieb verfolgt werden kann.

    Ziel 5

  5. Kapitel 5

    Fair für alle Kundinnen und Kunden?

    Vor dem Pilot prüft Leandro die Fehlerraten getrennt nach Sprache und stellt fest, dass französische Meldungen doppelt so oft falsch zugeteilt werden. Der Grund: Nur 8 Prozent der Trainingsdaten waren französisch. Er ergänzt weitere Daten, dokumentiert die Grenzen des Modells und hält fest, dass das Modell nur Vorschläge macht, die Mitarbeitende jederzeit ändern können. Danach gibt die Datenschutzberaterin den Pilot frei.

    Ziel 6

Lernweg

Wie lernst du das?

  1. 1

    Grundideen und Werkzeuge

    ca. 3 Std.

    Du richtest deine Umgebung ein und lernst die Arten von ML-Problemen kennen. Google Colab oder JupyterLab lokal sind kostenlos.

    • JupyterLab mit pandas und scikit-learn installieren oder Google Colab verwenden
    • Zehn Alltagsbeispiele als Klassifikation, Regression oder Clustering einordnen
    • Für ein Beispiel eine einfache Regel als Baseline formulieren

    Trainiert Kompetenz A1A2

    Lernziel1

  2. 2

    Daten verstehen und vorbereiten

    ca. 5 Std.

    Du arbeitest mit einem echten, öffentlichen Datensatz und lernst, dass Datenaufbereitung den grössten Teil der Arbeit ausmacht.

    • Einen Datensatz von opendata.swiss laden und mit describe(), info() und Diagrammen erkunden
    • Fehlende Werte und Ausreisser behandeln und Kategorien codieren
    • Daten in Trainings- und Testteil aufteilen und begründen, warum vor der Aufbereitung

    Trainiert Kompetenz B1B2

    Lernziel2

  3. 3

    Erste Modelle trainieren

    ca. 5 Std.

    Du trainierst verschiedene Modelle und lernst, sie fair zu vergleichen.

    • Eine Regression und eine Klassifikation mit je drei Algorithmen trainieren
    • Alle Schritte in eine scikit-learn-Pipeline packen
    • Die Ergebnisse in einer Vergleichstabelle mit Baseline darstellen

    Trainiert Kompetenz C1C2

    Lernziel3

  4. 4

    Ehrlich bewerten

    ca. 5 Std.

    Du lernst, Kennzahlen richtig zu lesen und Overfitting zu erkennen und zu vermeiden.

    • Konfusionsmatrix, Precision und Recall für einen unausgeglichenen Datensatz berechnen
    • Kreuzvalidierung durchführen und Trainings- mit Testfehler vergleichen
    • Mit GridSearchCV zwei Hyperparameter abstimmen

    Trainiert Kompetenz D1D2C3

    Lernziel4

  5. 5

    Vom Notebook zur Anwendung

    ca. 5 Std.

    Du bringst ein Modell aus dem Notebook in einen Webdienst, den andere Programme nutzen können.

    • Die trainierte Pipeline mit joblib speichern und neu laden
    • Eine FastAPI-Anwendung mit Eingabevalidierung schreiben
    • Den Dienst in einen Docker-Container packen und mit curl oder Postman testen

    Trainiert Kompetenz E1E2

    Lernziel5

  6. 6

    Verantwortung und Abschlussprojekt

    ca. 4 Std.

    Du prüfst dein Modell auf Fairness und Datenschutz und fasst das ganze Projekt zusammen.

    • Kennzahlen getrennt nach Gruppen berechnen und Unterschiede interpretieren
    • Eine einseitige Modellbeschreibung mit Zweck, Daten, Kennzahlen und Grenzen schreiben
    • Das Projekt in 10 Minuten einer Person ohne ML-Kenntnisse erklären

    Trainiert Kompetenz F1F2A3D3

    Lernziel614

Üben

Übungen aus der Praxis

Velo-Ausleihen vorhersagen

Einstieg Einstieg

Ein städtischer Veloverleih will planen, wie viele Velos er pro Tag bereitstellen muss. Es gibt Daten zu Wetter, Wochentag und Anzahl Ausleihen der letzten zwei Jahre.

Weist nach B1C1

  1. Daten laden und mit Diagrammen den Zusammenhang zwischen Temperatur und Ausleihen zeigen
  2. Eine Baseline (Durchschnitt pro Wochentag) berechnen
  3. Eine lineare Regression trainieren und den MAE mit der Baseline vergleichen
Tipp anzeigen

Der Wochentag ist eine Kategorie, keine Zahl. Montag ist nicht 'kleiner' als Sonntag.

Lösungsskizze anzeigen

Train-Test-Split, Wochentag per One-Hot-Encoding, Temperatur und Niederschlag als Zahlen. Die Regression sollte die Baseline klar schlagen, z.B. MAE 180 statt 310 Ausleihen. Interpretation der Koeffizienten: pro Grad mehr steigen die Ausleihen.

Kündigungen im Fitnessabo erkennen

Fortgeschritten Fortgeschritten

Eine Fitnesskette will Mitglieder erkennen, die bald kündigen könnten, um ihnen ein Angebot zu machen. Nur 8 % kündigen pro Jahr.

Weist nach A2D2

  1. Das Problem formulieren und eine passende Hauptkennzahl wählen
  2. Daten aufbereiten und zwei Klassifikationsmodelle trainieren
  3. Konfusionsmatrix, Precision und Recall interpretieren
  4. Mit Kreuzvalidierung prüfen, ob das Ergebnis stabil ist
Tipp anzeigen

Überlege, was teurer ist: einem treuen Mitglied unnötig ein Angebot zu machen oder eine Kündigung zu übersehen. Daraus folgt, ob Precision oder Recall wichtiger ist.

Lösungsskizze anzeigen

Klassifikation mit unausgeglichenen Klassen, Stratified-Split und class_weight. Recall ist meist wichtiger, weil ein Angebot günstig ist. Random Forest oder logistische Regression im Vergleich, Kreuzvalidierung mit 5 Folds, Ergebnis z.B. Recall 70 % bei Precision 35 %.

Ticket-Klassifikation als Dienst

Anspruchsvoll Anspruchsvoll

Der IT-Support einer Kantonsverwaltung will eingehende Tickets automatisch den Teams Arbeitsplatz, Netzwerk und Fachanwendung zuordnen. Es gibt 12 000 anonymisierte Tickets mit Betreff, Text und Team.

Weist nach E2E3F3D3B3

  1. Texte mit TF-IDF in Zahlen umwandeln und einen Klassifikator trainieren
  2. Kennzahlen pro Team auswerten und einen Schwellenwert für 'manuell prüfen' festlegen
  3. Die Pipeline speichern und als FastAPI-Dienst im Container bereitstellen
  4. Datenschutz und Grenzen in einer Modellbeschreibung dokumentieren
Tipp anzeigen

Achte darauf, dass die Texte vor dem Training keine Namen oder Telefonnummern mehr enthalten. Ein Modell kann auch Personendaten 'lernen'.

Lösungsskizze anzeigen

Pipeline aus TfidfVectorizer und LogisticRegression oder LinearSVC. Bewertung mit classification_report pro Team. Unter 60 % Wahrscheinlichkeit wird an einen Menschen weitergeleitet. API mit Pydantic-Validierung und Versionsangabe in der Antwort. Modellbeschreibung mit Zweck, Datenbasis, Kennzahlen, bekannten Schwächen und Verantwortlichen.

Selbstcheck

Kannst du das beantworten?

Was ist der Unterschied zwischen Klassifikation und Regression?

Klassifikation sagt eine Kategorie voraus (z.B. Team A, B oder C), Regression eine Zahl (z.B. Mietpreis in CHF).

Warum braucht es eine Baseline?

Um zu zeigen, dass das Modell besser ist als eine einfache Regel. Ohne Vergleich ist eine Kennzahl wertlos.

Warum ist 99 % Genauigkeit bei 1 % Betrugsfällen kein gutes Zeichen?

Weil ein Modell, das immer 'kein Betrug' sagt, genau diese Genauigkeit erreicht, aber keinen einzigen Betrug findet.

Was bedeutet Overfitting?

Das Modell lernt die Trainingsdaten auswendig, inklusive Zufälle, und funktioniert auf neuen Daten deutlich schlechter.

Warum muss der Train-Test-Split vor der Aufbereitung passieren?

Damit keine Informationen aus den Testdaten, z.B. Mittelwerte zum Auffüllen, ins Training gelangen (Data Leakage).

Was misst Recall?

Welcher Anteil der tatsächlich positiven Fälle vom Modell gefunden wird.

Warum speichert man die ganze Pipeline und nicht nur das Modell?

Weil neue Daten genau gleich aufbereitet werden müssen wie die Trainingsdaten, sonst sind die Vorhersagen falsch.

Wie kann ein Modell diskriminieren, obwohl niemand das will?

Es übernimmt Muster aus historischen Daten, in denen bestimmte Gruppen benachteiligt wurden, auch über indirekte Merkmale wie Wohnort.

Prüfung

Stolpersteine & Prüfungstipps

Typische Stolpersteine

  • Das Modell auf den Testdaten auswerten, die auch für Tuning oder Aufbereitung verwendet wurden.
  • Nur Accuracy angeben, obwohl die Klassen stark unausgeglichen sind.
  • Direkt ein komplexes Modell nehmen, ohne eine einfache Baseline zu berechnen.
  • Echte Personendaten unbearbeitet in Google Colab oder andere Cloud-Notebooks laden.
  • Die Vorverarbeitung beim Einsatz in der API anders umsetzen als im Training.
  • Ein Modell als 'objektiv' verkaufen, weil es ein Computer berechnet.

Tipps für den Kompetenznachweis

  • Gliedere dein Notebook klar: Problem, Daten, Aufbereitung, Modelle, Bewertung, Fazit. Mit Markdown-Zellen dazwischen.
  • Erkläre jede Kennzahl in einem Satz in Alltagssprache, z.B. 'Im Schnitt liegt die Schätzung CHF 165 daneben.'
  • Setze random_state, damit deine Ergebnisse reproduzierbar sind.
  • Nenne immer auch die Grenzen deines Modells. Das zeigt Verständnis und wird bewertet.

Glossar

Begriffe kurz erklärt

Machine Learning
Verfahren, bei denen ein Programm Regeln aus Beispieldaten lernt, statt sie von Hand zu erhalten.
Feature
Eingangsmerkmal, aus dem das Modell lernt, z.B. Fläche oder Baujahr einer Wohnung.
Label
Die richtige Antwort in den Trainingsdaten, z.B. der tatsächliche Mietpreis.
Baseline
Einfachste sinnvolle Vorhersage, mit der jedes Modell verglichen wird.
Overfitting
Überanpassung an die Trainingsdaten, sodass das Modell auf neuen Daten schlecht abschneidet.
Kreuzvalidierung
Die Daten werden mehrfach unterschiedlich in Training und Test aufgeteilt, um eine stabile Bewertung zu erhalten.
Konfusionsmatrix
Tabelle, die zeigt, wie oft das Modell welche Klasse richtig oder falsch vorhergesagt hat.
Data Leakage
Informationen aus den Testdaten gelangen unbemerkt ins Training und machen die Bewertung zu optimistisch.
Bias
Systematische Verzerrung in Daten oder Modell, die zu unfairen oder falschen Ergebnissen führt.

Mit KI-Tutor

Jeder Kurs hat einen persönlichen KI-Tutor

  • Erklärt in deinem Tempo
  • Debuggt mit dir
  • Fachgespräch wie im QV
  • Unbegrenzt neue Übungen

Denkanstösse statt fertiger Lösungen. In der Gratis-Lektion zum Ausprobieren.

KI-Tutor · Modul 164Nur Tipps

Mein JOIN liefert plötzlich doppelte Zeilen. Was mache ich falsch?
Gute Frage! Schau dir die Spalte an, über die du verbindest: Ist sie in beiden Tabellen eindeutig? Was passiert mit einer Kundin, die zwei Bestellungen hat?
Ah, dann kommt sie zweimal vor …
Genau. Willst du die Bestellungen zählen oder nur die Kundinnen sehen? Je nachdem hilft dir GROUP BY oder DISTINCT.

Tutavio

So helfen wir dir bei Modul 259

  • Wir gehen mit dir dein Jupyter-Notebook Zelle für Zelle durch und finden Data Leakage, falsche Splits oder unpassende Kennzahlen.
  • Wir erklären dir Precision, Recall und Konfusionsmatrix an deinem eigenen Modell, bis du sie ohne Spickzettel interpretieren kannst.
  • Wir helfen dir, dein Modell aus dem Notebook in eine FastAPI-Anwendung mit Docker zu bringen.
  • Wir prüfen mit dir dein Projekt auf Fairness- und Datenschutzfragen und bereiten dich auf kritische Fragen in der Präsentation vor.

Unverbindlich anfragen. Wir melden uns innert 24 Stunden.

Tutor:in für Modul 259 finden

Passende Module

Diese Seite ist eine eigene Lernhilfe von Tutavio und keine offizielle Modulbeschreibung. Nummer, Titel und Einordnung stammen aus den öffentlichen Bildungsplänen. Die verbindliche Modulidentifikation findest du im Modulbaukasten von ICT-Berufsbildung Schweiz.

Gratis-LektionNachhilfe