ROCm für Windows Schulung
ROCm ist eine quelloffene Plattform für die GPU-Programmierung, die AMD-GPUs unterstützt und zudem Kompatibilität mit CUDA und OpenCL bietet. ROCm gibt den Programmierern Einblick in die Hardwaredetails und ermöglicht volle Kontrolle über den Parallelisierungsprozess. Dies erfordert jedoch ein solides Verständnis der Gerätearchitektur, des Speichermodsells, des Ausführungsmodells sowie der Optimierungstechniken.
ROCm für Windows ist eine jüngste Entwicklung, die es Nutzern ermöglicht, ROCm unter dem weitverbreiteten Betriebssystem Windows zu installieren und zu nutzen. Dank ROCm für Windows können Anwender die Leistungsfähigkeit von AMD-GPUs in verschiedenen Anwendungsbereichen wie künstliche Intelligenz, Gaming, Grafikverarbeitung und wissenschaftliches Rechnen nutzen.
Diese instruktionsgeleitete Live-Schulung (online oder vor Ort) richtet sich an Entwicklerinnen und Entwickler der Einsteiger- bis Mittelstufe, die ROCm auf Windows installieren und nutzen möchten, um AMD-GPUs zu programmieren und deren Parallelitätsleistung auszuschöpfen.
Nach Abschluss dieser Schulung werden die Teilnehmenden in der Lage sein:
- Eine Entwicklungsumgebung einzurichten, die die ROCm-Plattform, eine AMD-GPU sowie Visual Studio Code unter Windows umfasst.
- Ein einfaches ROCm-Programm zu erstellen, das eine Vektoraddition auf der GPU ausführt und die Ergebnisse aus dem GPU-Speicher abruft.
- Die ROCm-API zur Abfrage von Geräteinformationen, zum Allokieren und Freigeben von Gerätespeicher, zum Kopieren von Daten zwischen Host und Gerät, zum Starten von Kernels sowie zum Synchronisieren von Threads zu nutzen.
- Die HIP-Sprache zur编写von Kernels zu verwenden, die auf der GPU ausgeführt werden und Daten manipulieren.
- Eingebaute Funktionen, Variablen und Bibliotheken von HIP für gängige Aufgaben und Operationen einzusetzen.
- Die Speicherbereiche von ROCm und HIP – wie global, shared, constant und local – zu nutzen, um Datenübertragungen und Speicherzugriffe zu optimieren.
- Die Ausführungsmodelle von ROCm und HIP zur Steuerung der Threads, Blöcke und Grids einzusetzen, die die Parallelität definieren.
- ROCm- und HIP-Programme mit Tools wie dem ROCm Debugger und dem ROCm Profiler zu debuggen und zu testen.
- ROCm- und HIP-Programme durch Techniken wie Coalescing, Caching, Prefetching und Profiling zu optimieren.
Kursformat
- Interaktive Vorlesungen und Diskussionen.
- Viele Übungen und praktische Anwendungen.
- Praktische Umsetzung in einer Live-Lab-Umgebung.
Optionen zur Kursanpassung
- Um eine maßgeschneiderte Schulung für diesen Kurs anzufordern, kontaktieren Sie uns bitte zur Vereinbarung.
Schulungsübersicht
Einführung
- Was ist ROCm?
- Was ist HIP?
- ROCm im Vergleich zu CUDA und OpenCL
- Übersicht über Funktionen und Architektur von ROCm und HIP
- ROCm für Windows im Vergleich zu ROCm für Linux
Installation
- Installation von ROCm unter Windows
- Überprüfung der Installation und Prüfung der Gerätekompatibilität
- Aktualisierung oder Deinstallation von ROCm unter Windows
- Lösung häufiger Installationsprobleme
Erste Schritte
- Erstellung eines neuen ROCm-Projekts mit Visual Studio Code unter Windows
- Erkundung der Projektstruktur und -dateien
- Kompilieren und Ausführen des Programms
- Anzeige der Ausgabe mittels printf und fprintf
ROCm-API
- Nutzung der ROCm-API im Host-Programm
- Abfrage von Geräteinformationen und -fähigkeiten
- Allokation und Freigabe von Gerätespeicher
- Kopieren von Daten zwischen Host und Gerät
- Starten von Kernels und Synchronisieren von Threads
- Umgang mit Fehlern und Ausnahmen
HIP-Sprache
- Nutzung der HIP-Sprache im Device-Programm
- Schreiben von Kernels, die auf der GPU ausgeführt werden und Daten manipulieren
- Nutzung von Datentypen, Qualifiern, Operatoren und Ausdrücken
- Nutzung eingebauter Funktionen, Variablen und Bibliotheken
Speichermodell von ROCm und HIP
- Nutzung verschiedener Speicherbereiche wie global, shared, constant und local
- Nutzung verschiedener Speicherobjekte wie Zeiger, Arrays, Texturen und Surfaces
- Nutzung verschiedener Speicherzugriffsmodi wie nur-lesend, nur-schreibend, lesen-schreiben usw.
- Anwendung des Speicherkonsistenzmodells und von Synchronisierungsmechanismen
Ausführungsmodell von ROCm und HIP
- Nutzung verschiedener Ausführungsmodelle wie Threads, Blöcke und Grids
- Nutzung von Thread-Funktionen wie hipThreadIdx_x, hipBlockIdx_x, hipBlockDim_x usw.
- Nutzung von Block-Funktionen wie __syncthreads, __threadfence_block usw.
- Nutzung von Grid-Funktionen wie hipGridDim_x, hipGridSync, Cooperative Groups usw.
Debugging
- Debuggen von ROCm- und HIP-Programmen unter Windows
- Nutzung des Debuggers in Visual Studio Code zum Untersuchen von Variablen, Haltepunkten, Aufrufstapel usw.
- Nutzung des ROCm Debuggers zum Debuggen von ROCm- und HIP-Programmen auf AMD-Geräten
- Nutzung des ROCm Profilers zur Analyse von ROCm- und HIP-Programmen auf AMD-Geräten
Optimierung
- Optimierung von ROCm- und HIP-Programmen unter Windows
- Anwendung von Coalescing-Techniken zur Verbesserung des Speicher-Durchsatzes
- Einsatz von Caching- und Prefetching-Techniken zur Reduzierung der Speicherlatenz
- Nutzung von Shared Memory und Local Memory zur Optimierung von Speicherzugriffen und Bandbreite
- Messung und Verbesserung der Ausführungszeit und Ressourcenauslastung durch Profiling und Profiling-Tools
Zusammenfassung und nächste Schritte
Voraussetzungen
- Grundkenntnisse in der C/C++-Sprache und Konzepten des parallelen Programmierens
- Basiswissen über Computerarchitektur und Speicherschichtung
- Erfahrung mit Befehlszeilentools und Code-Editoren
- Vertrautheit mit dem Windows-Betriebssystem und PowerShell
Zielgruppe
- Entwicklerinnen und Entwickler, die lernen möchten, wie man ROCm unter Windows installiert und nutzt, um AMD-GPUs zu programmieren und deren Parallelität auszuschöpfen.
- Entwicklerinnen und Entwickler, die hochleistungsstarke und skalierbaren Code schreiben möchten, der auf verschiedenen AMD-Geräten ausgeführt werden kann.
- Programmiererinnen und Programmierer, die die Low-Level-Aspekte der GPU-Programmierung erkunden und die Leistung ihres Codes optimieren möchten.
Offene Schulungskurse erfordern mindestens 5 Teilnehmer.
ROCm für Windows Schulung - Buchung
ROCm für Windows Schulung - Anfrage
ROCm für Windows - Beratungsanfrage
Kommende Kurse
Kombinierte Kurse
Entwicklung von KI-Anwendungen mit Huawei Ascend und CANN
21 StundenHuawei Ascend ist eine Familie von KI-Prozessoren, die für hochperformantes Inference- und Training konzipiert wurden.
Dieser instruktionsgestützte Live-Workshop (online oder vor Ort) richtet sich an KI-Ingenieure und Data Scientists auf mittlerem Niveau, die neuronale Netzwerkmodelle mit Huawei’s Ascend-Plattform und dem CANN-Toolkit entwickeln und optimieren möchten.
Nach Abschluss dieser Schulung können die Teilnehmer:
- Die CANN-Entwicklungsumgebung einrichten und konfigurieren.
- KI-Anwendungen mit MindSpore und CloudMatrix-Workflows entwickeln.
- Die Leistung auf Ascend-NPUs durch benutzerdefinierte Operatoren und Tiling optimieren.
- Modelle in Edge- oder Cloud-Umgebungen bereitstellen.
Form der Schulung
- Interaktive Vorlesungen und Diskussionen.
- Praxisnahe Verwendung von Huawei Ascend und CANN-Toolkit in Beispielanwendungen.
- Angeleitete Übungen zu Modellierung, Training und Deployment.
Optionen zur Schulungsanpassung
- Wenn Sie eine maßgeschneiderte Schulung für diesen Kurs basierend auf Ihrer Infrastruktur oder Ihren Datensätzen wünschen, kontaktieren Sie uns bitte, um dies zu arrangieren.
Bereitstellung von KI-Modellen mit CANN und Ascend AI-Prozessoren
14 StundenCANN (Compute Architecture for Neural Networks) ist der KI-Rechenstapel von Huawei zur Bereitstellung und Optimierung von KI-Modellen auf Ascend AI-Prozessoren.
Diese von Ausbildenden geleitete Live-Schulung (online oder vor Ort) richtet sich an KI-Entwickler und Ingenieure mit mittleren Kenntnissen, die trainierte KI-Modelle effizient auf Huawei Ascend-Hardware bereitstellen möchten, wobei das CANN-Toolkit sowie Tools wie MindSpore, TensorFlow oder PyTorch eingesetzt werden.
Am Ende dieser Schulung sind die Teilnehmer in der Lage:
- Die CANN-Architektur und ihre Rolle im KI-Bereitstellungsprozess zu verstehen.
- Modelle aus gängigen Frameworks in Ascend-kompatible Formate umzuwandeln und anzupassen.
- Tools wie ATC, OM-Modellkonvertierung und MindSpore für Inferenzen an der Edge und in der Cloud zu nutzen.
- Bereitstellungsprobleme zu diagnostizieren und die Leistung auf Ascend-Hardware zu optimieren.
Format des Kurses
- Interaktive Vorlesung und Demonstration.
- Praxisübungen mit CANN-Tools und Ascend-Simulatoren oder Geräten.
- Praktische Bereitstellungsszenarien basierend auf realen KI-Modellen.
Möglichkeiten zur Kursanpassung
- Um eine maßgeschneiderte Schulung für diesen Kurs anzufordern, kontaktieren Sie uns bitte zur Vereinbarung.
KI-Inferenz und -Bereitstellung mit CloudMatrix
21 StundenCloudMatrix ist Huaweis einheitliche Plattform für KI-Entwicklung und -Bereitstellung, die darauf ausgelegt ist, skalierbare Inferenz-Pipelines in Produktionsqualität zu unterstützen.
Dieses von Dozenten geleitete Live-Training (online oder vor Ort) richtet sich an KI-Fachkräfte auf Anfänger- bis fortgeschrittenem Niveau, die KI-Modelle mit der CloudMatrix-Plattform unter Integration von CANN und MindSpore bereitstellen und überwachen möchten.
Am Ende dieser Schulung sind die Teilnehmer in der Lage:
- CloudMatrix für das Verpacken, Bereitstellen und Ausliefern von Modellen zu nutzen.
- Modelle für Ascend-Chipsätze zu konvertieren und zu optimieren.
- Pipelines für Echtzeit- und Batch-Inferenz-Aufgaben einzurichten.
- Bereitstellungen zu überwachen und die Leistung in Produktionsumgebungen anzupassen.
Kursformat
- Interaktiver Vortrag und Diskussion.
- Praxisnahe Nutzung von CloudMatrix mit realen Bereitstellungszenarien.
- Angeleitete Übungen mit Schwerpunkt auf Konvertierung, Optimierung und Skalierung.
Optionen zur Kursanpassung
- Um eine maßgeschneiderte Schulung für diesen Kurs basierend auf Ihrer KI-Infrastruktur oder Cloud-Umgebung anzufordern, kontaktieren Sie uns bitte, um diese zu vereinbaren.
GPU-Programmierung auf Biren AI-Accelerators
21 StundenBiren AI-Accelerator sind Hochleistungs-GPUs, die für KI- und HPC-Anwendungen (High Performance Computing) entwickelt wurden und großes Training sowie Inferenz unterstützen.
Dieses von Dozenten geleitete Live-Training (online oder vor Ort) richtet sich an Entwickler auf fortgeschrittenem bis mittlerem Niveau, die Anwendungen mit Birens proprietärem GPU-Stack programmieren und optimieren möchten, wobei praktische Vergleiche zu CUDA-basierten Umgebungen durchgeführt werden.
Am Ende dieses Trainings werden die Teilnehmer in der Lage sein:
- Birens GPU-Architektur und Speicherhierarchie zu verstehen.
- Die Entwicklungsumgebung einzurichten und das Programmiermodell von Biren zu nutzen.
- CUDA-Code für Biren-Plattformen zu übersetzen und zu optimieren.
- Techniken zur Leistungsverbesserung und Fehlersuche anzuwenden.
Kursformat
- Interaktiver Vortrag und Diskussion.
- Praxisnahe Nutzung der Biren SDK in Beispiel-GPU-Arbeitslasten.
- Geleitete Übungen mit Fokus auf Portierung und Leistungsverbesserung.
Optionen zur Kursanpassung
- Wenn Sie ein maßgeschneidertes Training für diesen Kurs basierend auf Ihrer Anwendungspipeline oder Ihren Integrationsbedürfnissen anfordern möchten, kontaktieren Sie uns bitte zur Vereinbarung.
Cambricon MLU-Entwicklung mit BANGPy und Neuware
21 StundenDie Cambricon MLUs (Machine Learning Units) sind spezialisierte KI-Chips, die für das Inferencing und Training in Edge- und Rechenzentrums-Szenarien optimiert sind.
Dieser instruktorgeführte Live-Trainingskurs (online oder vor Ort) richtet sich an Entwickler auf fortgeschrittenem Niveau, die mit Hilfe des BANGPy-Frameworks und der Neuware SDK KI-Modelle auf Cambricon MLU-Hardware erstellen und bereitstellen möchten.
Nach Abschluss dieses Trainings werden die Teilnehmer in der Lage sein:
- Die Entwicklungsumgebungen für BANGPy und Neuware einzurichten und zu konfigurieren.
- Python- und C++-basierte Modelle für Cambricon MLUs zu entwickeln und zu optimieren.
- Modelle auf Edge- und Rechenzentrumsgeräten bereitzustellen, die den Neuware-Laufzeitumgebung ausführen.
- ML-Workflows mit MLU-spezifischen Beschleunigungsfeatures zu integrieren.
Kursformat
- Interaktive Vorträge und Diskussionen.
- Praktische Anwendung von BANGPy und Neuware für Entwicklung und Deployment.
- Geführte Übungen, die sich auf Optimierung, Integration und Tests konzentrieren.
Möglichkeiten zur Kursanpassung
- Wenn Sie eine maßgeschneiderte Schulung für diesen Kurs basierend auf Ihrem Cambricon-Gerätemodell oder Anwendungszweck anfordern möchten, kontaktieren Sie uns bitte zur Vereinbarung.
Einführung in CANN für Entwickler von KI-Frameworks
7 StundenCANN (Compute Architecture for Neural Networks) ist das KI-Computing-Toolkit von Huawei, das zur Kompilierung, Optimierung und Bereitstellung von KI-Modellen auf Ascend-KI-Prozessoren verwendet wird.
Dieses Instructor-led-Training (online oder vor Ort) richtet sich an AI-Entwickler mit Grundkenntnissen, die verstehen möchten, wie CANN in den gesamten Modelllebenszyklus von der Schulung bis zur Bereitstellung integriert ist und wie es mit Frameworks wie MindSpore, TensorFlow und PyTorch zusammenarbeitet.
Am Ende dieses Trainings sind die Teilnehmer in der Lage:
- Den Zweck und die Architektur des CANN-Toolkits zu verstehen.
- Eine Entwicklungsumgebung mit CANN und MindSpore einzurichten.
- Ein einfaches KI-Modell auf Ascend-Hardware zu konvertieren und bereitzustellen.
- Grundlegendes Wissen für künftige CANN-Optimierungs- oder Integrationsprojekte zu erwerben.
Kursformat
- Interaktive Vorlesung und Diskussion.
- Praktische Übungen mit der Bereitstellung einfacher Modelle.
- Schritt-für-Schritt-Einführung in die CANN-Toolchain und Integrationspunkte.
Optionen zur Kursanpassung
- Für eine maßgeschneiderte Schulung zu diesem Kurs kontaktieren Sie uns bitte zur Terminvereinbarung.
CANN für Edge-AI-Deployment
14 StundenDas Huawei Ascend CANN-Toolkit ermöglicht leistungsfähige KI-Inferenz auf Edge-Geräten wie dem Ascend 310. CANN stellt unverzichtbare Werkzeuge zum Kompilieren, Optimieren und Bereitstellen von Modellen bereit, wobei Rechenleistung und Speicher eingeschränkt sind.
Dieses instructor-led-Training (live, online oder vor Ort) richtet sich an KI-Entwickler und Integratoren auf fortgeschrittenem Niveau, die Modelle auf Ascend Edge-Geräten mit der CANN Toolchain bereitstellen und optimieren möchten.
Nach Abschluss dieses Trainings werden die Teilnehmer in der Lage sein:
- KI-Modelle für den Ascend 310 mit CANN-Werkzeugen vorzubereiten und zu konvertieren.
- Leichtgewichtige Inferenz-Pipelines mit MindSpore Lite und AscendCL zu entwickeln.
- Die Modellleistung für Umgebungen mit begrenzter Rechenleistung und Speicher zu optimieren.
- KI-Anwendungen in realen Edge-Szenarien bereitzustellen und zu überwachen.
Format des Kurses
- Interaktiver Vortrag und Demonstration.
- Praxisnahe Laboreinheiten mit Edge-spezifischen Modellen und Szenarien.
- Live-Bereitstellungsbeispiele auf virtueller oder physischer Edge-Hardware.
Möglichkeiten zur Anpassung des Kurses
- Für eine maßgeschneiderte Schulung zu diesem Kurs wenden Sie sich bitte an uns, um dies zu organisieren.
Verstehen von Huaweis AI-Compute-Stack: Von CANN zu MindSpore
14 StundenDer KI-Stack von Huawei – vom tiefgreifenden CANN SDK bis zum hochrangigen MindSpore Framework – bietet eine eng integrierte Entwicklungsumgebung für KI, die auf Ascend-Hardware optimiert ist.
Diese Dozenten-gestützte Live-Schulung (Online oder vor Ort) richtet sich an technische Fachkräfte vom Anfänger- bis zum Fortgeschrittenen-Level, die verstehen möchten, wie CANN und MindSpore-Komponenten zusammenarbeiten, um das KI-Lebenszyklusmanagement und Infrastrukturentscheidungen zu unterstützen.
Am Ende dieser Schulung werden die Teilnehmer in der Lage sein:
- Die Schichtenarchitektur des Huawei AI Compute Stack zu verstehen.
- Zu erkennen, wie CANN bei der Modelloptimierung und Hardware-basierten Implementierung unterstützt.
- Das MindSpore Framework und die Toolchain im Vergleich zu Branchenaltschulen bewerten.
- Den Huawei AI Stack in Unternehmens- oder Cloud/On-Prem-Umgebungen positionieren.
Kursformat
- Interaktive Vorlesungen und Diskussionen.
- Live-System-Demonstrationen und Fall-basierte Durchläufe.
- Optionale angeleitete Laborarbeiten zum Modellfluss von MindSpore zu CANN.
Anpassungsoptionen des Kurses
- Um eine maßgeschneiderte Schulung für diesen Kurs anzufordern, kontaktieren Sie uns bitte zur Vereinbarung.
Optimieren der Leistung neuronaler Netzwerke mit dem CANN SDK
14 StundenDas CANN SDK (Compute Architecture for Neural Networks) ist Huaweis KI-Berechnungsgrundlage, die es Entwicklern ermöglicht, die Leistung von eingesetzten neuronalen Netzwerken auf Ascend-KIs-Prozessoren feinzustimmen und zu optimieren.
Dieser von einem Instruktör geleitete, live veranstaltete Kurs (online oder vor Ort) richtet sich an erfahrene KI-Entwickler und Systemingenieure, die die Inferenzleistung mithilfe der erweiterten Toolset-Funktionen von CANN optimieren möchten, einschließlich Graph Engine, TIK und der Entwicklung benutzerdefinierter Operatoren.
Nach Abschluss dieses Kurses sind die Teilnehmer in der Lage:
- Die Laufzeitarchitektur und den Lebenszyklus von CANN zu verstehen.
- Profiling-Tools und die Graph Engine für Leistungsanalyse und -optimierung zu verwenden.
- Benutzerdefinierte Operatoren mit TIK und TVM zu erstellen und zu optimieren.
- Speicherengpässe zu beheben und den Modell-Durchsatz zu verbessern.
Format des Kurses
- Interaktive Vorträge und Diskussionen.
- Praxisübungen mit Echtzeit-Profiling und Operator-Tuning.
- Optimierungsübungen anhand von Beispielen für Edge-Bereitstellungen.
Möglichkeiten zur Anpassung des Kurses
- Um eine maßgeschneiderte Schulung für diesen Kurs zu erhalten, kontaktieren Sie uns bitte zur Vereinbarung.
CANN SDK für Computer Vision und NLP-Pipelines
14 StundenDas CANN SDK (Compute Architecture for Neural Networks) bietet leistungsstarke Tools zur Bereitstellung und Optimierung von Echtzeit-KI-Anwendungen im Bereich Computer Vision und NLP, insbesondere für Huawei Ascend Hardware.
Dieses Instructor-Led-Training (live, online oder vor Ort) richtet sich an fortgeschrittene KI-Experten, die Vision- und Sprachmodelle mit dem CANN SDK für produktionsreale Anwendungen entwickeln, bereitstellen und optimieren möchten.
Am Ende dieses Trainings werden die Teilnehmer in der Lage sein:
- CV- und NLP-Modelle mit CANN und AscendCL bereitzustellen und zu optimieren.
- CANN-Tools zur Modellkonvertierung zu verwenden und diese in Live-Pipelines zu integrieren.
- Die Inferenzleistung für Aufgaben wie Objekterkennung, Klassifizierung und Sentiment-Analyse zu optimieren.
- Echtzeit-CV/NLP-Pipelines für Edge- oder Cloud-basierte Bereitstellungen aufzubauen.
Kursformat
- Interaktive Vorträge und Demonstrationen.
- Praktische Laboreinheiten mit Modellsbereitstellung und Leistungsprofilierung.
- Live-Pipelinedesign anhand realer CV- und NLP-Anwendungsfälle.
Möglichkeiten zur Kursanpassung
- Um eine maßgeschneiderte Schulung für diesen Kurs anzufordern, kontaktieren Sie uns bitte zur Vereinbarung.
Erstellung benutzerdefinierter KI-Operatoren mit CANN TIK und TVM
14 StundenMit CANN TIK (Tensor Instruction Kernel) und Apache TVM lassen sich fortschrittliche Optimierungen und individuelle Anpassungen von KI-Modelloperatoren für Huawei-Ascend-Hardware durchführen.
Diese instruktionsgeleitete Live-Schulung (online oder vor Ort) richtet sich an fortgeschrittene Systementwickler, die benutzerdefinierte Operatoren für KI-Modelle mit Hilfe des TIK-Programmierungsmodells von CANN und der TVM-Compiler-Integration erstellen, bereitstellen und optimieren möchten.
Nach Abschluss dieser Schulung sind die Teilnehmenden in der Lage:
- Benutzerdefinierte KI-Operatoren mit der TIK DSL für Ascend-Prozessoren zu schreiben und zu testen.
- Benutzerdefinierte Operatoren in die CANN-Laufzeitumgebung und die Ausführungsgraphen zu integrieren.
- TVM für das Operator-Scheduling, das Auto-Tuning und die Leistungsbewertung zu nutzen.
- Den Leistungsablauf auf Befehlsebene für benutzerdefinierte Berechnungsmuster zu debuggen und zu optimieren.
Kursformat
- Interaktive Vorlesung und Demonstration.
- Praktisches Programmieren von Operatoren mit TIK- und TVM-Pipelines.
- Testen und Tuning auf Ascend-Hardware oder Simulatoren.
Optionen zur Kursanpassung
- Wenn Sie eine maßgeschneiderte Schulung für diesen Kurs wünschen, kontaktieren Sie uns bitte zur Vereinbarung.
Migration von CUDA-Anwendungen zu chinesischen GPU-Architekturen
21 StundenChinesische GPU-Architekturen wie Huawei Ascend, Biren und Cambricon MLUs bieten CUDA-Alternativen, die speziell für den lokalen KI- und HPC-Markt (High Performance Computing) entwickelt wurden.
Dieser instructor-led-Livekurs (online oder vor Ort) richtet sich an fortgeschrittene GPU-Entwickler und Infrastruktur-Spezialisten, die bestehende CUDA-Anwendungen auf chinesische Hardware-Plattformen portieren und optimieren möchten.
Nach Abschluss dieser Schulung sind die Teilnehmer in der Lage:
- Die Kompatibilität bestehender CUDA-Workloads mit alternativen chinesischen Chips zu bewerten.
- CUDA-Codebasen auf Huawei CANN, Biren SDK und Cambricon BANGPy umzustellen.
- Leistungen über verschiedene Plattformen hinweg zu vergleichen und Optimierungspotenziale zu identifizieren.
- Praktische Herausforderungen bei der Querschnitts-Architektur-Unterstützung und -Bereitstellung zu bewältigen.
Kursformat
- Interaktive Vorträge und Diskussionen.
- Praktische Laborarbeiten zum Übersetzen von Code und zum Leistungsvergleich.
- Geführte Übungen, die auf Mehr-GPU-Adaptionsstrategien fokussiert sind.
Möglichkeiten zur Kursspezifischen Anpassung
- Um eine maßgeschneiderte Schulung für diesen Kurs basierend auf Ihrer Plattform oder Ihrem CUDA-Projekt anzufordern, kontaktieren Sie uns bitte zur Organisation.
Leistungsoptimierung auf Ascend, Biren und Cambricon
21 StundenAscend, Biren und Cambricon gehören zu den führenden KI-Hardwareplattformen in China und bieten jeweils einzigartige Beschleunigungs- und Profiling-Tools für KI-Arbeitslasten im Produktionsmaßstab an.
Dieser instruktorgeleitete Live-Kurs (online oder vor Ort) richtet sich an erfahrene Ingenieurinnen und Ingenieure der KI-Infrastruktur und Performance, die ihre Workflows für das Inferencing und Training von Modellen über mehrere chinesische KI-Chipplattformen hinweg optimieren möchten.
Nach Abschluss dieses Kurses werden die Teilnehmenden in der Lage sein:
- Modelle auf den Plattformen Ascend, Biren und Cambricon zu benchmarken.
- Systemengpässe sowie Ineffizienzen bei Speicher und Rechenleistung zu identifizieren.
- Optimierungen auf Graph-, Kernel- und Operator-Ebene anzuwenden.
- Bereitstellungs-Pipelines so abzustimmen, dass Durchsatz und Latenz verbessert werden.
Kursformat
- Interaktive Vorträge und Diskussionen.
- Praktischer Einsatz von Profiling- und Optimierungstools auf jeder Plattform.
- Geführte Übungen, die auf praktischen Abstimmungsszenarien basieren.
Optionen zur Kursanpassung
- Um einen maßgeschneiderten Kurs für Ihre Leistungsdatenbank oder Modelltyp anzufordern, kontaktieren Sie uns bitte zur Vereinbarung.