Analyseworkspace für große Datenmengen benötigt? Synapse-Workspace erstellen

Veröffentlicht am:

Ein Team sammelt Verkaufsdateien aus vielen Systemen. Analysten benötigen Summen über diese Dateien, während Engineers Daten aufbereiten und die Verarbeitung koordinieren. Azure Synapse Analytics verbindet SQL-Abfragen, Spark-Verarbeitung und Datenpipelines in einem Workspace. Diese kleine Übung fragt mit dem integrierten serverlosen SQL-Pool eine Datei direkt im Speicher ab; derselbe Ansatz kann größere Dateisammlungen auswerten.

Data Factory, Stream Analytics und Synapse

Data Factory Stream Analytics Synapse Analytics
Hauptaufgabe Daten in Workflows verschieben und transformieren Eingehende Ereignisse kontinuierlich verarbeiten Große Datenmengen mit SQL und Spark abfragen und analysieren
Typische Aufgabe Tägliche Verkaufsdateien kopieren, bereinigen und in eine Datenbank laden Temperaturwerte über 30°C beim Eintreffen erkennen Verkaufssummen über Tausende Dateien berechnen
Ausführung Eine Pipeline startet, führt Schritte aus und endet Ein Job läuft fortlaufend und verarbeitet Ereignisse Abfragen, Verarbeitungsjobs und Pipelines laufen nach Bedarf
Deine Übung sales.csv kopieren und filtern Temperaturnachrichten filtern sales.csv direkt im Speicher abfragen

Die Funktionen überschneiden sich: Synapse enthält Datenpipelines auf Basis der Data-Factory-Technologie sowie SQL- und Spark-Funktionen.

Die Dienste können auch zusammenarbeiten: Data Factory sammelt historische Dateien; Stream Analytics verarbeitet Live-Ereignisse; Synapse analysiert die gespeicherten Ergebnisse.

Workspace erstellen

Öffne im Azure-Portal Azure Synapse Analytics → Create:

Resource group: rg-cloudtrips-synapse-test-weu
Managed resource group: leer lassen
Workspace name: syn-ctappweu
Region: West Europe
Data Lake Storage Gen2 account → Create new: stctsynapseweu
File system → Create new: workspace
Assign myself Storage Blob Data Contributor: Checked

Passe global eindeutige Namen bei Bedarf an. Das Dateisystem ist ein Speichercontainer. Data Lake Storage Gen2 ergänzt Blob Storage um eine hierarchische Ordnerstruktur für Analyseaufgaben.

Verwende unter Security den SQL-Administrator ctadmin und speichere dein gewähltes Passwort sicher, falls diese Angaben verlangt werden. Lasse unter Networking das verwaltete virtuelle Netzwerk für diese Übung deaktiviert, aktiviere öffentlichen Zugriff und erlaube deine aktuelle Client-IP. Richte Git später ein. Prüfe die Angaben und erstelle den Workspace.

Öffne nach der Bereitstellung Overview → Open Synapse Studio. Suche unter Manage → SQL pools nach Built-in.

Synapse Studio SQL pools mit dem serverlosen SQL-Pool Built-in

Built-in ist für Abfragen bereit und wird nach verarbeiteter Datenmenge abgerechnet. Verwende ihn für diese Übung; dedizierte SQL-Pools und Spark-Pools sind zusätzliche Rechenoptionen.

Beispieldatei hochladen

Prüfe unter stctsynapseweu → Access control (IAM) die Rolle Storage Blob Data Contributor für deinen Benutzer und die verwaltete Workspace-Identität syn-ctappweu. Ergänze fehlende Zuweisungen und warte einige Minuten auf ihre Wirksamkeit. Die Abfrage liest die Datei mit deiner angemeldeten Identität.

Speichere dies als sales.csv oder verwende dieselbe Datei aus dem ADF-Trip:

order_id,product,amount
1,Notebook,12.50
2,Pen,2.00

Öffne in Synapse Studio Data → Linked → Azure Data Lake Storage Gen2 → dein primärer Speicher → workspace. Lade sales.csv direkt in diesen Container hoch.

Synapse Studio Data hub mit sales.csv im Speichercontainer workspace

Prüfe den Dateinamen sales.csv im Stammverzeichnis des Containers. Die Datei enthält die beiden Verkaufsdatensätze für die SQL-Abfrage.

Datei abfragen

Öffne Develop → + → SQL script. Vergib den Namen sales-summary, wähle Connect to: Built-in und Use database: master und verwende dein angemeldetes Microsoft-Entra-Konto. Führe diese Abfrage aus; passe den Speichernamen an, falls du ihn geändert hast:

SELECT COUNT(*) AS SaleCount,
       SUM(amount) AS TotalAmount
FROM OPENROWSET(
    BULK 'https://stctsynapseweu.dfs.core.windows.net/workspace/sales.csv',
    FORMAT = 'CSV',
    PARSER_VERSION = '2.0',
    FIRSTROW = 2
)
WITH (
    order_id int,
    product varchar(100),
    amount decimal(10,2)
) AS sales;

Synapse-SQL-Ergebnis mit SaleCount 2 und TotalAmount 14.50

Erwarte SaleCount = 2 und TotalAmount = 14.50. OPENROWSET liest die Datei, FIRSTROW = 2 überspringt die Kopfzeile und WITH definiert die Spaltentypen. SQL summiert die Beträge direkt aus dem Speicher. Wähle Publish all, um das Skript im Workspace zu speichern.

Falls der SQL-Endpunkt die Verbindung blockiert, öffne Networking am Workspace im Azure-Portal, füge deine aktuelle Client-IP hinzu und speichere. Bei einem Speicherzugriffsfehler prüfe die Blob-Datenrolle deines Benutzers und den Dateipfad.

Abschließen

Serverlose Abfragen verursachen Kosten nach verarbeiteter Datenmenge, einschließlich einer Mindestabrechnungsmenge pro Abfrage; Speicher verursacht separate Kosten. Behalte den Workspace für weitere Übungen oder lösche rg-cloudtrips-synapse-test-weu, um Workspace und Speicher zu entfernen.