PySpark-Confluent-Kafka-Apache-Drill-
A code-based tutorial for production level data streaming with PySpark plus Optimus for data cleaning, Confluent Kafka, & Apache Drill using Docker and Cassandra (NoSQL DB) for storage; This allows for for fast feature engineering and data cleaning.
// repository documentation
Was this content helpful?
(0 ratings)
