Thank you for sending your enquiry! One of our team members will contact you shortly.
Thank you for sending your booking! One of our team members will contact you shortly.
Duration 21 hours (3 days)
Course Outline
Foundations of Audio Classification
- Categories of sound events: environmental, mechanical, and human-generated
- Overview of practical applications: surveillance, monitoring, and automation
- Distinguishing between audio classification, detection, and segmentation
Audio Data and Feature Extraction
- Varieties of audio files and supported formats
- Considerations regarding sampling rate, windowing, and frame size
- Extraction of MFCCs, chroma features, and mel-spectrograms
Data Preparation and Annotation
- Utilizing datasets such as UrbanSound8K, ESC-50, and proprietary collections
- Annotating sound events and defining temporal boundaries
- Techniques for balancing datasets and augmenting audio inputs
Building Audio Classification Models
- Application of convolutional neural networks (CNNs) for audio tasks
- Evaluating model inputs: raw waveforms versus extracted features
- Selection of loss functions, evaluation metrics, and management of overfitting
Event Detection and Temporal Localization
- Strategies for frame-based and segment-based detection
- Refining detections through thresholds and smoothing algorithms
- Visualizing predictions along audio timelines
Advanced Topics and Real-Time Processing
- Applying transfer learning in low-data environments
- Model deployment using TensorFlow Lite or ONNX
- Handling streaming audio processing and latency optimizations
Project Development and Application Scenarios
- Designing an end-to-end pipeline from ingestion to classification
- Creating proof-of-concept solutions for surveillance, quality control, or monitoring
- Implementing logging, alerting, and integration with dashboards or APIs
Summary and Next Steps
Requirements
- A solid grasp of machine learning concepts and model training processes
- Proficiency in Python programming and data preprocessing techniques
- Knowledge of digital audio fundamentals
Target Audience
- Data scientists
- Machine learning engineers
- Researchers and developers specializing in audio signal processing