Towards Efficient and Trustworthy Federated Learning on the Computing Continuum
Vers un Apprentissage Fédéré Efficient et Digne de Confiance sur le Continuum Numérique
Résumé
The emergence of new data privacy concerns and regulations advocates for decentralization by moving the computation at the Edge of the network, where the data is produced. Federated Learning (FL) is such a solution, running decentralized training, rather than consolidating large amounts of sensitive data on a single server, for running Machine Learning workflows. While this strategy proves effective in preserving data privacy, it also faces significant challenges in terms of practicality when deploying such FL systems at large scale on the Computing Continuum. The combination of heterogeneous, volatile, possibly defective or malicious devices greatly impacts training efficiency across decentralized environments. This thesis makes a first step towards addressing these challenges for FL on the Computing Continuum. We propose new approaches to efficiently improve the resilience of FL systems to adversarial scenarios, and enable personalized training based on client local objectives. We further investigate how different infrastructures could be used for reproducing performance of real-world FL systems, as a first step towards understanding performance of FL systems across complex environments of the Computing Continuum.
Les nouvelles réglementations pour la protection des données préconisent de passer à un modèle décentralisé plaçant les calculs à la périphérie du réseau. Suivant ce modèle, l'apprentissage fédéré (FL) exécute des tâches d'apprentissage automatique de façon décentralisée plutôt que de consolider de larges quantités de données sensibles sur un unique serveur. Alors que cette stratégie se montre efficace pour préserver la confidentialité des données, elle rencontre certaines difficultés en termes de déploiement à large échelle sur le Continuum Numérique. Les appareils hétérogènes, volatiles, défectueux ou corrompus, impactent significativement l'efficacité de l'apprentissage. Cette thèse tente d’apporter des solutions à ces problèmes pour mieux supporter le FL au travers du Continuum Numérique. Nous proposons de nouvelles approches pour améliorer la résilience des systèmes de FL lors de scénarios impliquant des pairs malveillants, et permettre un apprentissage personnalisé en fonction des objectifs locaux des différents clients. Nous allons plus loin en étudiant comment différentes infrastructures de calcul peuvent être utilisées pour reproduire la performance de systèmes réels de FL, marquant une nouvelle étape vers une meilleure compréhension des performances de ces systèmes dans des environnements complexes du Continuum Numérique.
| Origine | Version validée par le jury (STAR) |
|---|---|
| Licence |
