Data Science
Artificial Intelligence
Wie wir Bert skaliert haben, um täglich über 1 Milliarde Anfragen auf der CPU zu bedienen
Author
Venue
Data + AI Summit 2021
Abstract
Maschinelles Lernen ist ein wesentlicher Bestandteil unserer Fähigkeit, wichtige Dienste für unsere riesige Community zu skalieren. In diesem Vortrag berichten wir über unseren Weg zur Skalierung unserer Deep-Learning-Textklassifikatoren, um mehr als 50.000 Anfragen pro Sekunde bei Latenzen unter 20 ms zu verarbeiten. Wir werden erläutern, wie es uns gelungen ist, BERT nicht nur schnell genug für unsere Nutzer zu machen, sondern auch wirtschaftlich genug, um es in der Produktion zu überschaubaren Kosten auf der CPU auszuführen.
