Data Science
Artificial Intelligence
Hoe we Bert hebben geschaald om dagelijks meer dan 1 miljard verzoeken op de CPU te verwerken
Author
Venue
Data + AI Summit 2021
Abstract
Machine learning is een essentieel onderdeel van ons vermogen om belangrijke diensten op te schalen voor onze enorme community. In deze presentatie delen we ons traject om onze deep learning-tekstclassificatoren op te schalen tot meer dan 50.000 verzoeken per seconde met een latentie van minder dan 20 ms. We zullen uitleggen hoe we BERT niet alleen snel genoeg hebben kunnen maken voor onze gebruikers, maar ook economisch genoeg om in productie te draaien tegen beheersbare kosten op de CPU.
