商品簡介
Les technologies de traitement par lots (telles que MapReduce, Hive, Pig) sont arriv嶪s ?maturit?et ont 彋?largement utilis嶪s dans l'industrie. Ces syst鋗es ont permis de r廥oudre avec succ鋊 le probl鋗e du traitement de gros volumes de donn嶪s. Cependant, de grandes quantit廥 de donn嶪s doivent d'abord 皻re collect嶪s et stock嶪s dans une base de donn嶪s ou un syst鋗e de fichiers. Cela prend beaucoup de temps. Ensuite, il faut du temps pour terminer les t歊hes d'analyse de traitement par lots avant d'obtenir des r廥ultats. Dans de nombreux cas, il est n嶰essaire d'analyser les r廥ultats d'une s廦uence illimit嶪 de donn嶪s en quelques secondes ou sous-secondes. Pour r廧ondre ?la demande croissante de traitement de ces donn嶪s en continu, plusieurs syst鋗es de traitement en continu sont mis en oeuvre et largement adopt廥, tels que Apache Storm, Apache Spark, IBM InfoSphere Streams et Apache Flink. La question de savoir comment 憝aluer les syst鋗es de traitement en continu avant d'en choisir un pour le d憝eloppement de la production reste ouverte. Dans ce livre, nous pr廥entons StreamBench, un cadre de r嶨廨ence pour faciliter les comparaisons de performance des syst鋗es de traitement de flux. L'une des principales caract廨istiques du cadre StreamBench est qu'il est extensible - il permet de d嶨inir facilement de nouvelles charges de travail, tout en facilitant l'憝aluation comparative de nouveaux syst鋗es de traitement de flux.