{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,6]],"date-time":"2026-07-06T03:53:33Z","timestamp":1783310013566,"version":"3.54.6"},"reference-count":240,"publisher":"Institute of Electrical and Electronics Engineers (IEEE)","license":[{"start":{"date-parts":[[2020,1,1]],"date-time":"2020-01-01T00:00:00Z","timestamp":1577836800000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/ieeexplore.ieee.org\/Xplorehelp\/downloads\/license-information\/IEEE.html"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["IEEE Trans. Knowl. Data Eng."],"published-print":{"date-parts":[[2020]]},"DOI":"10.1109\/tkde.2020.3015777","type":"journal-article","created":{"date-parts":[[2020,8,11]],"date-time":"2020-08-11T22:22:48Z","timestamp":1597184568000},"page":"1-1","source":"Crossref","is-referenced-by-count":97,"title":["A Survey on Large-Scale Machine Learning"],"prefix":"10.1109","author":[{"given":"Meng","family":"Wang","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Weijie","family":"Fu","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Xiangnan","family":"He","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Shijie","family":"Hao","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Xindong","family":"Wu","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"263","reference":[{"key":"ref1","article-title":"Baidu-allreduce","year":"2017"},{"key":"ref2","article-title":"Multi-worker mirrored strategy","year":"2020"},{"key":"ref3","article-title":"Parallel learning of lightgbm","year":"2020"},{"key":"ref4","article-title":"Torch.distributed","year":"2020"},{"key":"ref5","first-page":"265","article-title":"Tensorflow: A system for large-scale machine learning","volume-title":"Proc. 12th USENIX Conf. Operating Syst. Des. Implementation","author":"Abadi"},{"key":"ref6","first-page":"78","article-title":"A lower bound for the optimization of finite sums","volume-title":"Proc. 32nd Int. Conf. Mach. Learn.","author":"Agarwal"},{"key":"ref7","doi-asserted-by":"publisher","DOI":"10.1109\/CDC.2012.6426626"},{"key":"ref8","first-page":"7575","article-title":"cpSGD: Communication-efficient and differentially-private distributed SGD","volume-title":"Proc. 32nd Int. Conf. Neural Inf. Process. Syst.","author":"Agarwal"},{"key":"ref9","doi-asserted-by":"publisher","DOI":"10.1145\/2783258.2783373"},{"key":"ref10","first-page":"1591","article-title":"Bayesian posterior sampling via stochastic gradient fisher scoring","author":"Ahn","year":"2012","journal-title":"Proc. 29th Int. Conf. Mach. Learn."},{"key":"ref11","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2013.146"},{"key":"ref12","doi-asserted-by":"publisher","DOI":"10.1016\/j.bdr.2015.04.001"},{"key":"ref13","article-title":"Variance reduction in SGD by distributed importance sampling","author":"Alain","year":"2015"},{"key":"ref14","first-page":"1709","article-title":"QSGD: Communication-efficient SGD via gradient quantization and encoding","volume-title":"Proc. 31st Conf. Neural Inf. Process. Syst.","author":"Alistarh"},{"key":"ref15","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2014.79"},{"key":"ref16","first-page":"1756","article-title":"Communication complexity of distributed convex learning and optimization","volume-title":"Proc. 28th Int. Conf. Neural Inf. Process. Syst.","author":"Arjevani"},{"key":"ref17","doi-asserted-by":"publisher","DOI":"10.1109\/ACII.2015.7344554"},{"key":"ref18","doi-asserted-by":"publisher","DOI":"10.1145\/3038912.3052694"},{"key":"ref19","doi-asserted-by":"publisher","DOI":"10.1137\/080716542"},{"key":"ref20","first-page":"541","article-title":"To understand deep learning we need to understand kernel learning","author":"Belkin","year":"2018","journal-title":"Proc. 35th Int. Conf. Mach. Learn."},{"issue":"2","key":"ref21","first-page":"849","article-title":"A streaming parallel decision tree algorithm","volume":"11","author":"Ben-Haim","year":"2010","journal-title":"J. Mach. Learn. Res."},{"key":"ref22","first-page":"163","article-title":"Label embedding trees for large multi-class tasks","volume-title":"Proc. 23rd Int. Conf. Neural Inf. Process. Syst.","author":"Bengio"},{"key":"ref23","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-642-35289-8_26"},{"key":"ref24","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2013.50"},{"key":"ref25","first-page":"1","article-title":"Theano: Deep learning on GPUs with python","volume-title":"Proc. Conf. Neural Inf. Process. Syst.","author":"Bergstra"},{"key":"ref26","doi-asserted-by":"publisher","DOI":"10.1038\/nature23474"},{"key":"ref27","doi-asserted-by":"publisher","DOI":"10.1162\/jmlr.2003.3.4-5.993"},{"key":"ref28","doi-asserted-by":"publisher","DOI":"10.14778\/3007263.3007279"},{"key":"ref29","doi-asserted-by":"publisher","DOI":"10.14778\/2732286.2732292"},{"key":"ref30","article-title":"Towards federated learning at scale: System design","author":"Bonawitz","year":"2019"},{"key":"ref31","doi-asserted-by":"publisher","DOI":"10.1145\/3133956.3133982"},{"key":"ref32","first-page":"161","article-title":"The tradeoffs of large scale learning","volume-title":"Proc. 20th Int. Conf. Neural Inf. Process. Syst.","author":"Bottou"},{"key":"ref33","doi-asserted-by":"publisher","DOI":"10.1137\/16M1080173"},{"key":"ref34","first-page":"2313","article-title":"Sampling with minimum sum of squared similarities for nystrom-based large scale spectral clustering","volume-title":"Proc. 24th Int. Conf. Artif. Intell.","author":"Bouneffouf"},{"key":"ref35","doi-asserted-by":"publisher","DOI":"10.1561\/2200000016"},{"key":"ref36","doi-asserted-by":"publisher","DOI":"10.1023\/A:I0I0933404324"},{"key":"ref37","article-title":"Large scale GAN training for high fidelity natural image synthesis","author":"Brock","year":"2018"},{"key":"ref38","doi-asserted-by":"publisher","DOI":"10.1137\/140954362"},{"key":"ref39","doi-asserted-by":"publisher","DOI":"10.1145\/2588555.2593680"},{"key":"ref40","first-page":"688","article-title":"Improved large-scale graph learning through ridge spectral sparsification","volume-title":"Proc. 35th Int. Conf. Mach. Learn.","author":"Calandriello"},{"key":"ref41","first-page":"1369","article-title":"Coordinate descent method for large-scale l2-loss linear support vector machines","volume":"9","author":"Chang","year":"2008","journal-title":"J. Mach. Learn. Res."},{"key":"ref42","article-title":"Slide: In defense of smart algorithms over hardware acceleration for large-scale deep learning systems","author":"Chen","year":"2019"},{"key":"ref43","first-page":"1051","article-title":"Bridging the gap between stochastic gradient MCMC and stochastic optimization","volume-title":"Proc. Int. Conf. Artif. Intell. Statist.","author":"Chen"},{"key":"ref44","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR42600.2020.00154"},{"issue":"5","key":"ref45","first-page":"1989","article-title":"Fast approximate kNN graph construction for high dimensional data via recursive lanczos bisection","volume":"10","author":"Chen","year":"2009","journal-title":"J. Mach. Learn. Res."},{"key":"ref46","doi-asserted-by":"publisher","DOI":"10.1145\/3230543.3230551"},{"key":"ref47","doi-asserted-by":"publisher","DOI":"10.1007\/s11036-013-0489-0"},{"key":"ref48","doi-asserted-by":"publisher","DOI":"10.1145\/3298989"},{"key":"ref49","first-page":"6571","article-title":"Neural ordinary differential equations","volume-title":"Proc. Conf. Neural Inf. Process. Syst.","author":"Chen"},{"key":"ref50","article-title":"Rabit: A reliable allreduce and broadcast interface","author":"Chen"},{"key":"ref51","first-page":"1683","article-title":"Stochastic gradient hamiltonian monte carlo","volume-title":"Proc. 31st Int. Conf. Mach. Learn.","author":"Chen"},{"key":"ref52","doi-asserted-by":"publisher","DOI":"10.1145\/2939672.2939785"},{"key":"ref53","article-title":"MXNet: A flexible and efficient machine learning library for heterogeneous distributed systems","author":"Chen","year":"2015"},{"key":"ref54","doi-asserted-by":"publisher","DOI":"10.1109\/ACCESS.2014.2325029"},{"key":"ref55","doi-asserted-by":"publisher","DOI":"10.1109\/MSP.2017.2765695"},{"key":"ref56","doi-asserted-by":"publisher","DOI":"10.1145\/2939672.2939826"},{"key":"ref57","doi-asserted-by":"publisher","DOI":"10.1080\/00031305.1995.10476177"},{"key":"ref58","doi-asserted-by":"publisher","DOI":"10.1145\/2668133"},{"key":"ref59","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2017.89"},{"key":"ref60","doi-asserted-by":"publisher","DOI":"10.1002\/cpa.20042"},{"key":"ref61","first-page":"1504","article-title":"Equilibrated adaptive learning rates for non-convex optimization","volume-title":"Proc. Conf. Neural Inf. Process. Syst.","author":"Dauphin"},{"key":"ref62","first-page":"1223","article-title":"Large scale distributed deep networks","volume-title":"Proc. 25th Int. Conf. Neural Inf. Process. Syst.","author":"Dean"},{"key":"ref63","doi-asserted-by":"publisher","DOI":"10.1145\/1327452.1327492"},{"key":"ref64","first-page":"1646","article-title":"SAGA: A fast incremental gradient method with support for non-strongly convex composite objectives","volume-title":"Proc. Int. Conf. Neural Inf. Process. Syst.","author":"Defazio"},{"key":"ref65","first-page":"567","article-title":"Fast and balanced: Efficient label tree learning for large scale object recognition","volume-title":"Proc. 25th Annu. Conf. Neural Inf. Process. Syst.","author":"Deng"},{"key":"ref66","doi-asserted-by":"publisher","DOI":"10.1017\/atsip.2013.9"},{"key":"ref67","first-page":"2160","article-title":"Nearest neighbor based greedy coordinate descent","volume-title":"Proc. 24th Int. Conf. Neural Inf. Process. Syst.","author":"Dhillon"},{"key":"ref68","article-title":"Incorporating nesterov momentum into adam","author":"Dozat"},{"issue":"Jul","key":"ref69","first-page":"2121","article-title":"Adaptive subgradient methods for online learning and stochastic optimization","volume":"12","author":"Duchi","year":"2011","journal-title":"J. Mach. Learn. Res."},{"key":"ref70","volume-title":"Pattern Classification","author":"Duda","year":"2012"},{"key":"ref71","first-page":"250","article-title":"Snap ML: A hierarchical framework for machine learning","volume-title":"Proc. 32nd Conf. Neural Inf. Process. Syst.","author":"D\u00fcnner"},{"key":"ref72","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-319-10605-2"},{"key":"ref73","first-page":"269","article-title":"A novel greedy algorithm for nystr\u00f6m approximation","volume-title":"Proc. 14th Int. Conf. Artif. Intell. Statist.","author":"Farahat"},{"key":"ref74","doi-asserted-by":"publisher","DOI":"10.1145\/1058129.1058148"},{"key":"ref75","doi-asserted-by":"publisher","DOI":"10.1214\/aos\/1016218223"},{"key":"ref76","doi-asserted-by":"publisher","DOI":"10.1016\/S0167-9473(01)00065-2"},{"key":"ref77","doi-asserted-by":"publisher","DOI":"10.1109\/TBDATA.2017.2757522"},{"key":"ref78","doi-asserted-by":"publisher","DOI":"10.1145\/3219819.3219954"},{"key":"ref79","first-page":"784","article-title":"Efficient label propagation","volume-title":"Proc. 31st Int. Conf. Mach. Learn.","author":"Fujiwara"},{"key":"ref80","first-page":"2142","article-title":"Optimal mini-batch and step sizes for saga","author":"Gazagnadou","year":"2019","journal-title":"Proc. 36th Int. Conf. Mach. Learn."},{"key":"ref81","doi-asserted-by":"publisher","DOI":"10.1162\/089976602753633411"},{"key":"ref82","first-page":"11","article-title":"Local machine learning models for spatial data analysis","volume":"4","author":"Gilardi","year":"2000","journal-title":"J. Geographic Inf. Decis. Anal."},{"issue":"1","key":"ref83","first-page":"3977","article-title":"Revisiting the nystr\u00f6m method for improved large-scale machine learning","volume":"17","author":"Gittens","year":"2016","journal-title":"J. Mach. Learn. Res."},{"key":"ref84","article-title":"Powergraph: Distributed graph-parallel computation on natural graphs","volume-title":"Proc. 10th USENIX Conf. Operating Syst. Des. Implementation","author":"Gonzalez"},{"key":"ref85","first-page":"599","article-title":"Graphx: Graph processing in a distributed dataflow framework","volume-title":"Proc. 11th USENIX Conf. Operating Syst. Des. Implementation","author":"Gonzalez"},{"key":"ref86","first-page":"364","article-title":"Adaptive sampling for SGD by exploiting side information","volume-title":"Proc. 33rd Int. Conf. Mach. Learn.","author":"Gopal"},{"key":"ref87","article-title":"Accurate, large minibatch SGD: Training imagenet in 1 hour","author":"Goyal","year":"2017"},{"key":"ref88","first-page":"1302","article-title":"Efficient softmax approximation for GPUs","volume-title":"Proc. 34th Int. Conf. Mach. Learn.","author":"Grave"},{"key":"ref89","doi-asserted-by":"publisher","DOI":"10.1073\/pnas.0307752101"},{"key":"ref90","doi-asserted-by":"publisher","DOI":"10.1137\/090771806"},{"issue":"1","key":"ref91","first-page":"1319","article-title":"The optimal sample complexity of PAC learning","volume":"17","author":"Hanneke","year":"2016","journal-title":"J. Mach. Learn. Res."},{"key":"ref92","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2015.7299173"},{"key":"ref93","doi-asserted-by":"publisher","DOI":"10.1109\/TNNLS.2018.2890117"},{"key":"ref94","doi-asserted-by":"publisher","DOI":"10.1137\/1.9780898718027"},{"key":"ref95","doi-asserted-by":"publisher","DOI":"10.1145\/2692916.2558890"},{"key":"ref96","first-page":"1223","article-title":"More effective distributed ML via a stale synchronous parallel parameter server","volume-title":"Proc. 26th Int. Conf. Neural Inf. Process. Syst.","author":"Ho"},{"key":"ref97","article-title":"Mobilenets: Efficient convolutional neural networks for mobile vision applications","author":"Howard","year":"2017"},{"key":"ref98","doi-asserted-by":"publisher","DOI":"10.1145\/1390156.1390208"},{"key":"ref99","first-page":"993","article-title":"Shark","volume":"9","author":"Igel","year":"2008","journal-title":"J. Mach. Learn. Res."},{"key":"ref100","doi-asserted-by":"publisher","DOI":"10.1145\/3077136.3084135"},{"key":"ref101","first-page":"3068","article-title":"Communication-efficient distributed dual coordinate ascent","volume-title":"Proc. 27th Int. Conf. Neural Inf. Process. Syst.","author":"Jaggi"},{"key":"ref102","article-title":"Nccl 2.0","author":"Jeaugey","year":"2017"},{"key":"ref103","doi-asserted-by":"publisher","DOI":"10.1145\/2647868.2654889"},{"key":"ref104","doi-asserted-by":"publisher","DOI":"10.1145\/3183713.3196892"},{"key":"ref105","doi-asserted-by":"publisher","DOI":"10.1145\/3183713.3196894"},{"key":"ref106","doi-asserted-by":"publisher","DOI":"10.1093\/nsr\/nwx018"},{"key":"ref107","doi-asserted-by":"publisher","DOI":"10.1145\/1150402.1150429"},{"key":"ref108","doi-asserted-by":"publisher","DOI":"10.5555\/2999611.2999647"},{"key":"ref109","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2012.21"},{"key":"ref110","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2014.298"},{"key":"ref111","doi-asserted-by":"publisher","DOI":"10.1109\/TKDE.2017.2762294"},{"key":"ref112","first-page":"3146","article-title":"Lightgbm: A highly efficient gradient boosting decision tree","volume-title":"Proc. 31st Int. Conf. Neural Inf. Process. Syst.","author":"Ke"},{"key":"ref113","doi-asserted-by":"publisher","DOI":"10.1007\/978-1-4842-2766-4"},{"key":"ref114","first-page":"1449","article-title":"How do humans teach: On curriculum learning and teaching dimension","volume-title":"Proc. 24th Int. Conf. Neural Inf. Process. Syst.","author":"Khan"},{"key":"ref115","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2017.320"},{"key":"ref116","article-title":"Adam: A method for stochastic optimization","author":"Kingma","year":"2014"},{"key":"ref117","doi-asserted-by":"publisher","DOI":"10.5555\/2999134.2999257"},{"key":"ref118","first-page":"981","article-title":"Sampling methods for the nystr\u00f6m method","volume":"13","author":"Kumar","year":"2012","journal-title":"J. Mach. Learn. Res."},{"key":"ref119","doi-asserted-by":"publisher","DOI":"10.21236\/ada603410"},{"key":"ref120","doi-asserted-by":"publisher","DOI":"10.1186\/s40537-015-0032-1"},{"key":"ref121","first-page":"2331","article-title":"Slow learners are fast","author":"Langford","journal-title":"Proc. 22nd Int. Conf. Neural Inf. Process. Syst."},{"key":"ref122","first-page":"265","article-title":"On optimization methods for deep learning","volume-title":"Proc. 28th Int. Conf. Mach. Learn.","author":"Le"},{"key":"ref123","doi-asserted-by":"publisher","DOI":"10.1038\/natureI4539"},{"key":"ref124","doi-asserted-by":"publisher","DOI":"10.1109\/FOCS.2013.24"},{"key":"ref125","first-page":"379","article-title":"Accelerated proximal gradient methods for nonconvex programming","volume-title":"Proc. 28th Int. Conf. Neural Inf. Process. Syst.","author":"Li"},{"key":"ref126","doi-asserted-by":"publisher","DOI":"10.5555\/2685048.2685095"},{"key":"ref127","article-title":"Fast parallel machine learning algorithms for large datasets using graphic processing unit","author":"Li","year":"2011"},{"key":"ref128","doi-asserted-by":"publisher","DOI":"10.1016\/j.neucom.2016.08.037"},{"key":"ref129","first-page":"3059","article-title":"An accelerated proximal coordinate gradient method","volume-title":"Proc. 27th Int. Conf. Neural Inf. Process. Syst.","author":"Lin"},{"key":"ref130","article-title":"Deep gradient compression: Reducing the communication bandwidth for distributed training","author":"Lin","year":"2017"},{"key":"ref131","first-page":"469","article-title":"An asynchronous parallel stochastic coordinate descent algorithm","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Liu"},{"key":"ref132","first-page":"679","article-title":"Large graph construction for scalable semi-supervised learning","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Liu"},{"key":"ref133","doi-asserted-by":"publisher","DOI":"10.14778\/2212351.2212354"},{"issue":"1","key":"ref134","first-page":"1613","article-title":"Large scale online kernel learning","volume":"17","author":"Lu","year":"2016","journal-title":"J. Mach. Learn. Res."},{"key":"ref135","first-page":"3778","article-title":"Diving into the shallows: A computational perspective on large-scale shallow learning","volume-title":"Proc. 31st Int. Conf. Neural Inf. Process. Syst.","author":"Ma"},{"key":"ref136","first-page":"2917","article-title":"A complete recipe for stochastic gradient MCMC","volume-title":"Proc. 28th Int. Conf. Neural Inf. Process. Syst.","author":"Ma"},{"key":"ref137","article-title":"Rectifier nonlinearities improve neural network acoustic models","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Maas"},{"key":"ref138","doi-asserted-by":"publisher","DOI":"10.1145\/1807167.1807184"},{"key":"ref139","doi-asserted-by":"publisher","DOI":"10.1016\/j.acha.2010.02.003"},{"key":"ref140","first-page":"2915","article-title":"Delay-tolerant algorithms for asynchronous distributed online learning","volume-title":"Proc. 27th Int. Conf. Neural Inf. Process. Syst.","author":"McMahan"},{"key":"ref141","first-page":"1603","article-title":"Gated softmax classification","volume-title":"Proc. Int. Conf. Neural Inf. Process. Syst.","author":"Memisevic"},{"issue":"34","key":"ref142","first-page":"1","article-title":"MLlib: Machine learning in apache spark","volume":"17","author":"Meng","year":"2016","journal-title":"J. Mach. Learn. Res."},{"key":"ref143","first-page":"3111","article-title":"Distributed representations of words and phrases and their compositionality","volume-title":"Proc. 26th Int. Conf. Neural Inf. Process. Syst.","author":"Mikolov"},{"key":"ref144","first-page":"46","article-title":"Hierarchical probabilistic neural network language model","volume-title":"Proc. Int. Conf. Artif. Intell. Statist.","author":"Morin"},{"key":"ref145","first-page":"561","article-title":"Ray: A distributed framework for emerging AI applications","volume-title":"Proc. 13th USENIX Conf. Operating Syst. Des. Implementation","author":"Moritz"},{"key":"ref146","volume-title":"Machine Learning: A Probabilistic Perspective","author":"Murphy","year":"2012"},{"key":"ref147","doi-asserted-by":"publisher","DOI":"10.1162\/jocn_a_00643"},{"key":"ref148","first-page":"9018","article-title":"Efficient high dimensional bayesian optimization with additivity and quadrature fourier features","volume-title":"Proc. 32nd Int. Conf. Neural Inf. Process. Syst.","author":"Mutny"},{"key":"ref149","doi-asserted-by":"publisher","DOI":"10.5555\/3104322.3104425"},{"key":"ref150","doi-asserted-by":"publisher","DOI":"10.1201\/b10905-6"},{"key":"ref151","doi-asserted-by":"publisher","DOI":"10.1137\/100802001"},{"key":"ref152","doi-asserted-by":"publisher","DOI":"10.1007\/s10107-012-0629-5"},{"key":"ref153","first-page":"1632","article-title":"Coordinate descent converges faster with the gauss-southwell rule than random selection","volume-title":"Proc. 32nd Int. Conf. Mach. Learn.","author":"Nutini"},{"key":"ref154","doi-asserted-by":"publisher","DOI":"10.1145\/2733373.2807410"},{"key":"ref155","doi-asserted-by":"publisher","DOI":"10.1561\/2400000003"},{"key":"ref156","doi-asserted-by":"publisher","DOI":"10.5555\/3454287.3455008"},{"key":"ref157","doi-asserted-by":"publisher","DOI":"10.1016\/j.jpdc.2008.09.002"},{"key":"ref158","first-page":"3102","article-title":"Stochastic gradient riemannian langevin dynamics on the probability simplex","volume-title":"Proc. 26th Int. Conf. Neural Inf. Processi. Syst.","author":"Patterson"},{"key":"ref159","doi-asserted-by":"publisher","DOI":"10.1109\/TNET.2015.2458892"},{"key":"ref160","doi-asserted-by":"publisher","DOI":"10.1016\/S0893-6080(98)00116-6"},{"key":"ref161","first-page":"1177","article-title":"Random features for large-scale kernel machines","volume-title":"Proc. Int. Conf. Neural Inf. Process. Syst.","author":"Rahimi"},{"key":"ref162","doi-asserted-by":"publisher","DOI":"10.1103\/physrevlett.113.130503"},{"key":"ref163","first-page":"693","article-title":"Hogwild: A lock-free approach to parallelizing stochastic gradient descent","volume-title":"Proc. Int. Conf. Neural Inf. Process. Syst.","author":"Recht"},{"key":"ref164","article-title":"On the convergence of adam and beyond","author":"Reddi","year":"2019"},{"key":"ref165","doi-asserted-by":"publisher","DOI":"10.1109\/MICRO.2016.7783721"},{"issue":"1","key":"ref166","first-page":"2657","article-title":"Distributed coordinate descent method for learning with big data","volume":"17","author":"Richt\u00e1rik","year":"2016","journal-title":"J. Mach. Learn. Res."},{"key":"ref167","article-title":"Iterative MapReduce for large scale machine learning","author":"Rosen","year":"2013"},{"key":"ref168","doi-asserted-by":"publisher","DOI":"10.1145\/2517349.2522740"},{"key":"ref169","article-title":"An overview of gradient descent optimization algorithms","author":"Ruder","year":"2016"},{"key":"ref170","doi-asserted-by":"publisher","DOI":"10.1038\/s42256-019-0048-x"},{"key":"ref171","doi-asserted-by":"publisher","DOI":"10.1007\/s11263-015-0816-y"},{"key":"ref172","doi-asserted-by":"publisher","DOI":"10.1109\/21.97458"},{"key":"ref173","first-page":"5014","article-title":"Adversarially robust generalization requires more data","volume-title":"Proc. Int. Conf. Neural Inf. Process. Syst.","author":"Schmidt"},{"key":"ref174","doi-asserted-by":"publisher","DOI":"10.1007\/s10107-016-1030-6"},{"key":"ref175","first-page":"1458","article-title":"Convergence rates of inexact proximal-gradient methods for convex optimization","volume-title":"Proc. Int. Conf. Neural Inf. Process. Syst.","author":"Schmidt"},{"key":"ref176","doi-asserted-by":"publisher","DOI":"10.21437\/interspeech.2014-274"},{"key":"ref177","article-title":"Horovod: Fast and easy distributed deep learning in tensorflow","author":"Sergeev","year":"2018"},{"key":"ref178","article-title":"A primer on coordinate descent algorithms","author":"Shi","year":"2016"},{"key":"ref179","doi-asserted-by":"publisher","DOI":"10.1109\/MSST.2010.5496972"},{"key":"ref180","first-page":"701","article-title":"Memory efficient kernel approximation","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Si"},{"key":"ref181","article-title":"Rigid-motion scattering for image classification","author":"Sifre"},{"key":"ref182","article-title":"Very deep convolutional networks for large-scale image recognition","author":"Simonyan","year":"2014"},{"key":"ref183","article-title":"Don\u2019t decay the learning rate, increase the batch size","author":"Smith","year":"2017"},{"key":"ref184","doi-asserted-by":"publisher","DOI":"10.1109\/TIT.2018.2854560"},{"issue":"6","key":"ref185","first-page":"1799","article-title":"The shogun machine learning toolbox","volume":"11","author":"Sonnenburg","year":"2010","journal-title":"J. Mach. Learn. Res."},{"key":"ref186","first-page":"1144","article-title":"Optimal rates for random fourier features","volume-title":"Proc. Int. Conf. Neural Inf. Process. Syst.","author":"Sriperumbudur"},{"key":"ref187","doi-asserted-by":"publisher","DOI":"10.1109\/TCYB.2019.2950779"},{"key":"ref188","first-page":"1139","article-title":"On the importance of initialization and momentum in deep learning","volume-title":"Proc. 30th Int. Conf. Mach. Learn.","author":"Sutskever"},{"key":"ref189","doi-asserted-by":"publisher","DOI":"10.4324\/9781410605337-29"},{"key":"ref190","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2016.308"},{"key":"ref191","first-page":"6155","article-title":"Doublesqueeze: Parallel stochastic gradient descent with double-pass error-compensated compression","author":"Tang","year":"2019","journal-title":"Proc. 36th Int. Conf. Mach. Learn."},{"key":"ref192","doi-asserted-by":"publisher","DOI":"10.1109\/JPROC.2010.2050290"},{"key":"ref193","doi-asserted-by":"publisher","DOI":"10.1186\/s40537-015-0030-3"},{"key":"ref194","doi-asserted-by":"publisher","DOI":"10.1145\/1273496.1273611"},{"key":"ref195","doi-asserted-by":"publisher","DOI":"10.1145\/2523616.2523633"},{"key":"ref196","volume-title":"The Computer and the Brain","author":"Von Neumann","year":"2012"},{"key":"ref197","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2012.6247790"},{"key":"ref198","article-title":"Hashing for similarity search: A survey","author":"Wang","year":"2014"},{"key":"ref199","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2017.2699960"},{"key":"ref200","doi-asserted-by":"publisher","DOI":"10.1109\/TKDE.2017.2654445"},{"key":"ref201","doi-asserted-by":"publisher","DOI":"10.1109\/TKDE.2016.2535367"},{"key":"ref202","first-page":"681","article-title":"Bayesian learning via stochastic gradient langevin dynamics","volume-title":"Proc. 28th Int. Conf. Mach. Learn.","author":"Welling"},{"key":"ref203","doi-asserted-by":"publisher","DOI":"10.5555\/3294771.3294915"},{"key":"ref204","doi-asserted-by":"publisher","DOI":"10.1007\/s10107-015-0892-3"},{"key":"ref205","first-page":"5325","article-title":"Error compensated quantized SGD and its applications to large-scale distributed optimization","author":"Wu","year":"2018","journal-title":"Proc. 35th Int. Conf. Mach. Learn."},{"key":"ref206","article-title":"Deep image: Scaling up image recognition","author":"Wu","year":"2015"},{"key":"ref207","doi-asserted-by":"publisher","DOI":"10.1109\/TKDE.2013.109"},{"key":"ref208","first-page":"595","article-title":"Gandiva: Introspective cluster scheduling for deep learning","volume-title":"Proc. 13th USENIX Conf. Operating Syst. Des. Implementation","author":"Xiao"},{"key":"ref209","doi-asserted-by":"publisher","DOI":"10.1109\/TBDATA.2015.2472014"},{"key":"ref210","doi-asserted-by":"publisher","DOI":"10.1145\/2009916.2009988"},{"key":"ref211","article-title":"A survey on multi-view learning","author":"Xu","year":"2013"},{"key":"ref212","article-title":"Towards optimal one pass large scale learning with averaged stochastic gradient descent","author":"Xu","year":"2011"},{"key":"ref213","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2015.314"},{"key":"ref214","first-page":"476","article-title":"Nystr\u00f6m method vs random fourier features: A theoretical and empirical comparison","volume-title":"Proc. Advances Neural Inf. Process. Syst.","author":"Yang"},{"key":"ref215","doi-asserted-by":"publisher","DOI":"10.1214\/16-AOS1472"},{"key":"ref216","first-page":"4801","article-title":"Hierarchical graph representation learning with differentiable pooling","volume-title":"Proc. Int. Conf. Neural Inf. Process. Syst.","author":"Ying"},{"key":"ref217","doi-asserted-by":"publisher","DOI":"10.1016\/c2013-0-11733-3"},{"key":"ref218","article-title":"Multi-scale context aggregation by dilated convolutions","author":"Yu"},{"key":"ref219","first-page":"5125","article-title":"GradiVeQ: Vector quantization for bandwidth-efficient gradient aggregation in distributed CNN training","volume-title":"Proc. Int. Conf. Neural Inf. Process. Syst.","author":"Yu"},{"key":"ref220","doi-asserted-by":"publisher","DOI":"10.1109\/JPROC.2012.2188013"},{"key":"ref221","doi-asserted-by":"publisher","DOI":"10.1007\/s10589-009-9251-8"},{"key":"ref222","doi-asserted-by":"publisher","DOI":"10.1145\/2886107.2886110"},{"key":"ref223","first-page":"10","article-title":"Spark: Cluster computing with working sets","volume-title":"Proc. 2nd USENIX Conf. Hot Topics Cloud Comput.","author":"Zaharia"},{"key":"ref224","doi-asserted-by":"publisher","DOI":"10.1145\/2517349.2522737"},{"key":"ref225","article-title":"Adadelta: An adaptive learning rate method","author":"Zeiler","year":"2012"},{"key":"ref226","first-page":"4035","article-title":"ZipML: Training linear models with end-to-end low precision, and a little bit of deep learning","volume-title":"Proc. 34th Int. Conf. Mach. Learn.","author":"Zhang"},{"key":"ref227","doi-asserted-by":"publisher","DOI":"10.1145\/2911451.2911502"},{"key":"ref228","doi-asserted-by":"publisher","DOI":"10.1109\/TNNLS.2014.2315526"},{"key":"ref229","doi-asserted-by":"publisher","DOI":"10.1145\/1390156.1390311"},{"key":"ref230","doi-asserted-by":"publisher","DOI":"10.1016\/j.inffus.2017.10.006"},{"key":"ref231","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2018.00716"},{"key":"ref232","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-642-40991-2_42"},{"key":"ref233","doi-asserted-by":"publisher","DOI":"10.1145\/3299869.3314038"},{"key":"ref234","first-page":"685","article-title":"Deep learning with elastic averaging SGD","volume-title":"Proc. Int. Conf. Neural Inf. Process. Syst.","author":"LeCun"},{"key":"ref235","first-page":"3329","article-title":"Accelerated mini-batch randomized block coordinate descent method","volume-title":"Proc. Int. Conf. Neural Inf. Process. Syst.","author":"Zhao"},{"key":"ref236","first-page":"4120","article-title":"Asynchronous stochastic gradient descent with delay compensation","volume-title":"Proc. 34th Int. Conf. Mach. Learn.","author":"Zheng"},{"key":"ref237","doi-asserted-by":"publisher","DOI":"10.1093\/nsr\/nwx106"},{"key":"ref238","first-page":"375","article-title":"Gridgraph: Large-scale graph processing on a single machine using 2-level hierarchical partitioning","volume-title":"Proc. USENIX Conf. Usenix Annu. Tech. Conf.","author":"Zhu"},{"key":"ref239","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2019.00953"},{"key":"ref240","first-page":"2595","article-title":"Parallelized stochastic gradient descent","volume-title":"Proc. Int. Conf. Neural Inf. Process. Syst.","author":"Zinkevich"}],"container-title":["IEEE Transactions on Knowledge and Data Engineering"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx7\/69\/4358933\/09165233.pdf?arnumber=9165233","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2024,1,9]],"date-time":"2024-01-09T23:50:46Z","timestamp":1704844246000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/9165233\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2020]]},"references-count":240,"URL":"https:\/\/doi.org\/10.1109\/tkde.2020.3015777","relation":{},"ISSN":["1041-4347","1558-2191","2326-3865"],"issn-type":[{"value":"1041-4347","type":"print"},{"value":"1558-2191","type":"electronic"},{"value":"2326-3865","type":"electronic"}],"subject":[],"published":{"date-parts":[[2020]]}}}