{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,8,11]],"date-time":"2026-08-11T16:03:38Z","timestamp":1786464218845,"version":"3.56.0"},"reference-count":331,"publisher":"Emerald","issue":"1","content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2018,12,23]]},"abstract":"<jats:p>Neural ranking models for information retrieval (IR) use shallow or deep neural networks to rank search results in response to a query. Traditional learning to rank models employ supervised machine learning (ML) techniques\u2014including neural networks\u2014over hand-crafted IR features. By contrast, more recently proposed neural models learn representations of language from raw text that can bridge the gap between query and document vocabulary. Unlike classical learning to rank models and non-neural approaches to IR, these new ML techniques are data-hungry, requiring large scale training data before they can be deployed. This tutorial introduces basic concepts and intuitions behind neural IR models, and places them in the context of classical non-neural approaches to IR. We begin by introducing fundamental concepts of retrieval and different neural and non-neural approaches to unsupervised learning of vector representations of text. We then review IR methods that employ these pre-trained neural vector representations without learning the IR task end-to-end. We introduce the Learning to Rank (LTR) framework next, discussing standard loss functions for ranking. We follow that with an overview of deep neural networks (DNNs), including standard architectures and implementations. Finally, we review supervised neural learning to rank models, including recent DNN architectures trained end-to-end for ranking tasks. We conclude with a discussion on potential future directions for neural IR.<\/jats:p>","DOI":"10.1561\/1500000061","type":"journal-article","created":{"date-parts":[[2018,12,23]],"date-time":"2018-12-23T07:02:55Z","timestamp":1545548575000},"page":"1-126","source":"Crossref","is-referenced-by-count":192,"title":["An Introduction to Neural Information Retrieval"],"prefix":"10.1108","volume":"13","author":[{"given":"Bhaskar","family":"Mitra","sequence":"first","affiliation":[{"name":"Microsoft, University College London"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Nick","family":"Craswell","sequence":"additional","affiliation":[{"name":"Microsoft"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"140","published-online":{"date-parts":[[2018,12,23]]},"reference":[{"key":"2026060107313023300_ref001","article-title":"\u201cTensorflow: Large-scale machine learning on heterogeneous distributed systems\u201d","volume-title":"arXiv preprint","author":"Abadi","year":"2016"},{"key":"2026060107313023300_ref002","doi-asserted-by":"crossref","DOI":"10.21236\/ADA460118","article-title":"\u201cUMass at TREC 2004: Novelty and HARD\u201d","volume-title":"TREC","author":"Abdul-Jaleel","year":"2004"},{"key":"2026060107313023300_ref003","article-title":"\u201cOverview of the TREC 2015 LiveQA Track\u201d","volume-title":"TREC","author":"Agichtein","year":"2015"},{"key":"2026060107313023300_ref004","first-page":"133","article-title":"\u201cAnalysis of the paragraph vector model for information retrieval\u201d","volume-title":"Proc. ICTIR","author":"Ai","year":"2016"},{"key":"2026060107313023300_ref005","first-page":"869","article-title":"\u201cImproving language estimation with the paragraph vector model for ad-hoc retrieval\u201d","volume-title":"Proc. SIGIR","author":"Ai","year":"2016"},{"key":"2026060107313023300_ref006","article-title":"\u201cRand-walk: A latent variable model approach to word embeddings\u201d","volume-title":"arXiv preprint","author":"Arora","year":"2015"},{"key":"2026060107313023300_ref007","volume-title":"Modern information retrieval","author":"Baeza-Yates","year":"1999"},{"key":"2026060107313023300_ref008","article-title":"\u201cNeural machine translation by jointly learning to align and translate\u201d","volume-title":"arXiv preprint","author":"Bahdanau","year":"2014"},{"key":"2026060107313023300_ref009","article-title":"\u201cVariational Attention for Sequence-to-Sequence Models\u201d","volume-title":"arXiv preprint","author":"Bahuleyan","year":"2017"},{"issue":"6","key":"2026060107313023300_ref010","doi-asserted-by":"crossref","first-page":"853","DOI":"10.1016\/S0306-4573(02)00084-5","article-title":"\u201cEngineering a multipurpose test collection for web retrieval experiments\u201d","volume":"39","author":"Bailey","year":"2003","journal-title":"Information Processing & Management"},{"issue":"3","key":"2026060107313023300_ref011","doi-asserted-by":"crossref","first-page":"402","DOI":"10.1162\/neco.1993.5.3.402","article-title":"\u201cNeural networks for fingerprint recognition\u201d","volume":"5","author":"Baldi","year":"1993","journal-title":"Neural Computation"},{"key":"2026060107313023300_ref012","first-page":"238","article-title":"\u201cDon't count, predict! A systematic comparison of context-counting vs. context-predicting semantic vectors\u201d","volume-title":"Proc. ACL","author":"Baroni","year":"2014"},{"issue":"4","key":"2026060107313023300_ref013","doi-asserted-by":"crossref","first-page":"673","DOI":"10.1162\/coli_a_00016","article-title":"\u201cDistributional memory: A general framework for corpus-based semantics\u201d","volume":"36","author":"Baroni","year":"2010","journal-title":"Computational Linguistics"},{"key":"2026060107313023300_ref014","volume-title":"Elements of semiology","author":"Barthes","year":"1977"},{"key":"2026060107313023300_ref015","first-page":"41","article-title":"\u201cAnticipating Information Needs Based on Check-in Activity\u201d","volume-title":"WSDM","author":"Benetka","year":"2017"},{"issue":"1","key":"2026060107313023300_ref016","doi-asserted-by":"crossref","first-page":"1","DOI":"10.1561\/2200000006","article-title":"\u201cLearning deep architectures for AI\u201d","volume":"2","author":"Bengio","year":"2009","journal-title":"Foundations and Trends in Machine Learning"},{"issue":"Feb","key":"2026060107313023300_ref017","first-page":"1137","article-title":"\u201cA neural probabilistic language model\u201d","volume":"3","author":"Bengio","year":"2003","journal-title":"Journal of Machine Learning Research"},{"key":"2026060107313023300_ref018","first-page":"153","article-title":"\u201cGreedy layer-wise training of deep networks\u201d","volume-title":"Proc. NIPS","author":"Bengio","year":"2007"},{"issue":"4","key":"2026060107313023300_ref019","doi-asserted-by":"crossref","first-page":"713","DOI":"10.1109\/TNN.2007.912312","article-title":"\u201cAdaptive importance sampling to accelerate training of a neural probabilistic language model\u201d","volume":"19","author":"Bengio","year":"2008","journal-title":"IEEE Transactions on Neural Networks"},{"key":"2026060107313023300_ref020","article-title":"\u201cQuick Training of Probabilistic Neural Nets by Importance Sampling\u201d","volume-title":"AISTATS","author":"Bengio","year":"2003"},{"key":"2026060107313023300_ref021","doi-asserted-by":"crossref","first-page":"222","DOI":"10.1145\/312624.312681","article-title":"\u201cInformation retrieval as statistical translation\u201d","volume-title":"Proc. SIGIR","author":"Berger","year":"1999"},{"key":"2026060107313023300_ref022","article-title":"\u201cThe extreme classification repository: multi-label datasets & code\u201d","author":"Bhatia","year":"2016"},{"key":"2026060107313023300_ref023","volume-title":"Pattern recognition and machine learning","author":"Bishop","year":"2006"},{"key":"2026060107313023300_ref024","first-page":"993","article-title":"\u201cLatent dirichlet allocation\u201d","volume":"3","author":"Blei","year":"2003","journal-title":"Journal of Machine Learning Research"},{"key":"2026060107313023300_ref025","article-title":"\u201cLarge-scale simple question answering with memory networks\u201d","volume-title":"arXiv preprint","author":"Bordes","year":"2015"},{"key":"2026060107313023300_ref026","first-page":"205","article-title":"\u201cA context-aware time model for web search\u201d","volume-title":"Proc. SIGIR","author":"Borisov","year":"2016"},{"key":"2026060107313023300_ref027","first-page":"531","article-title":"\u201cA neural click model for web search\u201d","volume-title":"Proc. WWW","author":"Borisov","year":"2016"},{"key":"2026060107313023300_ref028","doi-asserted-by":"crossref","DOI":"10.18653\/v1\/P16-1139","article-title":"\u201cA fast unified model for parsing and sentence understanding\u201d","volume-title":"arXiv preprint","author":"Bowman","year":"2016"},{"key":"2026060107313023300_ref029","article-title":"\u201cAn exploration of softmax alternatives belonging to the spherical loss family\u201d","volume-title":"arXiv preprint","author":"Br\u00e9bisson","year":"2015"},{"key":"2026060107313023300_ref030","article-title":"\u201cThe Z-loss: a shift and scale invariant classification loss belonging to the Spherical Family\u201d","volume-title":"arXiv preprint","author":"Br\u00e9bisson","year":"2016"},{"key":"2026060107313023300_ref031","first-page":"360","article-title":"\u201cProcessing natural language without natural language processing\u201d","volume-title":"International Conference on Intelligent Text Processing and Computational Linguistics","author":"Brill","year":"2003"},{"issue":"4","key":"2026060107313023300_ref032","first-page":"669","article-title":"\u201cSignature Verification Using A \"Siamese\" Time Delay Neural Network\u201d","volume":"7","author":"Bromley","year":"1993","journal-title":"IJPRAI"},{"issue":"2","key":"2026060107313023300_ref033","first-page":"79","article-title":"\u201cA statistical approach to machine translation\u201d","volume":"16","author":"Brown","year":"1990","journal-title":"Computational Linguistics"},{"issue":"4","key":"2026060107313023300_ref034","first-page":"467","article-title":"\u201cClass-based n-gram models of natural language\u201d","volume":"18","author":"Brown","year":"1992","journal-title":"Computational Linguistics"},{"issue":"2","key":"2026060107313023300_ref035","first-page":"263","article-title":"\u201cThe mathematics of statistical machine translation: Parameter estimation\u201d","volume":"19","author":"Brown","year":"1993","journal-title":"Computational Linguistics"},{"key":"2026060107313023300_ref036","article-title":"\u201cAsk the right questions: Active question reformulation with reinforcement learning\u201d","volume-title":"arXiv preprint","author":"Buck","year":"2017"},{"issue":"3","key":"2026060107313023300_ref037","doi-asserted-by":"crossref","first-page":"510","DOI":"10.3758\/BF03193020","article-title":"\u201cExtracting semantic representations from word co-occurrence statistics: A computational study\u201d","volume":"39","author":"Bullinaria","year":"2007","journal-title":"Behavior Research Methods"},{"issue":"3","key":"2026060107313023300_ref038","doi-asserted-by":"crossref","first-page":"890","DOI":"10.3758\/s13428-011-0183-8","article-title":"\u201cExtracting semantic representations from word co-occurrence statistics: stop-lists, stemming, and SVD\u201d","volume":"44","author":"Bullinaria","year":"2012","journal-title":"Behavior Research Methods"},{"key":"2026060107313023300_ref039","first-page":"89","article-title":"\u201cLearning to rank using gradient descent\u201d","volume-title":"Proc. ICML","author":"Burges","year":"2005"},{"issue":"23\u2013581","key":"2026060107313023300_ref040","first-page":"81","article-title":"\u201cFrom ranknet to lambdarank to lambdamart: An overview\u201d","volume":"11","author":"Burges","year":"2010","journal-title":"Learning"},{"key":"2026060107313023300_ref041","first-page":"193","article-title":"\u201cLearning to rank with nonsmooth cost functions\u201d","volume-title":"NIPS","author":"Burges","year":"2006"},{"key":"2026060107313023300_ref042","article-title":"\u201cClueweb09 data set\u201d","author":"Callan","year":"2009"},{"key":"2026060107313023300_ref043","first-page":"129","article-title":"\u201cLearning to rank: from pairwise approach to listwise approach\u201d","volume-title":"Proc. ICML","author":"Cao","year":"2007"},{"key":"2026060107313023300_ref044","doi-asserted-by":"crossref","DOI":"10.1145\/3077136.3080816","article-title":"\u201cVariational Deep Semantic Hashing for Text Documents\u201d","volume-title":"Proc. SIGIR","author":"Chaidaroon","year":"2017"},{"key":"2026060107313023300_ref045","volume-title":"Semiotics for beginners","author":"Chandler","year":"1994"},{"key":"2026060107313023300_ref046","article-title":"\u201cMxnet: A flexible and efficient machine learning library for heterogeneous distributed systems\u201d","volume-title":"arXiv preprint","author":"Chen","year":"2015"},{"key":"2026060107313023300_ref047","first-page":"315","article-title":"\u201cRanking measures and loss functions in learning to rank\u201d","volume-title":"Advances in Neural Information Processing Systems","author":"Chen","year":"2009"},{"key":"2026060107313023300_ref048","article-title":"\u201cStrategies for training large vocabulary neural language models\u201d","volume-title":"arXiv preprint","author":"Chen","year":"2015"},{"key":"2026060107313023300_ref049","doi-asserted-by":"crossref","DOI":"10.3115\/v1\/W14-4012","article-title":"\u201cOn the properties of neural machine translation: Encoder-decoder approaches\u201d","volume-title":"arXiv preprint","author":"Cho","year":"2014"},{"key":"2026060107313023300_ref050","first-page":"539","article-title":"\u201cLearning a similarity metric discriminatively, with application to face verification\u201d","volume-title":"Computer Vision and Pattern Recognition (CVPR)","author":"Chopra","year":"2005"},{"key":"2026060107313023300_ref051","first-page":"577","article-title":"\u201cAttention-based models for speech recognition\u201d","volume-title":"Proc. NIPS","author":"Chorowski","year":"2015"},{"key":"2026060107313023300_ref052","article-title":"\u201cEmpirical evaluation of gated recurrent neural networks on sequence modeling\u201d","volume-title":"arXiv preprint","author":"Chung","year":"2014"},{"key":"2026060107313023300_ref053","article-title":"\u201cExtreme Classification 2016: The NIPS Workshop on Multi-class and Multi-label Learning in Extremely Large Label Spaces\u201d","author":"Cisse","year":"2016"},{"key":"2026060107313023300_ref054","first-page":"100","article-title":"\u201cAggregating continuous word embeddings for information retrieval\u201d","volume-title":"Workshop on Continuous Vector Space Models and their Compositionality","author":"Clinchant","year":"2013"},{"key":"2026060107313023300_ref055","article-title":"\u201cAdaptability of neural networks on varying granularity IR tasks\u201d","volume-title":"arXiv preprint","author":"Cohen","year":"2016"},{"key":"2026060107313023300_ref056","first-page":"143","article-title":"\u201cEnd to End Long Short Term Memory Networks for Non-Factoid Question Answering\u201d","volume-title":"Proc. ICTIR","author":"Cohen","year":"2016"},{"key":"2026060107313023300_ref057","doi-asserted-by":"crossref","DOI":"10.1145\/3209978.3210141","article-title":"\u201cCross Domain Regularization for Neural Ranking Models using Adversarial Learning\u201d","volume-title":"Proc. SIGIR","author":"Cohen","year":"2018"},{"key":"2026060107313023300_ref058","article-title":"\u201cTorch7: A matlab-like environment for machine learning\u201d","volume-title":"BigLearn, NIPS Workshop","author":"Collobert","year":"2011"},{"key":"2026060107313023300_ref059","first-page":"2493","article-title":"\u201cNatural language processing (almost) from scratch\u201d","volume":"12","author":"Collobert","year":"2011","journal-title":"Journal of Machine Learning Research"},{"key":"2026060107313023300_ref060","first-page":"605","article-title":"\u201cSubset ranking using regression\u201d","volume-title":"COLT","author":"Cossock","year":"2006"},{"key":"2026060107313023300_ref061","doi-asserted-by":"crossref","first-page":"1703","DOI":"10.1007\/978-0-387-39940-9_488","article-title":"\u201cMean reciprocal rank\u201d","volume-title":"Encyclopedia of Database Systems","author":"Craswell","year":"2009"},{"key":"2026060107313023300_ref062","first-page":"251","article-title":"\u201cNeural Models for Full Text Search\u201d","volume-title":"Proc. WSDM","author":"Craswell","year":"2017"},{"key":"2026060107313023300_ref063","doi-asserted-by":"crossref","DOI":"10.1145\/2911451.2917762","article-title":"\u201cNeu-IR: The SIGIR 2016 Workshop on Neural Information Retrieval\u201d","volume-title":"SIGIR Workshop","author":"Craswell","year":"2016"},{"issue":"2","key":"2026060107313023300_ref064","doi-asserted-by":"crossref","first-page":"96","DOI":"10.1145\/3053408.3053425","article-title":"\u201cReport on the SIGIR 2016 Workshop on Neural Information Retrieval (Neu-IR)\u201d","volume":"50","author":"Craswell","year":"2016","journal-title":"ACM SIGIR Forum"},{"key":"2026060107313023300_ref065","article-title":"\u201cNeu-IR\u201917: Neural Information Retrieval\u201d","volume-title":"Proc. SIGIR","author":"Craswell","year":"2017"},{"issue":"3","key":"2026060107313023300_ref066","doi-asserted-by":"crossref","first-page":"152","DOI":"10.1145\/3190580.3190603","article-title":"\u201cReport on the Second SIGIR Workshop on Neural Information Retrieval (Neu-IR\u201917)\u201d","volume":"51","author":"Craswell","year":"2018","journal-title":"ACM SIGIR Forum"},{"key":"2026060107313023300_ref067","article-title":"\u201cOverview of the TREC 2002 Web track\u201d","volume-title":"TREC","author":"Craswell","year":"2003"},{"key":"2026060107313023300_ref068","article-title":"\u201cProceedings of the 2009 workshop on Web Search Click Data\u201d","author":"Craswell","year":"2009"},{"key":"2026060107313023300_ref069","volume-title":"Search engines: Information retrieval in practice","author":"Croft","year":"2010"},{"key":"2026060107313023300_ref070","author":"De Saussure","year":"1916"},{"issue":"6","key":"2026060107313023300_ref071","doi-asserted-by":"crossref","first-page":"391","DOI":"10.1002\/(SICI)1097-4571(199009)41:6<391::AID-ASI1>3.0.CO;2-9","article-title":"\u201cIndexing by latent semantic analysis\u201d","volume":"41","author":"Deerwester","year":"1990","journal-title":"JASIS"},{"key":"2026060107313023300_ref072","article-title":"\u201cLearning to Learn from Weak Supervision by Full Supervision\u201d","volume-title":"arXiv preprint","author":"Dehghani","year":"2017"},{"key":"2026060107313023300_ref073","first-page":"65","article-title":"\u201cNeural ranking models with weak supervision\u201d","volume-title":"Proc. SIGIR","author":"Dehghani","year":"2017"},{"key":"2026060107313023300_ref074","first-page":"1","article-title":"\u201cMaximum likelihood from incomplete data via the EM algorithm\u201d","author":"Dempster","year":"1977","journal-title":"Journal of the Royal Statistical Society, Series B (Methodological)"},{"issue":"3\u20134","key":"2026060107313023300_ref075","doi-asserted-by":"crossref","first-page":"197","DOI":"10.1561\/2000000039","article-title":"\u201cDeep learning: methods and applications\u201d","volume":"7","author":"Deng","year":"2014","journal-title":"Foundations and Trends in Signal Processing"},{"key":"2026060107313023300_ref076","article-title":"\u201cModelling, visualising and summarising documents with a single convolutional neural network\u201d","volume-title":"arXiv preprint","author":"Denil","year":"2014"},{"key":"2026060107313023300_ref077","doi-asserted-by":"crossref","DOI":"10.18653\/v1\/P16-1035","article-title":"\u201cQuery Expansion with Locally-Trained Word Embeddings\u201d","volume-title":"Proc. ACL","author":"Diaz","year":"2016"},{"key":"2026060107313023300_ref078","first-page":"1451","article-title":"\u201cRobust models of mouse movement on dynamic web search results pages\u201d","volume-title":"Proc. ACM CIKM","author":"Diaz","year":"2013"},{"key":"2026060107313023300_ref079","first-page":"460","article-title":"\u201cOn the local optimality of LambdaRank\u201d","volume-title":"Proc. SIGIR","author":"Donmez","year":"2009"},{"issue":"Jul","key":"2026060107313023300_ref080","first-page":"2121","article-title":"\u201cAdaptive subgradient methods for online learning and stochastic optimization\u201d","volume":"12","author":"Duchi","year":"2011","journal-title":"Journal of Machine Learning Research"},{"key":"2026060107313023300_ref081","article-title":"\u201cNotes on Noise Contrastive Estimation and Negative Sampling\u201d","volume-title":"arXiv preprint","author":"Dyer","year":"2014"},{"issue":"2","key":"2026060107313023300_ref082","doi-asserted-by":"crossref","first-page":"179","DOI":"10.1207\/s15516709cog1402_1","article-title":"\u201cFinding structure in time\u201d","volume":"14","author":"Elman","year":"1990","journal-title":"Cognitive Science"},{"issue":"3","key":"2026060107313023300_ref083","doi-asserted-by":"crossref","first-page":"59","DOI":"10.1609\/aimag.v31i3.2303","article-title":"\u201cBuilding Watson: An overview of the DeepQA project\u201d","volume":"31","author":"Ferrucci","year":"2010","journal-title":"AI Magazine"},{"key":"2026060107313023300_ref084","first-page":"1","article-title":"\u201cA synopsis of linguistic theory, 1930\u20131955\u201d","volume-title":"Studies in Linguistic Analysis","author":"Firth","year":"1957"},{"issue":"Nov","key":"2026060107313023300_ref085","first-page":"933","article-title":"\u201cAn efficient boosting algorithm for combining preferences\u201d","volume":"4","author":"Freund","year":"2003","journal-title":"Journal of Machine Learning Research"},{"issue":"3","key":"2026060107313023300_ref086","doi-asserted-by":"crossref","first-page":"183","DOI":"10.1145\/65943.65944","article-title":"\u201cOptimum polynomial retrieval functions based on the probability ranking principle\u201d","volume":"7","author":"Fuhr","year":"1989","journal-title":"ACM Transactions on Information Systems"},{"key":"2026060107313023300_ref087","doi-asserted-by":"crossref","DOI":"10.3115\/v1\/P15-2073","article-title":"\u201cdeltaBLEU: A discriminative metric for generation tasks with intrinsically diverse targets\u201d","volume-title":"arXiv preprint","author":"Galley","year":"2015"},{"key":"2026060107313023300_ref088","first-page":"795","article-title":"\u201cWord Embedding based Generalized Language Model for Information Retrieval\u201d","volume-title":"Proc. SIGIR","author":"Ganguly","year":"2015"},{"key":"2026060107313023300_ref089","doi-asserted-by":"crossref","DOI":"10.3115\/v1\/D14-1002","article-title":"\u201cModeling interestingness with deep neural networks\u201d","volume-title":"Proc. EMNLP","author":"Gao","year":"2014"},{"key":"2026060107313023300_ref090","article-title":"\u201cA Knowledge-Grounded Neural Conversation Model\u201d","volume-title":"arXiv preprint","author":"Ghazvininejad","year":"2017"},{"key":"2026060107313023300_ref091","article-title":"\u201cword2vec Explained: deriving Mikolov et al.\u2019s negative-sampling word-embedding method\u201d","volume-title":"arXiv preprint","author":"Goldberg","year":"2014"},{"key":"2026060107313023300_ref092","first-page":"347","article-title":"\u201cLearning task-dependent distributed representations by backpropagation through structure\u201d","volume-title":"IEEE International Conference on Neural Networks","author":"Goller","year":"1996"},{"issue":"5","key":"2026060107313023300_ref093","doi-asserted-by":"crossref","first-page":"403","DOI":"10.1007\/BF02163027","article-title":"\u201cSingular value decomposition and least squares solutions\u201d","volume":"14","author":"Golub","year":"1970","journal-title":"Numerische Mathematik"},{"key":"2026060107313023300_ref094","volume-title":"Deep learning","author":"Goodfellow","year":"2016"},{"key":"2026060107313023300_ref095","first-page":"2672","article-title":"\u201cGenerative adversarial nets\u201d","volume-title":"Proc. NIPS","author":"Goodfellow","year":"2014"},{"key":"2026060107313023300_ref096","first-page":"561","article-title":"\u201cClasses for fast maximum entropy training\u201d","volume-title":"Proc. ICASSP","author":"Goodman","year":"2001"},{"key":"2026060107313023300_ref097","doi-asserted-by":"crossref","first-page":"478","DOI":"10.1145\/1008992.1009079","article-title":"\u201cEye-tracking analysis of user behavior in WWW search\u201d","volume-title":"Proc. SIGIR","author":"Granka","year":"2004"},{"key":"2026060107313023300_ref098","article-title":"\u201cEfficient softmax approximation for GPUs\u201d","volume-title":"arXiv preprint","author":"Grave","year":"2016"},{"key":"2026060107313023300_ref099","article-title":"\u201cGenerating sequences with recurrent neural networks\u201d","volume-title":"arXiv preprint","author":"Graves","year":"2013"},{"issue":"5","key":"2026060107313023300_ref100","doi-asserted-by":"crossref","first-page":"855","DOI":"10.1109\/TPAMI.2008.137","article-title":"\u201cA novel connectionist system for unconstrained handwriting recognition\u201d","volume":"31","author":"Graves","year":"2009","journal-title":"IEEE Transactions on Pattern Analysis and Machine Intelligence"},{"key":"2026060107313023300_ref101","doi-asserted-by":"crossref","first-page":"37","DOI":"10.1145\/2740908.2742774","article-title":"\u201cSearch Retargeting using Directed Query Embeddings\u201d","volume-title":"Proc. WWW","author":"Grbovic","year":"2015"},{"key":"2026060107313023300_ref102","first-page":"383","article-title":"\u201cContext-and Content-aware Embeddings for Query Rewriting in Sponsored Search\u201d","volume-title":"Proc. SIGIR","author":"Grbovic","year":"2015"},{"key":"2026060107313023300_ref103","article-title":"\u201cDRAW: A recurrent neural network for image generation\u201d","volume-title":"arXiv preprint","author":"Gregor","year":"2015"},{"key":"2026060107313023300_ref104","first-page":"417","article-title":"\u201cAn eye tracking study of the effect of target rank on web search\u201d","volume-title":"Proc. SIGCHI","author":"Guan","year":"2007"},{"key":"2026060107313023300_ref105","first-page":"55","article-title":"\u201cA Deep Relevance Matching Model for Ad-hoc Retrieval\u201d","volume-title":"Proc. CIKM","author":"Guo","year":"2016"},{"key":"2026060107313023300_ref106","first-page":"701","article-title":"\u201cSemantic Matching by Non-Linear Word Transportation for Information Retrieval\u201d","volume-title":"Proc. CIKM","author":"Guo","year":"2016"},{"key":"2026060107313023300_ref107","first-page":"6","article-title":"\u201cNoise-contrastive estimation: A new estimation principle for unnormalized statistical models\u201d","volume-title":"AISTATS","author":"Gutmann","year":"2010"},{"key":"2026060107313023300_ref108","first-page":"1735","article-title":"\u201cDimensionality reduction by learning an invariant mapping\u201d","volume-title":"IEEE Computer Vision and Pattern Recognition","author":"Hadsell","year":"2006"},{"issue":"6789","key":"2026060107313023300_ref109","doi-asserted-by":"crossref","first-page":"947","DOI":"10.1038\/35016072","article-title":"\u201cDigital selection and analogue amplification coexist in a cortex-inspired silicon circuit\u201d","volume":"405","author":"Hahnloser","year":"2000","journal-title":"Nature"},{"issue":"2","key":"2026060107313023300_ref110","doi-asserted-by":"crossref","first-page":"8","DOI":"10.1109\/MIS.2009.36","article-title":"\u201cThe unreasonable effectiveness of data\u201d","volume":"24","author":"Halevy","year":"2009","journal-title":"IEEE Intelligent Systems"},{"key":"2026060107313023300_ref111","doi-asserted-by":"crossref","DOI":"10.3366\/edinburgh\/9780748613083.001.0001","volume-title":"Saussure and his Interpreters","author":"Harris","year":"2001"},{"issue":"2\u20133","key":"2026060107313023300_ref112","doi-asserted-by":"crossref","first-page":"146","DOI":"10.1080\/00437956.1954.11659520","article-title":"\u201cDistributional structure\u201d","volume":"10","author":"Harris","year":"1954","journal-title":"Word"},{"key":"2026060107313023300_ref113","doi-asserted-by":"crossref","DOI":"10.1007\/978-0-387-21606-5","volume-title":"The elements of statistical learning","author":"Hastie","year":"2001"},{"key":"2026060107313023300_ref114","first-page":"770","article-title":"\u201cDeep residual learning for image recognition\u201d","volume-title":"Proc. CVPR","author":"He","year":"2016"},{"issue":"Supplement\u20131","key":"2026060107313023300_ref115","doi-asserted-by":"crossref","first-page":"445","DOI":"10.1016\/0893-6080(88)90469-8","article-title":"\u201cTheory of the backpropagation neural network\u201d","volume":"1","author":"Hecht-Nielsen","year":"1988","journal-title":"Neural Networks"},{"key":"2026060107313023300_ref116","doi-asserted-by":"crossref","DOI":"10.7551\/mitpress\/1113.003.0010","article-title":"\u201cLarge margin rank boundaries for ordinal regression\u201d","author":"Herbrich","year":"2000"},{"key":"2026060107313023300_ref117","first-page":"1693","article-title":"\u201cTeaching machines to read and comprehend\u201d","volume-title":"Proc. NIPS","author":"Hermann","year":"2015"},{"key":"2026060107313023300_ref118","volume-title":"Using language models for information retrieval","author":"Hiemstra","year":"2001"},{"key":"2026060107313023300_ref119","article-title":"\u201cThe Goldilocks Principle: Reading Children\u2019s Books with Explicit Memory Representations\u201d","volume-title":"arXiv preprint","author":"Hill","year":"2015"},{"key":"2026060107313023300_ref120","article-title":"\u201cDistributed representations\u201d","author":"Hinton","year":"1984"},{"issue":"6","key":"2026060107313023300_ref121","doi-asserted-by":"crossref","first-page":"82","DOI":"10.1109\/MSP.2012.2205597","article-title":"\u201cDeep neural networks for acoustic modeling in speech recognition: The shared views of four research groups\u201d","volume":"29","author":"Hinton","year":"2012","journal-title":"IEEE Signal Processing Magazine"},{"issue":"8","key":"2026060107313023300_ref122","doi-asserted-by":"crossref","first-page":"1735","DOI":"10.1162\/neco.1997.9.8.1735","article-title":"\u201cLong short-term memory\u201d","volume":"9","author":"Hochreiter","year":"1997","journal-title":"Neural Computation"},{"key":"2026060107313023300_ref123","first-page":"549","article-title":"\u201cAn Eye-tracking Study of User Interactions with Query Auto Completion\u201d","volume-title":"Proc. CIKM","author":"Mitra","year":"2014"},{"key":"2026060107313023300_ref124","doi-asserted-by":"crossref","first-page":"50","DOI":"10.1145\/312624.312649","article-title":"\u201cProbabilistic latent semantic indexing\u201d","volume-title":"Proc. SIGIR","author":"Hofmann","year":"1999"},{"issue":"5","key":"2026060107313023300_ref125","doi-asserted-by":"crossref","first-page":"359","DOI":"10.1016\/0893-6080(89)90020-8","article-title":"\u201cMultilayer feedforward networks are universal approximators\u201d","volume":"2","author":"Hornik","year":"1989","journal-title":"Neural Networks"},{"key":"2026060107313023300_ref126","first-page":"2042","article-title":"\u201cConvolutional neural network architectures for matching natural language sentences\u201d","volume-title":"Proc. NIPS","author":"Hu","year":"2014"},{"key":"2026060107313023300_ref127","first-page":"4862","article-title":"\u201cSupervised Word Mover\u2019s Distance\u201d","volume-title":"Proc. NIPS","author":"Huang","year":"2016"},{"key":"2026060107313023300_ref128","first-page":"2333","article-title":"\u201cLearning deep structured semantic models for web search using clickthrough data\u201d","volume-title":"Proc. CIKM","author":"Huang","year":"2013"},{"key":"2026060107313023300_ref129","first-page":"1049","article-title":"\u201cPACRR: A Position-Aware Neural IR Model for Relevance Matching\u201d","volume-title":"Proc. EMNLP","author":"Hui","year":"2017"},{"key":"2026060107313023300_ref130","first-page":"152","article-title":"\u201cCo-PACRR: A Context-Aware Neural IR Model for Ad-hoc Retrieval\u201d","volume-title":"Proc. WSDM","author":"Hui","year":"2018"},{"key":"2026060107313023300_ref131","first-page":"935","article-title":"\u201cExtreme Multi-label Loss Functions for Recommendation, Tagging, Ranking Other Missing Label Applications\u201d","volume-title":"Proc. SIGKDD","author":"Jain","year":"2016"},{"key":"2026060107313023300_ref132","first-page":"2146","article-title":"\u201cWhat is the best multi-stage architecture for object recognition?\u201d","volume-title":"Proc. IEEE International Conference on Computer Vision","author":"Jarrett","year":"2009"},{"issue":"4","key":"2026060107313023300_ref133","doi-asserted-by":"crossref","first-page":"422","DOI":"10.1145\/582415.582418","article-title":"\u201cCumulated gain-based evaluation of IR techniques\u201d","volume":"20","author":"J\u00e4rvelin","year":"2002","journal-title":"ACM Transactions on Information Systems"},{"key":"2026060107313023300_ref134","article-title":"\u201cOn Using Very Large Target Vocabulary for Neural Machine Translation\u201d","volume-title":"arXiv preprint","author":"Jean","year":"2014"},{"key":"2026060107313023300_ref135","article-title":"\u201cInterpolated estimation of Markov source parameters from sparse data\u201d","volume-title":"Proc. Workshop on Pattern Recognition in Practice","author":"Jelinek","year":"1980"},{"key":"2026060107313023300_ref136","article-title":"\u201cBlackout: Speeding up recurrent neural network language models with very large vocabularies\u201d","volume-title":"arXiv preprint","author":"Ji","year":"2015"},{"key":"2026060107313023300_ref137","first-page":"675","article-title":"\u201cCaffe: Convolutional architecture for fast feature embedding\u201d","volume-title":"Proc. ACM Multimedia","author":"Jia","year":"2014"},{"key":"2026060107313023300_ref138","doi-asserted-by":"crossref","first-page":"154","DOI":"10.1145\/1076034.1076063","article-title":"\u201cAccurately interpreting clickthrough data as implicit feedback\u201d","volume-title":"Proc. SIGIR","author":"Joachims","year":"2005"},{"issue":"2","key":"2026060107313023300_ref139","doi-asserted-by":"crossref","first-page":"7","DOI":"10.1145\/1229179.1229181","article-title":"\u201cEvaluating the accuracy of implicit feedback from clicks and query reformulations in web search\u201d","volume":"25","author":"Joachims","year":"2007","journal-title":"ACM Transactions on Information Systems"},{"key":"2026060107313023300_ref140","first-page":"781","article-title":"\u201cUnbiased learning-to-rank with biased feedback\u201d","volume-title":"Proc. WSDM","author":"Joachims","year":"2017"},{"key":"2026060107313023300_ref141","article-title":"\u201cExploring the limits of language modeling\u201d","volume-title":"arXiv preprint","author":"Jozefowicz","year":"2016"},{"key":"2026060107313023300_ref142","doi-asserted-by":"crossref","DOI":"10.3115\/v1\/P14-1062","article-title":"\u201cA convolutional neural network for modelling sentences\u201d","volume-title":"arXiv preprint","author":"Kalchbrenner","year":"2014"},{"key":"2026060107313023300_ref143","doi-asserted-by":"crossref","DOI":"10.18653\/v1\/P16-1089","article-title":"\u201cSiamese cbow: Optimizing word embeddings for sentence representations\u201d","volume-title":"arXiv preprint","author":"Kenter","year":"2016"},{"key":"2026060107313023300_ref144","article-title":"\u201cNeural Networks for Information Retrieval (NN4IR)\u201d","volume-title":"Proc. SIGIR","author":"Kenter","year":"2017"},{"key":"2026060107313023300_ref145","first-page":"779","article-title":"\u201cNeural networks for information retrieval\u201d","volume-title":"Proc. WSDM","author":"Kenter","year":"2018"},{"key":"2026060107313023300_ref146","doi-asserted-by":"crossref","DOI":"10.1145\/3159652.3162009","article-title":"\u201cNeural networks for information retrieval\u201d","volume-title":"Proc. ECIR","author":"Kenter","year":"2018"},{"key":"2026060107313023300_ref147","first-page":"115","article-title":"\u201cShort Text Similarity with Word Embeddings\u201d","volume-title":"Proc. CIKM","author":"Kenter","year":"2015"},{"key":"2026060107313023300_ref148","doi-asserted-by":"crossref","DOI":"10.3115\/v1\/D14-1181","article-title":"\u201cConvolutional neural networks for sentence classification\u201d","volume-title":"arXiv preprint","author":"Kim","year":"2014"},{"key":"2026060107313023300_ref149","article-title":"\u201cCharacter-aware neural language models\u201d","volume-title":"arXiv preprint","author":"Kim","year":"2015"},{"key":"2026060107313023300_ref150","article-title":"\u201cAuto-encoding variational bayes\u201d","volume-title":"Proc. ICLR","author":"Kingma","year":"2014"},{"key":"2026060107313023300_ref151","first-page":"2348","article-title":"\u201cA multiplicative model for learning distributed text-based attribute representations\u201d","volume-title":"Proc. NIPS","author":"Kiros","year":"2014"},{"key":"2026060107313023300_ref152","unstructured":"Koch\n              G\n            \n          \n          2015\n          \u201cSiamese neural networks for one-shot image recognition\u201d\n          University of Toronto\n          PhD thesis"},{"key":"2026060107313023300_ref153","first-page":"1097","article-title":"\u201cImagenet classification with deep convolutional neural networks\u201d","volume-title":"Proc. NIPS","author":"Krizhevsky","year":"2012"},{"key":"2026060107313023300_ref154","first-page":"957","article-title":"\u201cFrom word embeddings to document distances\u201d","volume-title":"Proc. ICML","author":"Kusner","year":"2015"},{"key":"2026060107313023300_ref155","doi-asserted-by":"crossref","first-page":"111","DOI":"10.1145\/383952.383970","article-title":"\u201cDocument language models, query models, and risk minimization for information retrieval\u201d","volume-title":"Proc. SIGIR","author":"Lafferty","year":"2001"},{"key":"2026060107313023300_ref156","first-page":"113","article-title":"\u201cTowards better measurement of attention and satisfaction in mobile search\u201d","volume-title":"Proc. SIGIR","author":"Lagun","year":"2014"},{"key":"2026060107313023300_ref157","article-title":"\u201cFractalnet: Ultra-deep neural networks without residuals\u201d","volume-title":"arXiv preprint","author":"Larsson","year":"2016"},{"key":"2026060107313023300_ref158","volume-title":"A generative theory of relevance","author":"Lavrenko","year":"2008"},{"key":"2026060107313023300_ref159","doi-asserted-by":"crossref","first-page":"120","DOI":"10.1145\/383952.383972","article-title":"\u201cRelevance based language models\u201d","volume-title":"Proc. SIGIR","author":"Lavrenko","year":"2001"},{"key":"2026060107313023300_ref160","first-page":"5524","article-title":"\u201cStructured output layer neural network language model\u201d","volume-title":"Proc. ICASSP","author":"Le","year":"2011"},{"key":"2026060107313023300_ref161","first-page":"1188","article-title":"\u201cDistributed Representations of Sentences and Documents\u201d","volume-title":"Proc. ICML","author":"Le","year":"2014"},{"key":"2026060107313023300_ref162","article-title":"\u201cWord embeddings through Hellinger PCA\u201d","volume-title":"arXiv preprint","author":"Lebret","year":"2013"},{"issue":"7553","key":"2026060107313023300_ref163","doi-asserted-by":"crossref","first-page":"436","DOI":"10.1038\/nature14539","article-title":"\u201cDeep learning\u201d","volume":"521","author":"LeCun","year":"2015","journal-title":"Nature"},{"key":"2026060107313023300_ref164","first-page":"II-104","article-title":"\u201cLearning methods for generic object recognition with invariance to pose and lighting\u201d","volume-title":"Proc. CVPR","author":"LeCun","year":"2004"},{"key":"2026060107313023300_ref165","first-page":"253","article-title":"\u201cConvolutional networks and applications in vision\u201d","volume-title":"Proc. ISCAS","author":"LeCun","year":"2010"},{"key":"2026060107313023300_ref166","first-page":"302","article-title":"\u201cDependency-based word embeddings\u201d","volume-title":"Proc. ACL","author":"Levy","year":"2014"},{"key":"2026060107313023300_ref167","doi-asserted-by":"crossref","first-page":"211","DOI":"10.1162\/tacl_a_00134","article-title":"\u201cImproving distributional similarity with lessons learned from word embeddings\u201d","volume":"3","author":"Levy","year":"2015","journal-title":"Transactions of the Association for Computational Linguistics"},{"key":"2026060107313023300_ref168","first-page":"171","article-title":"\u201cLinguistic regularities in sparse and explicit word representations\u201d","volume-title":"Proc. CoNLL","author":"Levy","year":"2014"},{"key":"2026060107313023300_ref169","volume-title":"In the plex: How Google thinks, works, and shapes our lives","author":"Levy","year":"2011"},{"key":"2026060107313023300_ref170","doi-asserted-by":"crossref","article-title":"\u201cDeep Learning for Information Retrieval\u201d","author":"Li","DOI":"10.1145\/2911451.2914800"},{"issue":"5","key":"2026060107313023300_ref171","doi-asserted-by":"crossref","first-page":"343","DOI":"10.1561\/1500000035","article-title":"\u201cSemantic matching in search\u201d","volume":"7","author":"Li","year":"2014","journal-title":"Foundations and Trends in Information Retrieval"},{"key":"2026060107313023300_ref172","first-page":"897","article-title":"\u201cMcrank: Learning to rank using multiple classification and gradient boosting\u201d","volume-title":"Advances in Neural Information Processing Systems","author":"Li","year":"2008"},{"key":"2026060107313023300_ref173","first-page":"1035","article-title":"\u201cAnticipatory search: using context to initiate search\u201d","volume-title":"Proc. SIGIR","author":"Liebling","year":"2012"},{"key":"2026060107313023300_ref174","doi-asserted-by":"crossref","DOI":"10.18653\/v1\/D16-1230","article-title":"\u201cHow NOT to evaluate your dialogue system: An empirical study of unsupervised evaluation metrics for dialogue response generation\u201d","volume-title":"arXiv preprint","author":"Liu","year":"2016"},{"issue":"3","key":"2026060107313023300_ref175","doi-asserted-by":"crossref","first-page":"225","DOI":"10.1561\/1500000016","article-title":"\u201cLearning to Rank for Information Retrieval\u201d","volume":"3","author":"Liu","year":"2009","journal-title":"Foundations and Trends in Information Retrieval"},{"key":"2026060107313023300_ref176","first-page":"3","article-title":"\u201cLetor: Benchmark dataset for research on learning to rank for information retrieval\u201d","volume-title":"Proc. SIGIR Workshop on Learning to Rank","author":"Liu","year":"2007"},{"key":"2026060107313023300_ref177","doi-asserted-by":"crossref","DOI":"10.3115\/v1\/N15-1092","article-title":"\u201cRepresentation Learning Using Multi-Task Deep Neural Networks for Semantic Classification and Information Retrieval\u201d","volume-title":"Proc. NAACL","author":"Liu","year":"2015"},{"key":"2026060107313023300_ref178","first-page":"1367","article-title":"\u201cA deep architecture for matching short texts\u201d","volume-title":"Proc. NIPS","author":"Lu","year":"2013"},{"key":"2026060107313023300_ref179","volume-title":"Individual Choice Behavior: A Theoretical Analysis","author":"Luce","year":"1959"},{"issue":"2","key":"2026060107313023300_ref180","doi-asserted-by":"crossref","first-page":"203","DOI":"10.3758\/BF03204766","article-title":"\u201cProducing high-dimensional semantic spaces from lexical co-occurrence\u201d","volume":"28","author":"Lund","year":"1996","journal-title":"Behavior Research Methods, Instruments, & Computers"},{"key":"2026060107313023300_ref181","doi-asserted-by":"crossref","DOI":"10.18653\/v1\/D15-1166","article-title":"\u201cEffective approaches to attention-based neural machine translation\u201d","volume-title":"arXiv preprint","author":"Luong","year":"2015"},{"key":"2026060107313023300_ref182","article-title":"\u201cLstm-based predictions for proactive information retrieval\u201d","volume-title":"arXiv preprint","author":"Luukkonen","year":"2016"},{"key":"2026060107313023300_ref183","first-page":"2623","article-title":"\u201cMultimodal convolutional neural networks for matching image and sentence\u201d","volume-title":"Proc. ICCV","author":"Ma","year":"2015"},{"key":"2026060107313023300_ref184","first-page":"2579","article-title":"\u201cVisualizing data using t-SNE\u201d","volume":"9","author":"Maaten","year":"2008","journal-title":"Journal of Machine Learning Research"},{"issue":"3","key":"2026060107313023300_ref185","doi-asserted-by":"crossref","first-page":"289","DOI":"10.1017\/S1351324900000218","article-title":"\u201cA hierarchical Dirichlet language model\u201d","volume":"1","author":"MacKay","year":"1995","journal-title":"Natural Language Engineering"},{"issue":"1-2","key":"2026060107313023300_ref186","doi-asserted-by":"crossref","first-page":"114","DOI":"10.1093\/biomet\/44.1-2.114","article-title":"\u201cNon-null ranking models. I\u201d","volume":"44","author":"Mallows","year":"1957","journal-title":"Biometrika"},{"key":"2026060107313023300_ref187","first-page":"1","article-title":"\u201cUnderstanding Human Language: Can NLP and Deep Learning Help?\u201d","volume-title":"Proc. SIGIR","author":"Manning","year":"2016"},{"key":"2026060107313023300_ref188","doi-asserted-by":"crossref","DOI":"10.1017\/CBO9780511809071","volume-title":"Introduction to information retrieval","author":"Manning","year":"2008"},{"key":"2026060107313023300_ref189","volume-title":"Low rank approximation: algorithms, implementation, applications","author":"Markovsky","year":"2011"},{"key":"2026060107313023300_ref190","doi-asserted-by":"crossref","first-page":"437","DOI":"10.1145\/1148170.1148246","article-title":"\u201cHigh accuracy retrieval with multiple nested ranker\u201d","volume-title":"Proc. SIGIR","author":"Matveeva","year":"2006"},{"key":"2026060107313023300_ref191","doi-asserted-by":"crossref","first-page":"472","DOI":"10.1145\/1076034.1076115","article-title":"\u201cA Markov random field model for term dependencies\u201d","volume-title":"Proc. SIGIR","author":"Metzler","year":"2005"},{"key":"2026060107313023300_ref192","first-page":"16","article-title":"\u201cSimilarity measures for short segments of text\u201d","volume-title":"European Conference on Information Retrieval","author":"Metzler","year":"2007"},{"key":"2026060107313023300_ref193","first-page":"535","article-title":"\u201cProximity-based Rocchio\u2019s model for pseudo relevance\u201d","volume-title":"Proc. SIGIR","author":"Miao","year":"2012"},{"key":"2026060107313023300_ref194","article-title":"\u201cEfficient estimation of word representations in vector space\u201d","volume-title":"arXiv preprint","author":"Mikolov","year":"2013"},{"key":"2026060107313023300_ref195","first-page":"3","article-title":"\u201cRecurrent neural network based language model\u201d","volume-title":"Interspeech","author":"Mikolov","year":"2010"},{"key":"2026060107313023300_ref196","first-page":"5528","article-title":"\u201cExtensions of recurrent neural network language model\u201d","volume-title":"Proc. ICASSP","author":"Mikolov","year":"2011"},{"key":"2026060107313023300_ref197","first-page":"3111","article-title":"\u201cDistributed representations of words and phrases and their compositionality\u201d","volume-title":"Proc. NIPS","author":"Mikolov","year":"2013"},{"key":"2026060107313023300_ref198","first-page":"746","article-title":"\u201cLinguistic Regularities in Continuous Space Word Representations\u201d","volume-title":"Proc. HLT-NAACL","author":"Mikolov","year":"2013"},{"key":"2026060107313023300_ref199","first-page":"3","article-title":"\u201cExploring Session Context using Distributed Representations of Queries and Reformulations\u201d","volume-title":"Proc. SIGIR","author":"Mitra","year":"2015"},{"key":"2026060107313023300_ref200","doi-asserted-by":"crossref","DOI":"10.1145\/2806416.2806599","article-title":"\u201cQuery Auto-Completion for Rare Prefixes\u201d","volume-title":"Proc. CIKM","author":"Mitra","year":"2015"},{"key":"2026060107313023300_ref201","first-page":"813","article-title":"\u201cNeural Text Embeddings for Information Retrieval\u201d","volume-title":"Proc. WSDM","author":"Mitra","year":"2017"},{"key":"2026060107313023300_ref202","first-page":"1291","article-title":"\u201cLearning to Match Using Local and Distributed Representations of Text for Web Search\u201d","volume-title":"Proc. WWW","author":"Mitra","year":"2017"},{"key":"2026060107313023300_ref203","doi-asserted-by":"crossref","DOI":"10.1145\/3077136.3080650","article-title":"\u201cLuandri: a Clean Lua Interface to the Indri Search Engine\u201d","volume-title":"Proc. SIGIR","author":"Mitra","year":"2017"},{"key":"2026060107313023300_ref204","article-title":"\u201cA Dual Embedding Space Model for Document Ranking\u201d","volume-title":"arXiv preprint","author":"Mitra","year":"2016"},{"key":"2026060107313023300_ref205","first-page":"1055","article-title":"\u201cOn User Interactions with Query Auto-Completion\u201d","volume-title":"Proc. SIGIR","author":"Mitra","year":"2014"},{"key":"2026060107313023300_ref206","article-title":"\u201cA Proposal for Evaluating Answer Distillation from Web Data\u201d","volume-title":"Proc. SIGIR WebQA Workshop","author":"Mitra","year":"2016"},{"key":"2026060107313023300_ref207","first-page":"1081","article-title":"\u201cA scalable hierarchical distributed language model\u201d","volume-title":"Advances in Neural Information Processing Systems","author":"Mnih","year":"2009"},{"key":"2026060107313023300_ref208","article-title":"\u201cA fast and simple algorithm for training neural probabilistic language models\u201d","volume-title":"arXiv preprint","author":"Mnih","year":"2012"},{"key":"2026060107313023300_ref209","first-page":"2204","article-title":"\u201cRecurrent models of visual attention\u201d","volume-title":"Proc. NIPS","author":"Mnih","year":"2014"},{"issue":"7540","key":"2026060107313023300_ref210","doi-asserted-by":"crossref","first-page":"529","DOI":"10.1038\/nature14236","article-title":"\u201cHuman-level control through deep reinforcement learning\u201d","volume":"518","author":"Mnih","year":"2015","journal-title":"Nature"},{"key":"2026060107313023300_ref211","first-page":"2924","article-title":"\u201cOn the number of linear regions of deep neural networks\u201d","volume-title":"Proc. NIPS","author":"Montufar","year":"2014"},{"key":"2026060107313023300_ref212","first-page":"246","article-title":"\u201cHierarchical Probabilistic Neural Network Language Model\u201d","volume-title":"Proc. AISTATS","author":"Morin","year":"2005"},{"key":"2026060107313023300_ref213","first-page":"807","article-title":"\u201cRectified linear units improve restricted Boltzmann machines\u201d","volume-title":"Proc. ICML","author":"Nair","year":"2010"},{"key":"2026060107313023300_ref214","doi-asserted-by":"crossref","DOI":"10.1145\/2872518.2889361","article-title":"\u201cImproving Document Ranking with Dual Word Embeddings\u201d","volume-title":"Proc. WWW","author":"Nalisnick","year":"2016"},{"key":"2026060107313023300_ref215","doi-asserted-by":"crossref","DOI":"10.1145\/3121050.3121099","article-title":"\u201cBenchmark for Complex Answer Retrieval\u201d","volume-title":"Proc. ICTIR","author":"Nanni","year":"2017"},{"key":"2026060107313023300_ref216","article-title":"\u201cDyNet: The Dynamic Neural Network Toolkit\u201d","volume-title":"arXiv preprint","author":"Neubig","year":"2017"},{"key":"2026060107313023300_ref217","article-title":"\u201cToward a deep neural approach for knowledge-based IR\u201d","volume-title":"arXiv preprint","author":"Nguyen","year":"2016"},{"key":"2026060107313023300_ref218","article-title":"\u201cMS MARCO: A Human Generated MAchine Reading COmprehension Dataset\u201d","volume-title":"arXiv preprint","author":"Nguyen","year":"2016"},{"key":"2026060107313023300_ref219","first-page":"574","article-title":"\u201cTask-Oriented Query Reformulation with Reinforcement Learning\u201d","volume-title":"Proc. EMNLP","author":"Nogueira","year":"2017"},{"key":"2026060107313023300_ref220","first-page":"223","article-title":"\u201cCross-language information retrieval\u201d","volume":"33","author":"Oard","year":"1998","journal-title":"Annual Review of Information Science and Technology (ARIST)"},{"issue":"2-3","key":"2026060107313023300_ref221","doi-asserted-by":"crossref","first-page":"111","DOI":"10.1007\/s10791-017-9321-y","article-title":"\u201cNeural information retrieval: At the end of the early years\u201d","volume":"21","author":"Onal","year":"2018","journal-title":"Information Retrieval Journal"},{"key":"2026060107313023300_ref222","article-title":"\u201cSemantic Modelling with Long-Short-Term Memory for Information Retrieval\u201d","volume-title":"arXiv preprint","author":"Palangi","year":"2014"},{"key":"2026060107313023300_ref223","article-title":"\u201cDeep Sentence Embedding Using the Long Short Term Memory Network: Analysis and Application to Information Retrieval\u201d","volume-title":"arXiv preprint","author":"Palangi","year":"2015"},{"key":"2026060107313023300_ref224","article-title":"\u201cA study of matchpyramid models on ad-hoc retrieval\u201d","volume-title":"arXiv preprint","author":"Pang","year":"2016"},{"key":"2026060107313023300_ref225","doi-asserted-by":"crossref","DOI":"10.1609\/aaai.v30i1.10341","article-title":"\u201cText Matching as Image Recognition\u201d","volume-title":"Proc. AAAI","author":"Pang","year":"2016"},{"key":"2026060107313023300_ref226","doi-asserted-by":"crossref","DOI":"10.1145\/1146847.1146848","article-title":"\u201cA picture of search\u201d","volume-title":"Proc. InfoScale","author":"Pass","year":"2006"},{"key":"2026060107313023300_ref227","first-page":"1532","article-title":"\u201cGlove: Global vectors for word representation\u201d","volume-title":"Proc. EMNLP","author":"Pennington","year":"2014"},{"key":"2026060107313023300_ref228","doi-asserted-by":"crossref","first-page":"193","DOI":"10.2307\/2346567","article-title":"\u201cThe analysis of permutations\u201d","author":"Plackett","year":"1975","journal-title":"Applied Statistics"},{"key":"2026060107313023300_ref229","doi-asserted-by":"crossref","first-page":"275","DOI":"10.1145\/290941.291008","article-title":"\u201cA language modeling approach to information retrieval\u201d","volume-title":"Proc. SIGIR","author":"Ponte","year":"1998"},{"key":"2026060107313023300_ref230","article-title":"\u201cMore data usually beats better algorithms\u201d","volume-title":"Datawocky Blog","author":"Rajaraman","year":"2008"},{"key":"2026060107313023300_ref231","doi-asserted-by":"crossref","DOI":"10.18653\/v1\/D16-1264","article-title":"\u201cSquad: 100,000+ questions for machine comprehension of text\u201d","volume-title":"arXiv preprint","author":"Rajpurkar","year":"2016"},{"key":"2026060107313023300_ref232","first-page":"1137","article-title":"\u201cEfficient learning of sparse representations with an energy-based model\u201d","volume-title":"Proc. NIPS","author":"Ranzato","year":"2006"},{"key":"2026060107313023300_ref233","article-title":"\u201cStochastic backpropagation and approximate inference in deep generative models\u201d","volume-title":"Proc. ICML","author":"Rezende","year":"2014"},{"key":"2026060107313023300_ref234","article-title":"\u201cTheano: A Python framework for fast computation of mathematical expressions\u201d","volume-title":"arXiv preprint","author":"Al-Rfou","year":"2016"},{"key":"2026060107313023300_ref235","doi-asserted-by":"crossref","DOI":"10.18653\/v1\/D13-1020","article-title":"\u201cMCTest: A Challenge Dataset for the Open-Domain Machine Comprehension of Text\u201d","volume-title":"Proc. EMNLP","author":"Richardson","year":"2013"},{"key":"2026060107313023300_ref236","first-page":"603","article-title":"\u201cExtending average precision to graded relevance judgments\u201d","volume-title":"Proc. SIGIR","author":"Robertson","year":"2010"},{"key":"2026060107313023300_ref237","first-page":"73","article-title":"\u201cOkapi at TREC-4\u201d","volume-title":"Proc. TREC","author":"Robertson","year":"1996"},{"issue":"4","key":"2026060107313023300_ref238","first-page":"333","article-title":"\u201cThe probabilistic relevance framework: BM25 and beyond\u201d","volume":"3","author":"Robertson","year":"2009","journal-title":"Foundations and Trends in Information Retrieval"},{"key":"2026060107313023300_ref239","first-page":"42","article-title":"\u201cSimple BM25 extension to multiple weighted fields\u201d","volume-title":"Proc. CIKM","author":"Robertson","year":"2004"},{"key":"2026060107313023300_ref240","first-page":"627","article-title":"\u201cAn improved model of semantic similarity based on lexical co-occurrence\u201d","author":"Rohde","year":"2006","journal-title":"Communications of the ACM"},{"key":"2026060107313023300_ref241","article-title":"\u201cword2vec Parameter Learning Explained\u201d","volume-title":"arXiv preprint","author":"Rong","year":"2014"},{"key":"2026060107313023300_ref242","doi-asserted-by":"crossref","DOI":"10.1145\/3209978.3210127","article-title":"\u201cOptimizing Query Evaluations using Reinforcement Learning for Web Search\u201d","volume-title":"Proc. SIGIR","author":"Rosset","year":"2018"},{"key":"2026060107313023300_ref243","article-title":"\u201cUsing Word Embeddings for Automatic Query Expansion\u201d","volume-title":"arXiv preprint","author":"Roy","year":"2016"},{"key":"2026060107313023300_ref244","first-page":"59","article-title":"\u201cA metric for distributions with applications to image databases\u201d","volume-title":"Proc. Sixth International Conference on Computer Vision","author":"Rubner","year":"1998"},{"key":"2026060107313023300_ref245","article-title":"\u201cApproximating the Softmax for Learning Word Embeddings\u201d","volume-title":"sebastianruder.com\/word-embeddings-softmax\/","author":"Ruder","year":"2016"},{"issue":"3","key":"2026060107313023300_ref246","doi-asserted-by":"publisher","first-page":"211","DOI":"10.1007\/s11263-015-0816-y","article-title":"\u201cImageNet Large Scale Visual Recognition Challenge\u201d","volume":"115","author":"Russakovsky","year":"2015","journal-title":"International Journal of Computer Vision (IJCV)"},{"key":"2026060107313023300_ref247","unstructured":"Sahlgren\n              M\n            \n          \n          2006\n          \u201cThe Word-Space Model: Using distributional analysis to represent syntagmatic and paradigmatic relations between words in high-dimensional vector spaces\u201d\n          PhD thesis\n          Institutionen f\u00f6r lingvistik"},{"key":"2026060107313023300_ref248","first-page":"338","article-title":"\u201cLong short-term memory recurrent neural network architectures for large scale acoustic modeling\u201d","volume-title":"Proc. Interspeech","author":"Sak","year":"2014"},{"issue":"7","key":"2026060107313023300_ref249","doi-asserted-by":"crossref","first-page":"969","DOI":"10.1016\/j.ijar.2008.11.006","article-title":"\u201cSemantic hashing\u201d","volume":"50","author":"Salakhutdinov","year":"2009","journal-title":"International Journal of Approximate Reasoning"},{"key":"2026060107313023300_ref250","doi-asserted-by":"crossref","first-page":"85","DOI":"10.1016\/j.neunet.2014.09.003","article-title":"\u201cDeep learning in neural networks: An overview\u201d","volume":"61","author":"Schmidhuber","year":"2015","journal-title":"Neural Networks"},{"key":"2026060107313023300_ref251","first-page":"815","article-title":"\u201cFacenet: A unified embedding for face recognition and clustering\u201d","volume-title":"Proc. CVPR","author":"Schroff","year":"2015"},{"key":"2026060107313023300_ref252","unstructured":"Sen\u00e9cal\n              J-S\n            \n            \n              Bengio\n              Y\n            \n          \n          2003\n          \u201cAdaptive importance sampling to accelerate training of a neural probabilistic language model\u201d\n          Technical Report\n          IDIAP"},{"key":"2026060107313023300_ref253","first-page":"373","article-title":"\u201cLearning to rank short text pairs with convolutional deep neural networks\u201d","volume-title":"Proc. SIGIR","author":"Severyn","year":"2015"},{"key":"2026060107313023300_ref254","first-page":"255","article-title":"\u201cDeep Crossing: Web-scale modeling without manually crafted combinatorial features\u201d","volume-title":"Proc. SIGKDD","author":"Shan","year":"2016"},{"key":"2026060107313023300_ref255","first-page":"101","article-title":"\u201cA latent semantic model with convolutional-pooling structure for information retrieval\u201d","volume-title":"Proc. CIKM","author":"Shen","year":"2014"},{"key":"2026060107313023300_ref256","first-page":"373","article-title":"\u201cLearning semantic representations using convolutional neural networks for Web search\u201d","volume-title":"Proc. WWW","author":"Shen","year":"2014"},{"key":"2026060107313023300_ref257","doi-asserted-by":"crossref","DOI":"10.1109\/CCBD.2016.029","article-title":"\u201cBenchmarking State-of-the-Art Deep Learning Software Tools\u201d","volume-title":"arXiv preprint","author":"Shi","year":"2016"},{"key":"2026060107313023300_ref258","first-page":"695","article-title":"\u201cFrom queries to cards: Re-ranking proactive card recommendations based on reactive search history\u201d","volume-title":"Proc. SIGIR","author":"Shokouhi","year":"2015"},{"issue":"7587","key":"2026060107313023300_ref259","doi-asserted-by":"crossref","first-page":"484","DOI":"10.1038\/nature16961","article-title":"\u201cMastering the game of Go with deep neural networks and tree search\u201d","volume":"529","author":"Silver","year":"2016","journal-title":"Nature"},{"key":"2026060107313023300_ref260","first-page":"21","article-title":"\u201cPivoted document length normalization\u201d","volume-title":"Proc. SIGIR","author":"Singhal","year":"1996"},{"key":"2026060107313023300_ref261","first-page":"129","article-title":"\u201cParsing natural scenes and natural language with recursive neural networks\u201d","volume-title":"Proc. ICML","author":"Socher","year":"2011"},{"key":"2026060107313023300_ref262","first-page":"151","article-title":"\u201cSemi-supervised recursive autoencoders for predicting sentiment distributions\u201d","volume-title":"Proc. EMNLP","author":"Socher","year":"2011"},{"key":"2026060107313023300_ref263","first-page":"543","article-title":"\u201cQuery-less: Predicting task repetition for nextgen proactive search and recommendation engines\u201d","volume-title":"Proc. WWW","author":"Song","year":"2016"},{"key":"2026060107313023300_ref264","doi-asserted-by":"crossref","DOI":"10.1145\/2806416.2806493","article-title":"\u201cA Hierarchical Recurrent Encoder-Decoder for Generative Context-Aware Query Suggestion\u201d","volume-title":"arXiv preprint","author":"Sordoni","year":"2015"},{"key":"2026060107313023300_ref265","first-page":"196","article-title":"\u201cA neural network approach to context-sensitive generation of conversational responses\u201d","volume-title":"Proc. NAACL-HLT","author":"Sordoni","year":"2015"},{"issue":"1","key":"2026060107313023300_ref266","first-page":"1929","article-title":"\u201cDropout: A simple way to prevent neural networks from overfitting\u201d","volume":"15","author":"Srivastava","year":"2014","journal-title":"The Journal of Machine Learning Research"},{"key":"2026060107313023300_ref267","first-page":"2","article-title":"\u201cIndri: A language model-based search engine for complex queries\u201d","volume-title":"Proceedings of the International Conference on Intelligent Analysis","author":"Strohman","year":"2005"},{"issue":"6","key":"2026060107313023300_ref268","doi-asserted-by":"crossref","first-page":"1636","DOI":"10.1109\/TMM.2014.2330697","article-title":"\u201cA simple method to determine if a music information retrieval system is a \u201chorse\u201d\u201d","volume":"16","author":"Sturm","year":"2014","journal-title":"IEEE Transactions on Multimedia"},{"key":"2026060107313023300_ref269","first-page":"2440","article-title":"\u201cEnd-to-end memory networks\u201d","volume-title":"Proc. NIPS","author":"Sukhbaatar","year":"2015"},{"key":"2026060107313023300_ref270","first-page":"843","article-title":"\u201cRevisiting unreasonable effectiveness of data in deep learning era\u201d","volume-title":"IEEE International Conference on Computer Vision (ICCV)","author":"Sun","year":"2017"},{"key":"2026060107313023300_ref271","doi-asserted-by":"crossref","DOI":"10.3115\/v1\/P15-1014","article-title":"\u201cLearning word representations by jointly modeling syntagmatic and paradigmatic relations\u201d","volume-title":"Proc. ACL","author":"Sun","year":"2015"},{"key":"2026060107313023300_ref272","article-title":"\u201cSemantic Regularities in Document Representations\u201d","volume-title":"arXiv preprint","author":"Sun","year":"2016"},{"key":"2026060107313023300_ref273","first-page":"2915","article-title":"\u201cSparse word embeddings using l1 regularized online learning\u201d","volume-title":"Proc. IJCAI","author":"Sun","year":"2016"},{"key":"2026060107313023300_ref274","first-page":"1017","article-title":"\u201cGenerating text with recurrent neural networks\u201d","volume-title":"Proc. ICML","author":"Sutskever","year":"2011"},{"key":"2026060107313023300_ref275","first-page":"1","article-title":"\u201cGoing deeper with convolutions\u201d","volume-title":"Proc. CVPR","author":"Szegedy","year":"2015"},{"key":"2026060107313023300_ref276","article-title":"\u201cIntriguing properties of neural networks\u201d","volume-title":"arXiv preprint","author":"Szegedy","year":"2013"},{"key":"2026060107313023300_ref277","doi-asserted-by":"crossref","DOI":"10.3115\/v1\/P15-1150","article-title":"\u201cImproved semantic representations from tree-structured long short-term memory networks\u201d","volume-title":"arXiv preprint","author":"Tai","year":"2015"},{"key":"2026060107313023300_ref278","first-page":"585","article-title":"\u201cOptimisation methods for ranking functions with multiple parameters\u201d","volume-title":"Proc. CIKM","author":"Taylor","year":"2006"},{"key":"2026060107313023300_ref279","article-title":"\u201cThe information bottleneck method\u201d","volume-title":"arXiv preprint","author":"Tishby","year":"2000"},{"key":"2026060107313023300_ref280","article-title":"\u201cChainer: a next-generation open source framework for deep learning\u201d","volume-title":"Workshop on Machine Learning Systems (LearningSys), NIPS","author":"Tokui","year":"2015"},{"key":"2026060107313023300_ref281","doi-asserted-by":"crossref","first-page":"141","DOI":"10.1613\/jair.2934","article-title":"\u201cFrom frequency to meaning: Vector space models of semantics\u201d","volume":"37","author":"Turney","year":"2010","journal-title":"Journal of Artificial Intelligence Research"},{"key":"2026060107313023300_ref282","doi-asserted-by":"crossref","DOI":"10.1007\/978-3-319-56608-5_74","article-title":"\u201cPyndri: a Python Interface to the Indri Search Engine\u201d","volume-title":"arXiv preprint","author":"Van Gysel","year":"2017"},{"key":"2026060107313023300_ref283","doi-asserted-by":"crossref","DOI":"10.1145\/3132847.3132979","article-title":"\u201cReply With: Proactive Recommendation of Email Attachments\u201d","volume-title":"Proc. CIKM","author":"Van Gysel","year":"2017"},{"key":"2026060107313023300_ref284","first-page":"165","article-title":"\u201cLearning latent vector spaces for product search\u201d","volume-title":"Proc. CIKM","author":"Van Gysel","year":"2016"},{"key":"2026060107313023300_ref285","first-page":"1069","article-title":"\u201cUnsupervised, efficient and semantic expertise retrieval\u201d","volume-title":"Proc. WWW","author":"Van Gysel","year":"2016"},{"key":"2026060107313023300_ref286","article-title":"\u201cExtreme Classification 2015: The NIPS Workshop on Multi-class and Multi-label Learning in Extremely Large Label Spaces\u201d","volume-title":"Accessed June 7, 2017","author":"Varma","year":"2015"},{"key":"2026060107313023300_ref287","first-page":"1387","article-title":"\u201cDecoding with Large-Scale Neural Language Models Improves Translation\u201d","volume-title":"Proc. EMNLP","author":"Vaswani","year":"2013"},{"key":"2026060107313023300_ref288","article-title":"\u201cExact gradient updates in time independent of output size for the spherical loss family\u201d","volume-title":"arXiv preprint","author":"Vincent","year":"2016"},{"key":"2026060107313023300_ref289","first-page":"3630","article-title":"\u201cMatching networks for one shot learning\u201d","volume-title":"Proc. NIPS","author":"Vinyals","year":"2016"},{"key":"2026060107313023300_ref290","article-title":"\u201cA neural conversational model\u201d","volume-title":"ICML Deep Learning Workshop","author":"Vinyals","year":"2015"},{"key":"2026060107313023300_ref291","first-page":"1","article-title":"\u201cOverview of the eighth text retrieval conference (TREC-8)\u201d","volume-title":"TREC","author":"Voorhees","year":"2000"},{"key":"2026060107313023300_ref292","volume-title":"TREC: Experiment and evaluation in information retrieval","author":"Voorhees","year":"2005"},{"key":"2026060107313023300_ref293","doi-asserted-by":"crossref","first-page":"200","DOI":"10.1145\/345508.345577","article-title":"\u201cBuilding a question answering test collection\u201d","volume-title":"Proc. SIGIR","author":"Voorhees","year":"2000"},{"key":"2026060107313023300_ref294","first-page":"363","article-title":"\u201cMonolingual and cross-lingual information retrieval models based on (bilingual) word embeddings\u201d","volume-title":"Proc. SIGIR","author":"Vulic","year":"2015"},{"key":"2026060107313023300_ref295","article-title":"\u201cA deep architecture for semantic matching with multiple positional sentence representations\u201d","volume-title":"arXiv preprint","author":"Wan","year":"2015"},{"key":"2026060107313023300_ref296","article-title":"\u201cMatch-SRNN: Modeling the recursive matching structure with spatial rnn\u201d","volume-title":"arXiv preprint","author":"Wan","year":"2016"},{"issue":"18","key":"2026060107313023300_ref297","doi-asserted-by":"crossref","first-page":"3718","DOI":"10.1016\/j.ins.2007.02.045","article-title":"\u201cA novel document similarity measure based on earth mover\u2019s distance\u201d","volume":"177","author":"Wan","year":"2007","journal-title":"Information Sciences"},{"key":"2026060107313023300_ref298","first-page":"301","article-title":"\u201cThe earth mover\u2019s distance as a semantic measure for document similarity\u201d","volume-title":"Proc. CIKM","author":"Wan","year":"2005"},{"key":"2026060107313023300_ref299","doi-asserted-by":"crossref","DOI":"10.1145\/3077136.3080786","article-title":"\u201cIRGAN: A Minimax Game for Unifying Generative and Discriminative Information Retrieval Models\u201d","volume-title":"arXiv preprint","author":"Wang","year":"2017"},{"key":"2026060107313023300_ref300","first-page":"105","article-title":"\u201cA cascade ranking model for efficient ranked retrieval\u201d","volume-title":"Proc. SIGIR","author":"Wang","year":"2011"},{"key":"2026060107313023300_ref301","article-title":"\u201cTowards ai-complete question answering: A set of prerequisite toy tasks\u201d","volume-title":"arXiv preprint","author":"Weston","year":"2015"},{"key":"2026060107313023300_ref302","article-title":"\u201cMemory networks\u201d","volume-title":"arXiv preprint","author":"Weston","year":"2014"},{"key":"2026060107313023300_ref303","doi-asserted-by":"crossref","DOI":"10.1017\/CBO9781139525305","volume-title":"Interactions with search systems","author":"White","year":"2016"},{"key":"2026060107313023300_ref304","article-title":"\u201cDatasets Over Algorithms\u201d","author":"Wissner-Gross","year":"2016"},{"issue":"3","key":"2026060107313023300_ref305","doi-asserted-by":"crossref","first-page":"254","DOI":"10.1007\/s10791-009-9112-1","article-title":"\u201cAdapting boosting for information retrieval measures\u201d","volume":"13","author":"Wu","year":"2010","journal-title":"Information Retrieval"},{"key":"2026060107313023300_ref306","first-page":"1192","article-title":"\u201cListwise approach to learning to rank: theory and algorithm\u201d","volume-title":"Proc. ICML","author":"Xia","year":"2008"},{"key":"2026060107313023300_ref307","first-page":"395","article-title":"\u201cModeling Document Novelty with Neural Tensor Network for Search Result Diversification\u201d","volume-title":"Proc. SIGIR","author":"Xia","year":"2016"},{"key":"2026060107313023300_ref308","first-page":"1238","article-title":"\u201cLocality in search engine queries and its implications for caching\u201d","volume-title":"INFOCOM","author":"Xie","year":"2002"},{"key":"2026060107313023300_ref309","first-page":"2048","article-title":"\u201cShow, attend and tell: Neural image caption generation with visual attention\u201d","volume-title":"Proc. ICML","author":"Xu","year":"2015"},{"key":"2026060107313023300_ref310","first-page":"55","article-title":"\u201cLearning to respond with deep neural networks for retrieval-based human-computer conversation system\u201d","volume-title":"Proc. SIGIR","author":"Yan","year":"2016"},{"key":"2026060107313023300_ref311","doi-asserted-by":"crossref","DOI":"10.1137\/1.9781611972832.83","article-title":"\u201cLearning topics in short texts by non-negative matrix factorization on term correlation matrix\u201d","volume-title":"SIAM International Conference on Data Mining","author":"Yan","year":"2013"},{"key":"2026060107313023300_ref312","first-page":"287","article-title":"\u201caNMM: Ranking Short Answer Texts with Attention-Based Neural Matching Model\u201d","volume-title":"Proc. CIKM","author":"Yang","year":"2016"},{"key":"2026060107313023300_ref313","first-page":"2013","article-title":"\u201cWikiQA: A Challenge Dataset for Open-Domain Question Answering\u201d","volume-title":"Proc. EMNLP","author":"Yang","year":"2015"},{"key":"2026060107313023300_ref314","first-page":"247","article-title":"\u201cLearning discriminative projections for text similarity measures\u201d","volume-title":"Proc. CoNLL","author":"Yih","year":"2011"},{"key":"2026060107313023300_ref315","article-title":"\u201cABCNN: Attention-based convolutional neural network for modeling sentence pairs\u201d","volume-title":"arXiv preprint","author":"Yin","year":"2015"},{"key":"2026060107313023300_ref316","article-title":"\u201cAn introduction to computational networks and the computational network toolkit\u201d","author":"Yu","year":"2014"},{"key":"2026060107313023300_ref317","article-title":"\u201cOn using simultaneous perturbation stochastic approximation for IR measures, and the empirical optimality of LambdaRank\u201d","volume-title":"NIPS Machine Learning for Web Search Workshop","author":"Yue","year":"2007"},{"key":"2026060107313023300_ref318","doi-asserted-by":"crossref","first-page":"271","DOI":"10.1145\/1277741.1277790","article-title":"\u201cA support vector method for optimizing average precision\u201d","volume-title":"Proc. SIGIR","author":"Yue","year":"2007"},{"key":"2026060107313023300_ref319","first-page":"147","article-title":"\u201cEmbedding-based query language models\u201d","volume-title":"Proc. ICTIR","author":"Zamani","year":"2016"},{"key":"2026060107313023300_ref320","first-page":"123","article-title":"\u201cEstimating embedding vectors for queries\u201d","volume-title":"Proc. ICTIR","author":"Zamani","year":"2016"},{"key":"2026060107313023300_ref321","doi-asserted-by":"crossref","DOI":"10.1145\/3159652.3159730","article-title":"\u201cNeural Ranking Models with Multiple Document Fields\u201d","volume-title":"Proc. WSDM","author":"Zamani","year":"2018"},{"key":"2026060107313023300_ref322","first-page":"1","article-title":"\u201cMicrosoft Cambridge at TREC 13: Web and Hard Tracks\u201d","volume-title":"TREC","author":"Zaragoza","year":"2004"},{"key":"2026060107313023300_ref323","doi-asserted-by":"crossref","first-page":"334","DOI":"10.1145\/383952.384019","article-title":"\u201cA study of smoothing methods for language models applied to ad hoc information retrieval\u201d","volume-title":"Proc. SIGIR","author":"Zhai","year":"2001"},{"key":"2026060107313023300_ref324","article-title":"\u201cUnderstanding deep learning requires rethinking generalization\u201d","volume-title":"arXiv preprint","author":"Zhang","year":"2016"},{"key":"2026060107313023300_ref325","article-title":"\u201cSelf-Adaptive Hierarchical Sentence Model\u201d","volume-title":"arXiv preprint","author":"Zhao","year":"2015"},{"key":"2026060107313023300_ref326","first-page":"575","article-title":"\u201cLearning to Reweight Terms with Distributed Representations\u201d","volume-title":"Proc. SIGIR","author":"Zheng","year":"2015"},{"key":"2026060107313023300_ref327","doi-asserted-by":"crossref","DOI":"10.18653\/v1\/D16-1036","article-title":"\u201cMulti-view response selection for human-computer conversation\u201d","volume-title":"Proc. EMNLP","author":"Zhou","year":"2016"},{"key":"2026060107313023300_ref328","article-title":"\u201cRecall, precision and average precision\u201d","volume-title":"Department of Statistics and Actuarial Science, University of Waterloo","author":"Zhu","year":"2004"},{"key":"2026060107313023300_ref329","first-page":"1217","article-title":"\u201cSimple, fast noise-contrastive estimation for large rnn vocabularies\u201d","volume-title":"Proc. NAACL-HLT","author":"Zoph","year":"2016"},{"key":"2026060107313023300_ref330","doi-asserted-by":"crossref","first-page":"12","DOI":"10.1145\/2838931.2838936","article-title":"\u201cIntegrating and evaluating neural word embeddings in information retrieval\u201d","volume-title":"Proc. ADCS","author":"Zuccon","year":"2015"},{"key":"2026060107313023300_ref331","first-page":"8237","article-title":"\u201cSpeed regularization and optimality in word classing\u201d","volume-title":"ICASSP 2013 IEEE International Conference on Acoustics, Speech and Signal Processing","author":"Zweig","year":"2013"}],"container-title":["Foundations and Trends\u00ae in Information Retrieval"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/www.emerald.com\/ftinr\/article-pdf\/13\/1\/1\/11048187\/1500000061en.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"syndication"},{"URL":"https:\/\/www.emerald.com\/ftinr\/article-pdf\/13\/1\/1\/11048187\/1500000061en.pdf","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,6,1]],"date-time":"2026-06-01T11:32:31Z","timestamp":1780313551000},"score":1,"resource":{"primary":{"URL":"https:\/\/www.emerald.com\/ftinr\/article\/13\/1\/1\/1328679\/An-Introduction-to-Neural-Information-Retrieval"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2018,12,23]]},"references-count":331,"journal-issue":{"issue":"1","published-print":{"date-parts":[[2018,12,23]]}},"URL":"https:\/\/doi.org\/10.1561\/1500000061","relation":{},"ISSN":["1554-0669","1554-0677"],"issn-type":[{"value":"1554-0669","type":"print"},{"value":"1554-0677","type":"electronic"}],"subject":[],"published":{"date-parts":[[2018,12,23]]}}}