{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2021:BX4DKBUB7TRY7GBCXRHHHGFZX3","short_pith_number":"pith:BX4DKBUB","schema_version":"1.0","canonical_sha256":"0df8350681fce38f9822bc4e7398b9bef910208805508c06a50ca8df2d361e53","source":{"kind":"arxiv","id":"2108.13897","version":5},"attestation_state":"computed","paper":{"title":"mMARCO: A Multilingual Version of the MS MARCO Passage Ranking Dataset","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.CL","authors_text":"Hugo Queiroz Abonizio, Israel Campiotti, Luiz Bonifacio, Marzieh Fadaee, Roberto Lotufo, Rodrigo Nogueira, Vitor Jeronymo","submitted_at":"2021-08-31T14:53:37Z","abstract_excerpt":"The MS MARCO ranking dataset has been widely used for training deep learning models for IR tasks, achieving considerable effectiveness on diverse zero-shot scenarios. However, this type of resource is scarce in languages other than English. In this work, we present mMARCO, a multilingual version of the MS MARCO passage ranking dataset comprising 13 languages that was created using machine translation. We evaluated mMARCO by finetuning monolingual and multilingual reranking models, as well as a multilingual dense retrieval model on this dataset. We also evaluated models finetuned using the mMAR"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2108.13897","kind":"arxiv","version":5},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CL","submitted_at":"2021-08-31T14:53:37Z","cross_cats_sorted":["cs.AI"],"title_canon_sha256":"2de63d843651eb4632477ef6f6e2f4d4a6006c130fce0029c836559af69e002b","abstract_canon_sha256":"1435b3838da85fccde469d4fbf9f05dfa65b226c9d1ac84e3ae723f6b5c43039"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T04:49:21.326069Z","signature_b64":"S3jmtrFQRwFBkpeFUC92PjN0xLFHIbAhjKRAC34uUCTubzIAa2cOhGWjUn/DBfmCvM+KOneE7F4hcnaFDb28Bw==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"0df8350681fce38f9822bc4e7398b9bef910208805508c06a50ca8df2d361e53","last_reissued_at":"2026-07-05T04:49:21.325670Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T04:49:21.325670Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"mMARCO: A Multilingual Version of the MS MARCO Passage Ranking Dataset","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.CL","authors_text":"Hugo Queiroz Abonizio, Israel Campiotti, Luiz Bonifacio, Marzieh Fadaee, Roberto Lotufo, Rodrigo Nogueira, Vitor Jeronymo","submitted_at":"2021-08-31T14:53:37Z","abstract_excerpt":"The MS MARCO ranking dataset has been widely used for training deep learning models for IR tasks, achieving considerable effectiveness on diverse zero-shot scenarios. However, this type of resource is scarce in languages other than English. In this work, we present mMARCO, a multilingual version of the MS MARCO passage ranking dataset comprising 13 languages that was created using machine translation. We evaluated mMARCO by finetuning monolingual and multilingual reranking models, as well as a multilingual dense retrieval model on this dataset. We also evaluated models finetuned using the mMAR"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2108.13897","kind":"arxiv","version":5},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2108.13897/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2108.13897","created_at":"2026-07-05T04:49:21.325729+00:00"},{"alias_kind":"arxiv_version","alias_value":"2108.13897v5","created_at":"2026-07-05T04:49:21.325729+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2108.13897","created_at":"2026-07-05T04:49:21.325729+00:00"},{"alias_kind":"pith_short_12","alias_value":"BX4DKBUB7TRY","created_at":"2026-07-05T04:49:21.325729+00:00"},{"alias_kind":"pith_short_16","alias_value":"BX4DKBUB7TRY7GBC","created_at":"2026-07-05T04:49:21.325729+00:00"},{"alias_kind":"pith_short_8","alias_value":"BX4DKBUB","created_at":"2026-07-05T04:49:21.325729+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":15,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2604.21511","citing_title":"From Tokens to Concepts: Leveraging SAE for SPLADE","ref_index":3,"is_internal_anchor":false},{"citing_arxiv_id":"2606.22807","citing_title":"KaLM-Reranker-V1: Fast but Not Late Interaction for Compressed Document Reranking","ref_index":3,"is_internal_anchor":false},{"citing_arxiv_id":"2606.22722","citing_title":"moBERTo: A Modern Encoder for Portuguese via Continued Pretraining of ModernBERT","ref_index":5,"is_internal_anchor":false},{"citing_arxiv_id":"2606.13537","citing_title":"When Does Mixing Help? Analyzing Query Embedding Interpolation in Multilingual Dense Retrieval","ref_index":27,"is_internal_anchor":false},{"citing_arxiv_id":"2606.01995","citing_title":"CARTE: A Benchmark for Mapping Language Model Knowledge Across France","ref_index":2,"is_internal_anchor":false},{"citing_arxiv_id":"2606.30473","citing_title":"Field Order Should Not Matter: Permutation-Invariant Embedding Model Fine-Tuning for Structured Metadata Retrieval","ref_index":2,"is_internal_anchor":false},{"citing_arxiv_id":"2605.29502","citing_title":"Source-Grounded Semantic Reinforcement Learning for Low-Resource Target-Language Generation","ref_index":1,"is_internal_anchor":false},{"citing_arxiv_id":"2606.01304","citing_title":"When Hard Negatives Hurt: Bridging the Generative-Discriminative Gap in Hard Negative Synthesis for Retrieval","ref_index":3,"is_internal_anchor":false},{"citing_arxiv_id":"2309.07597","citing_title":"C-Pack: Packed Resources For General Chinese Embeddings","ref_index":10,"is_internal_anchor":false},{"citing_arxiv_id":"2402.03216","citing_title":"M3-Embedding: Multi-Linguality, Multi-Functionality, Multi-Granularity Text Embeddings Through Self-Knowledge Distillation","ref_index":64,"is_internal_anchor":false},{"citing_arxiv_id":"2604.23396","citing_title":"Lost in Decoding? Reproducing and Stress-Testing the Look-Ahead Prior in Generative Retrieval","ref_index":2,"is_internal_anchor":false},{"citing_arxiv_id":"2604.21511","citing_title":"From Tokens to Concepts: Leveraging SAE for SPLADE","ref_index":3,"is_internal_anchor":false},{"citing_arxiv_id":"2604.20199","citing_title":"All Languages Matter: Understanding and Mitigating Language Bias in Multilingual RAG","ref_index":5,"is_internal_anchor":false},{"citing_arxiv_id":"2604.13721","citing_title":"FRAGATA: Semantic Retrieval of HPC Support Tickets via Hybrid RAG over 20 Years of Request Tracker History","ref_index":14,"is_internal_anchor":false},{"citing_arxiv_id":"2604.14448","citing_title":"MARCA: A Checklist-Based Benchmark for Multilingual Web Search","ref_index":5,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/BX4DKBUB7TRY7GBCXRHHHGFZX3","json":"https://pith.science/pith/BX4DKBUB7TRY7GBCXRHHHGFZX3.json","graph_json":"https://pith.science/api/pith-number/BX4DKBUB7TRY7GBCXRHHHGFZX3/graph.json","events_json":"https://pith.science/api/pith-number/BX4DKBUB7TRY7GBCXRHHHGFZX3/events.json","paper":"https://pith.science/paper/BX4DKBUB"},"agent_actions":{"view_html":"https://pith.science/pith/BX4DKBUB7TRY7GBCXRHHHGFZX3","download_json":"https://pith.science/pith/BX4DKBUB7TRY7GBCXRHHHGFZX3.json","view_paper":"https://pith.science/paper/BX4DKBUB","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2108.13897&json=true","fetch_graph":"https://pith.science/api/pith-number/BX4DKBUB7TRY7GBCXRHHHGFZX3/graph.json","fetch_events":"https://pith.science/api/pith-number/BX4DKBUB7TRY7GBCXRHHHGFZX3/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/BX4DKBUB7TRY7GBCXRHHHGFZX3/action/timestamp_anchor","attest_storage":"https://pith.science/pith/BX4DKBUB7TRY7GBCXRHHHGFZX3/action/storage_attestation","attest_author":"https://pith.science/pith/BX4DKBUB7TRY7GBCXRHHHGFZX3/action/author_attestation","sign_citation":"https://pith.science/pith/BX4DKBUB7TRY7GBCXRHHHGFZX3/action/citation_signature","submit_replication":"https://pith.science/pith/BX4DKBUB7TRY7GBCXRHHHGFZX3/action/replication_record"}},"created_at":"2026-07-05T04:49:21.325729+00:00","updated_at":"2026-07-05T04:49:21.325729+00:00"}