{"as_of":"2026-08-09T07:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c11e81c1ae66c2a41f1bb7e526eb20a72c494aa6ac274e2721c6503825af3c3e","coverage":[{"denominator":30,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":30,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T11:20:23.727254Z","state":"measured"},{"denominator":46,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":46,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":16,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":16,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T04:09:37.299547Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":2,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.07972","last_updated":"2025-03-09T19:39:00Z","snapshot_observed_at":"2026-08-09T03:34:52.654329Z","submitted_at":"2025-02-11T21:36:31Z","title":"Training Sparse Mixture Of Experts Text Embedding Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.07972","snapshot_observed_at":"2026-08-07T04:09:37.299547Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.17277","last_updated":"2025-06-13T07:44:53Z","snapshot_observed_at":"2026-08-08T06:02:29.925753Z","submitted_at":"2025-06-13T07:44:53Z","title":"Chunk Twice, Embed Once: A Systematic Study of Segmentation and Representation Trade-offs in Chemistry-Aware Retrieval-Augmented Generation","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T04:09:37.299547Z"},"links":{"cited_paper":"/paper/2502.07972","citing_paper":"/paper/2506.17277"},"observation_digest":"sha256:30e98a8c62ccc61589dc25751b3699a22c6c1eb2551a0de1d9c5fa32892ebad2","observation_id":"cf30f101-c72a-4ed6-b41e-2791dd8ea6ae","resolution":{"observed_at":"2026-08-07T04:09:37.299547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07972","last_updated":"2025-03-09T19:39:00Z","snapshot_observed_at":"2026-08-09T03:34:52.654329Z","submitted_at":"2025-02-11T21:36:31Z","title":"Training Sparse Mixture Of Experts Text Embedding Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.07972","snapshot_observed_at":"2026-07-13T23:39:49.137616Z","title":"Nasrin Mostafazadeh, Nathanael Chambers, Xiaodong He, Devi Parikh, Dhruv Batra, Lucy Vanderwende, Pushmeet Kohli, and James Allen","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.16606","last_updated":"2026-06-18T13:24:02Z","snapshot_observed_at":"2026-08-08T10:09:47.933243Z","submitted_at":"2026-03-17T14:47:35Z","title":"Omnilingual SONAR: Cross-Lingual and Cross-Modal Sentence Embeddings Bridging Massively Multilingual Text and Speech","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-13T23:39:49.137616Z"},"links":{"cited_paper":"/paper/2502.07972","citing_paper":"/paper/2603.16606"},"observation_digest":"sha256:279f334782c093f2dce9d7276bfd2b68782f2c26c4eb49ffc6cb85d4df2afb40","observation_id":"1b3793eb-ed4f-4d12-aec5-b970042b738d","resolution":{"observed_at":"2026-07-13T23:39:49.137616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07972","last_updated":"2025-03-09T19:39:00Z","snapshot_observed_at":"2026-08-09T03:34:52.654329Z","submitted_at":"2025-02-11T21:36:31Z","title":"Training Sparse Mixture Of Experts Text Embedding Models","version":3},"cited_work":{"arxiv_id":"2502.07972","doi":"10.48550/arxiv.2502.07972","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.07972","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Training sparse mixture of experts text embedding models","venue":"ArXiv.org","work_id":"1ce6690d-657f-4536-9802-8c3836a550a2","year":2023},"citing_paper":{"arxiv_id":"2603.19339","last_updated":"2026-04-16T18:51:00Z","snapshot_observed_at":"2026-08-02T16:21:04.224971Z","submitted_at":"2026-03-19T10:01:32Z","title":"Spectral Tempering for Embedding Compression in Dense Passage Retrieval","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-15T08:57:36.201292Z"},"links":{"cited_paper":"/paper/2502.07972","citing_paper":"/paper/2603.19339"},"observation_digest":"sha256:dbd938c34868d3a45806256f138c101c947035720150bc3702a8e928cf634b6d","observation_id":"a4b88bf4-009f-4bb4-901f-07fabc116c9d","resolution":{"observed_at":"2026-05-15T08:59:53.119783Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07972","last_updated":"2025-03-09T19:39:00Z","snapshot_observed_at":"2026-08-09T03:34:52.654329Z","submitted_at":"2025-02-11T21:36:31Z","title":"Training Sparse Mixture Of Experts Text Embedding Models","version":3},"cited_work":{"arxiv_id":"2502.07972","doi":"10.48550/arxiv.2502.07972","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.07972","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Training sparse mixture of experts text embedding models","venue":"ArXiv.org","work_id":"1ce6690d-657f-4536-9802-8c3836a550a2","year":2023},"citing_paper":{"arxiv_id":"2604.16380","last_updated":"2026-03-25T13:30:40Z","snapshot_observed_at":"2026-08-08T06:45:13.140900Z","submitted_at":"2026-03-25T13:30:40Z","title":"Data Mixing for Large Language Models Pretraining: A Survey and Outlook","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-15T00:56:04.958757Z"},"links":{"cited_paper":"/paper/2502.07972","citing_paper":"/paper/2604.16380"},"observation_digest":"sha256:4698c61c752aa6c786d71411e4519ab5a8d4bd7963e1fef24703fbec6d44ebf3","observation_id":"fead9e2f-4eb9-416e-ab81-37ddf4c1d24e","resolution":{"observed_at":"2026-05-15T00:58:25.729802Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07972","last_updated":"2025-03-09T19:39:00Z","snapshot_observed_at":"2026-08-09T03:34:52.654329Z","submitted_at":"2025-02-11T21:36:31Z","title":"Training Sparse Mixture Of Experts Text Embedding Models","version":3},"cited_work":{"arxiv_id":"2502.07972","doi":"10.48550/arxiv.2502.07972","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.07972","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Training sparse mixture of experts text embedding models","venue":"ArXiv.org","work_id":"1ce6690d-657f-4536-9802-8c3836a550a2","year":2023},"citing_paper":{"arxiv_id":"2604.23396","last_updated":"2026-04-25T17:58:15Z","snapshot_observed_at":"2026-08-02T23:57:54.344932Z","submitted_at":"2026-04-25T17:58:15Z","title":"Lost in Decoding? Reproducing and Stress-Testing the Look-Ahead Prior in Generative Retrieval","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-08T07:29:33.327173Z"},"links":{"cited_paper":"/paper/2502.07972","citing_paper":"/paper/2604.23396"},"observation_digest":"sha256:18fe55c378cba41cc6c516c6378dc0ff7e7740a58c62591ee904adc70af46d58","observation_id":"a5ae6bb7-866e-4369-a067-e1f3bcc68389","resolution":{"observed_at":"2026-05-11T21:01:11.205185Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07972","last_updated":"2025-03-09T19:39:00Z","snapshot_observed_at":"2026-08-09T03:34:52.654329Z","submitted_at":"2025-02-11T21:36:31Z","title":"Training Sparse Mixture Of Experts Text Embedding Models","version":3},"cited_work":{"arxiv_id":"2502.07972","doi":"10.48550/arxiv.2502.07972","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.07972","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Training sparse mixture of experts text embedding models","venue":"ArXiv.org","work_id":"1ce6690d-657f-4536-9802-8c3836a550a2","year":2023},"citing_paper":{"arxiv_id":"2605.22247","last_updated":"2026-05-21T09:53:10Z","snapshot_observed_at":"2026-08-02T04:29:27.946498Z","submitted_at":"2026-05-21T09:53:10Z","title":"IdioLink: Retrieving Meaning Beyond Words Across Idiomatic and Literal Expressions","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-05-22T06:01:40.472586Z"},"links":{"cited_paper":"/paper/2502.07972","citing_paper":"/paper/2605.22247"},"observation_digest":"sha256:3088916f55b49c77fbf0d1902c89cd0dd6907fb536498576600757faeb9bb8a9","observation_id":"575c7cdd-479d-4de9-97d1-2b58a10fb72a","resolution":{"observed_at":"2026-05-22T06:04:39.687344Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07972","last_updated":"2025-03-09T19:39:00Z","snapshot_observed_at":"2026-08-09T03:34:52.654329Z","submitted_at":"2025-02-11T21:36:31Z","title":"Training Sparse Mixture Of Experts Text Embedding Models","version":3},"cited_work":{"arxiv_id":"2502.07972","doi":"10.48550/arxiv.2502.07972","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.07972","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Training sparse mixture of experts text embedding models","venue":"ArXiv.org","work_id":"1ce6690d-657f-4536-9802-8c3836a550a2","year":2023},"citing_paper":{"arxiv_id":"2606.04300","last_updated":"2026-06-03T00:08:44Z","snapshot_observed_at":"2026-07-06T23:44:28.265478Z","submitted_at":"2026-06-03T00:08:44Z","title":"Argus-Retriever: Vision-LLM Late-Interaction Retrieval with Region-Aware Query-Conditioned MoE for Visual Document Retrieval","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-06-28T04:55:04.299049Z"},"links":{"cited_paper":"/paper/2502.07972","citing_paper":"/paper/2606.04300"},"observation_digest":"sha256:c3856f76aeae09aa9c9225695d5e4a0c2749c19116b72ca0daf36b2fe92c1d5f","observation_id":"631b43b3-3bbc-42d6-9e44-d7b5de9b8e34","resolution":{"observed_at":"2026-07-02T10:46:52.608682Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07972","last_updated":"2025-03-09T19:39:00Z","snapshot_observed_at":"2026-08-09T03:34:52.654329Z","submitted_at":"2025-02-11T21:36:31Z","title":"Training Sparse Mixture Of Experts Text Embedding Models","version":3},"cited_work":{"arxiv_id":"2502.07972","doi":"10.48550/arxiv.2502.07972","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.07972","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Training sparse mixture of experts text embedding models","venue":"ArXiv.org","work_id":"1ce6690d-657f-4536-9802-8c3836a550a2","year":2023},"citing_paper":{"arxiv_id":"2606.09362","last_updated":"2026-06-08T11:35:34Z","snapshot_observed_at":"2026-08-06T21:55:04.906486Z","submitted_at":"2026-06-08T11:35:34Z","title":"Zero-Shot Semantic Re-Identification for Autonomous Driving: A VLM Baseline Study","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-27T16:51:22.211807Z"},"links":{"cited_paper":"/paper/2502.07972","citing_paper":"/paper/2606.09362"},"observation_digest":"sha256:a6922bc1025d2a668fd3a82d02e8ad4cf221eb844fa37b745e10adb32312961f","observation_id":"502e1960-b713-4c04-a950-739d6c4bf0dd","resolution":{"observed_at":"2026-07-03T00:57:30.713888Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07972","last_updated":"2025-03-09T19:39:00Z","snapshot_observed_at":"2026-08-09T03:34:52.654329Z","submitted_at":"2025-02-11T21:36:31Z","title":"Training Sparse Mixture Of Experts Text Embedding Models","version":3},"cited_work":{"arxiv_id":"2502.07972","doi":"10.48550/arxiv.2502.07972","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.07972","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Training sparse mixture of experts text embedding models","venue":"ArXiv.org","work_id":"1ce6690d-657f-4536-9802-8c3836a550a2","year":2023},"citing_paper":{"arxiv_id":"2606.13647","last_updated":"2026-06-11T17:50:06Z","snapshot_observed_at":"2026-08-06T22:05:17.004764Z","submitted_at":"2026-06-11T17:50:06Z","title":"SkMTEB: Slovak Massive Text Embedding Benchmark and Model Adaptation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-27T06:39:16.607939Z"},"links":{"cited_paper":"/paper/2502.07972","citing_paper":"/paper/2606.13647"},"observation_digest":"sha256:e57e605cabcc8db356b471c2f96fbaf46a9a1af81826457df1716f4f771a1e2a","observation_id":"1825692e-eda8-4721-8ae2-3d96854d9c11","resolution":{"observed_at":"2026-07-03T15:08:33.561685Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07972","last_updated":"2025-03-09T19:39:00Z","snapshot_observed_at":"2026-08-09T03:34:52.654329Z","submitted_at":"2025-02-11T21:36:31Z","title":"Training Sparse Mixture Of Experts Text Embedding Models","version":3},"cited_work":{"arxiv_id":"2502.07972","doi":"10.48550/arxiv.2502.07972","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.07972","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Training sparse mixture of experts text embedding models","venue":"ArXiv.org","work_id":"1ce6690d-657f-4536-9802-8c3836a550a2","year":2023},"citing_paper":{"arxiv_id":"2606.18103","last_updated":"2026-06-16T16:03:37Z","snapshot_observed_at":"2026-07-31T18:22:23.981249Z","submitted_at":"2026-06-16T16:03:37Z","title":"HistoRAG: Embedding Historical Methodology in Retrieval-Augmented Generation Through Critical Technical Practice","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-06-27T00:26:05.175925Z"},"links":{"cited_paper":"/paper/2502.07972","citing_paper":"/paper/2606.18103"},"observation_digest":"sha256:4f1555677b5f904c43da9e4825a8aa8a67641afbe4ad373f3da032994b6e1592","observation_id":"466197c9-5be8-425e-a487-465b1a8bfe9d","resolution":{"observed_at":"2026-06-27T00:30:16.214827Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07972","last_updated":"2025-03-09T19:39:00Z","snapshot_observed_at":"2026-08-09T03:34:52.654329Z","submitted_at":"2025-02-11T21:36:31Z","title":"Training Sparse Mixture Of Experts Text Embedding Models","version":3},"cited_work":{"arxiv_id":"2502.07972","doi":"10.48550/arxiv.2502.07972","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.07972","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Training sparse mixture of experts text embedding models","venue":"ArXiv.org","work_id":"1ce6690d-657f-4536-9802-8c3836a550a2","year":2023},"citing_paper":{"arxiv_id":"2606.29068","last_updated":"2026-06-27T20:09:05Z","snapshot_observed_at":"2026-07-07T00:03:07.870153Z","submitted_at":"2026-06-27T20:09:05Z","title":"A Comparative Study on Affective Cues in Text Embeddings Across Psychological Emotion Theories","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-30T09:19:10.305679Z"},"links":{"cited_paper":"/paper/2502.07972","citing_paper":"/paper/2606.29068"},"observation_digest":"sha256:6d541b3bea4b8b7e4ea134fce520c07391e7722224ac1a90ea5fdba919ed9539","observation_id":"2ad7d3b8-87b4-40f2-a4c2-f6df9bb53879","resolution":{"observed_at":"2026-06-30T09:24:31.783236Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07972","last_updated":"2025-03-09T19:39:00Z","snapshot_observed_at":"2026-08-09T03:34:52.654329Z","submitted_at":"2025-02-11T21:36:31Z","title":"Training Sparse Mixture Of Experts Text Embedding Models","version":3},"cited_work":{"arxiv_id":"2502.07972","doi":"10.48550/arxiv.2502.07972","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.07972","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Training sparse mixture of experts text embedding models","venue":"ArXiv.org","work_id":"1ce6690d-657f-4536-9802-8c3836a550a2","year":2023},"citing_paper":{"arxiv_id":"2607.01852","last_updated":"2026-07-02T08:12:35Z","snapshot_observed_at":"2026-08-06T23:53:26.271635Z","submitted_at":"2026-07-02T08:12:35Z","title":"Evaluating Chunking Strategies for Retrieval-Augmented Generation on Academic Texts","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-07-03T06:57:26.465300Z"},"links":{"cited_paper":"/paper/2502.07972","citing_paper":"/paper/2607.01852"},"observation_digest":"sha256:20cbd615abe0c645fb327c5deb944337c62dc717e4dc3384c15be3dfd2092bc6","observation_id":"96c0b6e0-0d18-47a4-81a9-025d7041ae2a","resolution":{"observed_at":"2026-07-03T06:57:42.250266Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07972","last_updated":"2025-03-09T19:39:00Z","snapshot_observed_at":"2026-08-09T03:34:52.654329Z","submitted_at":"2025-02-11T21:36:31Z","title":"Training Sparse Mixture Of Experts Text Embedding Models","version":3},"cited_work":{"arxiv_id":"2502.07972","doi":"10.48550/arxiv.2502.07972","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.07972","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Training sparse mixture of experts text embedding models","venue":"ArXiv.org","work_id":"1ce6690d-657f-4536-9802-8c3836a550a2","year":2023},"citing_paper":{"arxiv_id":"2607.01977","last_updated":"2026-07-02T10:09:03Z","snapshot_observed_at":"2026-08-05T21:05:34.012880Z","submitted_at":"2026-07-02T10:09:03Z","title":"OntoLearner: A Modular Python Library for Ontology Learning with Large Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-03T13:56:55.630390Z"},"links":{"cited_paper":"/paper/2502.07972","citing_paper":"/paper/2607.01977"},"observation_digest":"sha256:1eea7166285d6e5a854ae505efcf3dcecba32475bb431a75c787d9c271d21095","observation_id":"0b7990bf-4b0d-4cbb-b8b1-67a6bc1133e1","resolution":{"observed_at":"2026-07-03T13:58:21.008407Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07972","last_updated":"2025-03-09T19:39:00Z","snapshot_observed_at":"2026-08-09T03:34:52.654329Z","submitted_at":"2025-02-11T21:36:31Z","title":"Training Sparse Mixture Of Experts Text Embedding Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.07972","snapshot_observed_at":"2026-08-02T01:48:36.919839Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14561","last_updated":"2026-07-27T09:22:09Z","snapshot_observed_at":"2026-08-06T04:14:57.573434Z","submitted_at":"2026-07-16T04:40:05Z","title":"MARS: Multi-hop Adaptive Retrieval and SPARQL Generation for KGQA","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-02T01:48:36.919839Z"},"links":{"cited_paper":"/paper/2502.07972","citing_paper":"/paper/2607.14561"},"observation_digest":"sha256:c8c84e33325405de6c838ff00744ac324fbcff86643bea2d5a3be2f79879b56f","observation_id":"91b6023f-1c3e-463e-9f97-b6a99fbaff4b","resolution":{"observed_at":"2026-08-02T01:48:36.919839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07972","last_updated":"2025-03-09T19:39:00Z","snapshot_observed_at":"2026-08-09T03:34:52.654329Z","submitted_at":"2025-02-11T21:36:31Z","title":"Training Sparse Mixture Of Experts Text Embedding Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.07972","snapshot_observed_at":"2026-08-01T07:59:44.576310Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21274","last_updated":"2026-07-23T12:51:55Z","snapshot_observed_at":"2026-08-09T03:35:22.481408Z","submitted_at":"2026-07-23T12:51:55Z","title":"A Comparative Evaluation of Embeddings and LLMs in a Greek Book Publisher Setting - The CUP Dataset","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T07:59:44.576310Z"},"links":{"cited_paper":"/paper/2502.07972","citing_paper":"/paper/2607.21274"},"observation_digest":"sha256:203fb1299bbe734dfc933e654b54ac7e7acfc8bf447475a1cc83c8d5730bfc40","observation_id":"a5781c60-9705-4831-b0c5-6d0a12d529c9","resolution":{"observed_at":"2026-08-01T07:59:44.576310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07972","last_updated":"2025-03-09T19:39:00Z","snapshot_observed_at":"2026-08-09T03:34:52.654329Z","submitted_at":"2025-02-11T21:36:31Z","title":"Training Sparse Mixture Of Experts Text Embedding Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.07972","snapshot_observed_at":"2026-08-01T17:06:41.772717Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26380","last_updated":"2026-07-29T01:33:12Z","snapshot_observed_at":"2026-08-09T03:35:28.103583Z","submitted_at":"2026-07-29T01:33:12Z","title":"Continuous Online Evaluation of Recommendation Strategies in Social Science Academic Search","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-01T17:06:41.772717Z"},"links":{"cited_paper":"/paper/2502.07972","citing_paper":"/paper/2607.26380"},"observation_digest":"sha256:54e3af71da3dabb41be1ae0144f9bcc2b338ef50d7e071832a14152ab6cbb13d","observation_id":"4a781a83-29a3-451b-a535-75f95ace2416","resolution":{"observed_at":"2026-08-01T17:06:41.772717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2502.07972/citation-record","integrity":"/paper/2502.07972/integrity","json":"/paper/2502.07972/citation-record.json","paper":"/paper/2502.07972"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2211.15841","last_updated":"2022-11-29T00:27:08Z","snapshot_observed_at":"2026-08-03T23:24:43.956833Z","submitted_at":"2022-11-29T00:27:08Z","title":"MegaBlocks: Efficient Sparse Training with Mixture-of-Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.15841","snapshot_observed_at":"2026-08-08T11:20:23.608575Z","title":"Gumma, V ., Chitale, P","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07972","last_updated":"2025-03-09T19:39:00Z","snapshot_observed_at":"2026-08-09T03:34:52.654329Z","submitted_at":"2025-02-11T21:36:31Z","title":"Training Sparse Mixture Of Experts Text Embedding Models","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-08T11:20:23.608575Z"},"links":{"cited_paper":"/paper/2211.15841","citing_paper":"/paper/2502.07972"},"observation_digest":"sha256:457932f43fd43ca6c29f5bb3afe87a94a3b97ed1403371898f471680c6b8a947","observation_id":"99384180-b8a9-4ab8-a0b7-1a9605377599","resolution":{"observed_at":"2026-08-08T11:20:23.608575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11382","last_updated":"2025-02-09T07:58:46Z","snapshot_observed_at":"2026-08-09T03:35:27.200897Z","submitted_at":"2024-08-21T07:23:34Z","title":"Towards Inducing Long-Context Abilities in Multilingual Neural Machine Translation Models","version":3},"cited_work":{"arxiv_id":"2408.11382","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.11382","snapshot_observed_at":"2026-08-08T11:20:24.092584Z","title":"Towards Inducing Long-Context Abilities in Multilingual Neural Machine Translation Models","venue":"cs.CL","work_id":"d886e31d-4513-4783-bcb1-10ff1761144f","year":2024},"citing_paper":{"arxiv_id":"2502.07972","last_updated":"2025-03-09T19:39:00Z","snapshot_observed_at":"2026-08-09T03:34:52.654329Z","submitted_at":"2025-02-11T21:36:31Z","title":"Training Sparse Mixture Of Experts Text Embedding Models","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-08T11:20:23.613302Z"},"links":{"cited_paper":"/paper/2408.11382","citing_paper":"/paper/2502.07972"},"observation_digest":"sha256:aef33ee457c4eff7432b20a680f327bb124321128c3bb76890f032fe10f20efc","observation_id":"7bb68461-a936-4dba-8917-6622772dba58","resolution":{"observed_at":"2026-08-08T11:20:24.097626Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.15713","last_updated":"2024-12-17T20:58:26Z","snapshot_observed_at":"2026-08-09T03:35:05.694659Z","submitted_at":"2024-01-28T17:34:42Z","title":"Contrastive Learning and Mixture of Experts Enables Precise Vector Embeddings","version":3},"cited_work":{"arxiv_id":"2401.15713","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.15713","snapshot_observed_at":"2026-08-08T11:20:24.070136Z","title":"Contrastive Learning and Mixture of Experts Enables Precise Vector Embeddings","venue":"cs.LG","work_id":"3082281f-0428-4ccd-a062-e92fbdd20890","year":2024},"citing_paper":{"arxiv_id":"2502.07972","last_updated":"2025-03-09T19:39:00Z","snapshot_observed_at":"2026-08-09T03:34:52.654329Z","submitted_at":"2025-02-11T21:36:31Z","title":"Training Sparse Mixture Of Experts Text Embedding Models","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-08T11:20:23.618156Z"},"links":{"cited_paper":"/paper/2401.15713","citing_paper":"/paper/2502.07972"},"observation_digest":"sha256:15e22c6156f15735340f025638aee4889b156d49c94060c5bfaceb162b855e69","observation_id":"384a544c-2ef0-4d7a-990e-6cba2d74fcd1","resolution":{"observed_at":"2026-08-08T11:20:24.077151Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.07871","last_updated":"2024-02-12T18:33:47Z","snapshot_observed_at":"2026-08-01T16:05:25.800937Z","submitted_at":"2024-02-12T18:33:47Z","title":"Scaling Laws for Fine-Grained Mixture of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.07871","snapshot_observed_at":"2026-08-08T11:20:23.633073Z","title":"Kusupati, A., Bhatt, G., Rege, A., Wallingford, M., Sinha, A., Ramanujan, V ., Howard-Snyder, W., Chen, K., Kakade, S., Jain, P., and Farhadi, A","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07972","last_updated":"2025-03-09T19:39:00Z","snapshot_observed_at":"2026-08-09T03:34:52.654329Z","submitted_at":"2025-02-11T21:36:31Z","title":"Training Sparse Mixture Of Experts Text Embedding Models","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-08T11:20:23.633073Z"},"links":{"cited_paper":"/paper/2402.07871","citing_paper":"/paper/2502.07972"},"observation_digest":"sha256:b3c7e98bd40eb6a78f8c267b3229574c42fec89894f52a3216b67061b2a0133a","observation_id":"55cd9535-3e4b-4db5-aaa9-f9f4f0b56bfc","resolution":{"observed_at":"2026-08-08T11:20:23.633073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.13147","last_updated":"2024-02-08T03:21:26Z","snapshot_observed_at":"2026-07-06T13:14:06.120131Z","submitted_at":"2022-05-26T04:33:56Z","title":"Matryoshka Representation Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.13147","snapshot_observed_at":"2026-08-08T11:20:23.637406Z","title":"Kwiatkowski, T., Palomaki, J., Redfield, O., Collins, M., Parikh, A., Alberti, C., Epstein, D., Polosukhin, I., Kel- cey, M., Devlin, J., Lee, K., Toutanova, K","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07972","last_updated":"2025-03-09T19:39:00Z","snapshot_observed_at":"2026-08-09T03:34:52.654329Z","submitted_at":"2025-02-11T21:36:31Z","title":"Training Sparse Mixture Of Experts Text Embedding Models","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-08T11:20:23.637406Z"},"links":{"cited_paper":"/paper/2205.13147","citing_paper":"/paper/2502.07972"},"observation_digest":"sha256:791f85f104f199c324298ffd60fd396fd3adc8ecce3a326996362e61a981ebb0","observation_id":"c6375d30-3663-4d97-ae60-5cf9a1147d6e","resolution":{"observed_at":"2026-08-08T11:20:23.637406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.16668","last_updated":"2020-06-30T10:42:02Z","snapshot_observed_at":"2026-08-07T09:27:36.420559Z","submitted_at":"2020-06-30T10:42:02Z","title":"GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.16668","snapshot_observed_at":"2026-08-08T11:20:23.646455Z","title":null,"venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2502.07972","last_updated":"2025-03-09T19:39:00Z","snapshot_observed_at":"2026-08-09T03:34:52.654329Z","submitted_at":"2025-02-11T21:36:31Z","title":"Training Sparse Mixture Of Experts Text Embedding Models","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-08T11:20:23.646455Z"},"links":{"cited_paper":"/paper/2006.16668","citing_paper":"/paper/2502.07972"},"observation_digest":"sha256:8541c2a1f6dc4e37152c7ecd0c209661234f042df62a1cc139c78f6d48889adc","observation_id":"1aeeae6d-f7bf-4603-a6bc-12fd57a198a9","resolution":{"observed_at":"2026-08-08T11:20:23.646455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10814","last_updated":"2024-10-16T02:00:24Z","snapshot_observed_at":"2026-08-09T03:34:24.233039Z","submitted_at":"2024-10-14T17:59:44Z","title":"Your Mixture-of-Experts LLM Is Secretly an Embedding Model For Free","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10814","snapshot_observed_at":"2026-08-08T11:20:23.650682Z","title":"Li, Z., Zhang, X., Zhang, Y ., Long, D., Xie, P., and Zhang, M","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07972","last_updated":"2025-03-09T19:39:00Z","snapshot_observed_at":"2026-08-09T03:34:52.654329Z","submitted_at":"2025-02-11T21:36:31Z","title":"Training Sparse Mixture Of Experts Text Embedding Models","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-08T11:20:23.650682Z"},"links":{"cited_paper":"/paper/2410.10814","citing_paper":"/paper/2502.07972"},"observation_digest":"sha256:a54c203b7457aaa3b97e5aae28f6d0503c12f7b0f000ad78e57aa152b0bcd6f4","observation_id":"e6a23bff-c653-4453-af4b-4e238e4ecb09","resolution":{"observed_at":"2026-08-08T11:20:23.650682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05209","last_updated":"2024-03-13T08:14:47Z","snapshot_observed_at":"2026-08-03T21:56:31.751173Z","submitted_at":"2023-10-08T15:50:36Z","title":"Scaling Laws of RoPE-based Extrapolation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05209","snapshot_observed_at":"2026-08-08T11:20:23.654929Z","title":"Liu, Y ., Ott, M., Goyal, N., Du, J., Joshi, M., Chen, D., Levy, O., Lewis, M., Zettlemoyer, L., and Stoyanov, V","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07972","last_updated":"2025-03-09T19:39:00Z","snapshot_observed_at":"2026-08-09T03:34:52.654329Z","submitted_at":"2025-02-11T21:36:31Z","title":"Training Sparse Mixture Of Experts Text Embedding Models","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-08T11:20:23.654929Z"},"links":{"cited_paper":"/paper/2310.05209","citing_paper":"/paper/2502.07972"},"observation_digest":"sha256:15bc20b2186ff01453e4165a83e27324ad6040573d0aa7279bb05ad166450945","observation_id":"46868ceb-b944-4504-87b5-9aace9e934ad","resolution":{"observed_at":"2026-08-08T11:20:23.654929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05374","last_updated":"2024-05-08T19:05:18Z","snapshot_observed_at":"2026-07-06T18:11:48.858911Z","submitted_at":"2024-05-08T19:05:18Z","title":"Arctic-Embed: Scalable, Efficient, and Accurate Text Embedding Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.05374","snapshot_observed_at":"2026-08-08T11:20:23.659224Z","title":"Moreira, G","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07972","last_updated":"2025-03-09T19:39:00Z","snapshot_observed_at":"2026-08-09T03:34:52.654329Z","submitted_at":"2025-02-11T21:36:31Z","title":"Training Sparse Mixture Of Experts Text Embedding Models","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-08T11:20:23.659224Z"},"links":{"cited_paper":"/paper/2405.05374","citing_paper":"/paper/2502.07972"},"observation_digest":"sha256:9bacca0e2f410957eccdab72ef69d1244a9c3ab845c9c3449329134ecf2e0d27","observation_id":"ef32c99f-837a-4a31-b1ba-0726eeed4a31","resolution":{"observed_at":"2026-08-08T11:20:23.659224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09906","last_updated":"2025-03-03T04:28:49Z","snapshot_observed_at":"2026-07-06T17:30:34.153488Z","submitted_at":"2024-02-15T12:12:19Z","title":"Generative Representational Instruction Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09906","snapshot_observed_at":"2026-08-08T11:20:23.663259Z","title":"Nussbaum, Z., Morris, J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07972","last_updated":"2025-03-09T19:39:00Z","snapshot_observed_at":"2026-08-09T03:34:52.654329Z","submitted_at":"2025-02-11T21:36:31Z","title":"Training Sparse Mixture Of Experts Text Embedding Models","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-08T11:20:23.663259Z"},"links":{"cited_paper":"/paper/2402.09906","citing_paper":"/paper/2502.07972"},"observation_digest":"sha256:12fdef78183c22496e001fcd6a65d6c6f8e401faba3c2894db51051297a7fe04","observation_id":"44b0d999-908d-4f47-83f6-ad96c0cba4f6","resolution":{"observed_at":"2026-08-08T11:20:23.663259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01613","last_updated":"2025-02-03T22:26:56Z","snapshot_observed_at":"2026-08-08T18:16:47.501613Z","submitted_at":"2024-02-02T18:23:18Z","title":"Nomic Embed: Training a Reproducible Long Context Text Embedder","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01613","snapshot_observed_at":"2026-08-08T11:20:23.667474Z","title":"Rajpurkar, P., Zhang, J., Lopyrev, K., and Liang, P","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.07972","last_updated":"2025-03-09T19:39:00Z","snapshot_observed_at":"2026-08-09T03:34:52.654329Z","submitted_at":"2025-02-11T21:36:31Z","title":"Training Sparse Mixture Of Experts Text Embedding Models","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-08T11:20:23.667474Z"},"links":{"cited_paper":"/paper/2402.01613","citing_paper":"/paper/2502.07972"},"observation_digest":"sha256:0cfdf9007677405163100f6fcd7cd062a30b1a88aed8e454a2c542757a687c4f","observation_id":"b2fba75c-34fc-4247-8982-85c0cb330d0a","resolution":{"observed_at":"2026-08-08T11:20:23.667474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:20:24.164317Z","title":null,"venue":null,"work_id":"efca5b5d-3763-46a4-8ae5-7406dc93f88a","year":2004},"citing_paper":{"arxiv_id":"2502.07972","last_updated":"2025-03-09T19:39:00Z","snapshot_observed_at":"2026-08-09T03:34:52.654329Z","submitted_at":"2025-02-11T21:36:31Z","title":"Training Sparse Mixture Of Experts Text Embedding Models","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-08T11:20:23.676439Z"},"links":{"citing_paper":"/paper/2502.07972"},"observation_digest":"sha256:52cac865f74225be6d338abcc1d15db8298de0bbbbdf770154ca9fbd5d85064f","observation_id":"7f36c2b0-9d83-4fdc-85ed-6f5f58e6045d","resolution":{"observed_at":"2026-08-08T11:20:24.168761Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03533","last_updated":"2024-02-22T06:21:51Z","snapshot_observed_at":"2026-07-06T14:27:46.217000Z","submitted_at":"2022-12-07T09:25:54Z","title":"Text Embeddings by Weakly-Supervised Contrastive Pre-training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.03533","snapshot_observed_at":"2026-08-08T11:20:23.690040Z","title":"Text embeddings by weakly- supervised contrastive pre-training, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07972","last_updated":"2025-03-09T19:39:00Z","snapshot_observed_at":"2026-08-09T03:34:52.654329Z","submitted_at":"2025-02-11T21:36:31Z","title":"Training Sparse Mixture Of Experts Text Embedding Models","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-08T11:20:23.690040Z"},"links":{"cited_paper":"/paper/2212.03533","citing_paper":"/paper/2502.07972"},"observation_digest":"sha256:523e68a8818fbe999d05e8eda35ffca8a7f66a43ef6778cc00aeec1e48bb3de8","observation_id":"06569a7d-5833-4062-adf8-9536bffacb91","resolution":{"observed_at":"2026-08-08T11:20:23.690040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.07597","last_updated":"2024-09-24T03:01:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-14T10:57:50Z","title":"C-Pack: Packed Resources For General Chinese Embeddings","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.07597","snapshot_observed_at":"2026-08-08T11:20:23.694453Z","title":"org/abs/2309.07597","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07972","last_updated":"2025-03-09T19:39:00Z","snapshot_observed_at":"2026-08-09T03:34:52.654329Z","submitted_at":"2025-02-11T21:36:31Z","title":"Training Sparse Mixture Of Experts Text Embedding Models","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-08T11:20:23.694453Z"},"links":{"cited_paper":"/paper/2309.07597","citing_paper":"/paper/2502.07972"},"observation_digest":"sha256:ffe864d5b06b441eae4ebe15cf7fdf815e86afa6acd0a457b5b9251de1b3cea9","observation_id":"6eebe7a1-b207-484b-87a6-a3814d399276","resolution":{"observed_at":"2026-08-08T11:20:23.694453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16039","last_updated":"2023-11-14T01:40:13Z","snapshot_observed_at":"2026-07-06T16:24:38.375055Z","submitted_at":"2023-09-27T21:41:49Z","title":"Effective Long-Context Scaling of Foundation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16039","snapshot_observed_at":"2026-08-08T11:20:23.698827Z","title":"org/abs/2309.16039","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07972","last_updated":"2025-03-09T19:39:00Z","snapshot_observed_at":"2026-08-09T03:34:52.654329Z","submitted_at":"2025-02-11T21:36:31Z","title":"Training Sparse Mixture Of Experts Text Embedding Models","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-08T11:20:23.698827Z"},"links":{"cited_paper":"/paper/2309.16039","citing_paper":"/paper/2502.07972"},"observation_digest":"sha256:1b756ecbcfcf75312f981a057125f4c6d26bd9808a4b717bb16f5255d867b4b2","observation_id":"87cf181b-9fce-4008-b8a2-ed9fabef6bc7","resolution":{"observed_at":"2026-08-08T11:20:23.698827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11934","last_updated":"2021-03-11T18:45:13Z","snapshot_observed_at":"2026-08-09T05:32:57.900052Z","submitted_at":"2020-10-22T17:58:14Z","title":"mT5: A massively multilingual pre-trained text-to-text transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11934","snapshot_observed_at":"2026-08-08T11:20:23.703288Z","title":"Yu, P., Merrick, L., Nuti, G., and Campos, D","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2502.07972","last_updated":"2025-03-09T19:39:00Z","snapshot_observed_at":"2026-08-09T03:34:52.654329Z","submitted_at":"2025-02-11T21:36:31Z","title":"Training Sparse Mixture Of Experts Text Embedding Models","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-08T11:20:23.703288Z"},"links":{"cited_paper":"/paper/2010.11934","citing_paper":"/paper/2502.07972"},"observation_digest":"sha256:7e2cec26452b79806e17a68ffd29b5683e736aaef7fe87d39720d37997df349b","observation_id":"00c4a738-7e39-4c19-b7cf-4febec0037d1","resolution":{"observed_at":"2026-08-08T11:20:23.703288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04506","last_updated":"2024-12-14T00:13:09Z","snapshot_observed_at":"2026-07-06T20:02:26.756229Z","submitted_at":"2024-12-03T22:59:36Z","title":"Arctic-Embed 2.0: Multilingual Retrieval Without Compromise","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04506","snapshot_observed_at":"2026-08-08T11:20:23.708490Z","title":"Zhang, D., Li, J., Zeng, Z., and Wang, F","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07972","last_updated":"2025-03-09T19:39:00Z","snapshot_observed_at":"2026-08-09T03:34:52.654329Z","submitted_at":"2025-02-11T21:36:31Z","title":"Training Sparse Mixture Of Experts Text Embedding Models","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-08T11:20:23.708490Z"},"links":{"cited_paper":"/paper/2412.04506","citing_paper":"/paper/2502.07972"},"observation_digest":"sha256:3c6723531b77cdfeb4f835a90494a9afba8d1faadb9c29b2266a2bf18e90ad63","observation_id":"f8767e89-f3cb-4ffc-8460-47e4a65333e5","resolution":{"observed_at":"2026-08-08T11:20:23.708490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.09984","last_updated":"2022-10-18T16:47:18Z","snapshot_observed_at":"2026-07-06T14:07:19.717932Z","submitted_at":"2022-10-18T16:47:18Z","title":"Making a MIRACL: Multilingual Information Retrieval Across a Continuum of Languages","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.09984","snapshot_observed_at":"2026-08-08T11:20:23.718168Z","title":"Zhang, X., Zhang, Y ., Long, D., Xie, W., Dai, Z., Tang, J., Lin, H., Yang, B., Xie, P., Huang, F., Zhang, M., Li, W., and Zhang, M","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07972","last_updated":"2025-03-09T19:39:00Z","snapshot_observed_at":"2026-08-09T03:34:52.654329Z","submitted_at":"2025-02-11T21:36:31Z","title":"Training Sparse Mixture Of Experts Text Embedding Models","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-08T11:20:23.718168Z"},"links":{"cited_paper":"/paper/2210.09984","citing_paper":"/paper/2502.07972"},"observation_digest":"sha256:f6905bdeaa7bbd69a65d9ef8ce452a540e9a82412f9445c0a38efa06f108e7f4","observation_id":"4a95c4dd-5bcf-4ff8-bb8c-e0d1a6d98e37","resolution":{"observed_at":"2026-08-08T11:20:23.718168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.19669","last_updated":"2024-10-14T12:19:44Z","snapshot_observed_at":"2026-08-06T06:00:03.766109Z","submitted_at":"2024-07-29T03:12:28Z","title":"mGTE: Generalized Long-Context Text Representation and Reranking Models for Multilingual Text Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.19669","snapshot_observed_at":"2026-08-08T11:20:23.722732Z","title":"Zoph, B., Bello, I., Kumar, S., Du, N., Huang, Y ., Dean, J., Shazeer, N., and Fedus, W","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07972","last_updated":"2025-03-09T19:39:00Z","snapshot_observed_at":"2026-08-09T03:34:52.654329Z","submitted_at":"2025-02-11T21:36:31Z","title":"Training Sparse Mixture Of Experts Text Embedding Models","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-08T11:20:23.722732Z"},"links":{"cited_paper":"/paper/2407.19669","citing_paper":"/paper/2502.07972"},"observation_digest":"sha256:55712f20def6ec4722e8716de50d5b2f8f5b67b32aadf23e99ad4980dde436fc","observation_id":"8522fc91-cc67-49f1-b963-fa29b1151f0a","resolution":{"observed_at":"2026-08-08T11:20:23.722732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.08906","snapshot_observed_at":"2026-08-08T11:20:23.727254Z","title":"10 Training Sparse Mixture Of Experts Text Embedding Models A","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07972","last_updated":"2025-03-09T19:39:00Z","snapshot_observed_at":"2026-08-09T03:34:52.654329Z","submitted_at":"2025-02-11T21:36:31Z","title":"Training Sparse Mixture Of Experts Text Embedding Models","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-08T11:20:23.727254Z"},"links":{"cited_paper":"/paper/2202.08906","citing_paper":"/paper/2502.07972"},"observation_digest":"sha256:0c2cf61b3112a49821eb12383d06399cb7525a0627f5358777c9e59bb1e460f9","observation_id":"5bc7a076-1f82-41ba-92ca-bb5ca0b6784c","resolution":{"observed_at":"2026-08-08T11:20:23.727254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:20:23.623356Z","title":"doi: 10.1162/neco.1997.9.8.1735","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2502.07972","last_updated":"2025-03-09T19:39:00Z","snapshot_observed_at":"2026-08-09T03:34:52.654329Z","submitted_at":"2025-02-11T21:36:31Z","title":"Training Sparse Mixture Of Experts Text Embedding Models","version":3},"reference_index":1997,"source":"pdf_text","source_observed_at":"2026-08-08T11:20:23.623356Z"},"links":{"citing_paper":"/paper/2502.07972"},"observation_digest":"sha256:f62c0eb3cbaa864c133a4abd41980b085c93b29cbb1d2805b77e4ba10a21a0f4","observation_id":"7ea765dc-bc22-411b-868f-b111aa85369f","resolution":{"observed_at":"2026-08-08T11:20:23.623356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:20:23.671913Z","title":"doi: 10.18653/v1/D16-1264","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07972","last_updated":"2025-03-09T19:39:00Z","snapshot_observed_at":"2026-08-09T03:34:52.654329Z","submitted_at":"2025-02-11T21:36:31Z","title":"Training Sparse Mixture Of Experts Text Embedding Models","version":3},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-08T11:20:23.671913Z"},"links":{"citing_paper":"/paper/2502.07972"},"observation_digest":"sha256:c78f69880aff6be82d13349534148b2d52a12703ef14c5d1e9bc903fda4c7e23","observation_id":"b10bb9fd-d50f-4248-b7c3-ba34a582fdbb","resolution":{"observed_at":"2026-08-08T11:20:23.671913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1701.06538","last_updated":"2017-01-23T18:10:00Z","snapshot_observed_at":"2026-07-06T05:27:13.416519Z","submitted_at":"2017-01-23T18:10:00Z","title":"Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1701.06538","snapshot_observed_at":"2026-08-08T11:20:23.685607Z","title":"Su, H., Shi, W., Kasai, J., Wang, Y ., Hu, Y ., Ostendorf, M., tau Yih, W., Smith, N","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07972","last_updated":"2025-03-09T19:39:00Z","snapshot_observed_at":"2026-08-09T03:34:52.654329Z","submitted_at":"2025-02-11T21:36:31Z","title":"Training Sparse Mixture Of Experts Text Embedding Models","version":3},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-08T11:20:23.685607Z"},"links":{"cited_paper":"/paper/1701.06538","citing_paper":"/paper/2502.07972"},"observation_digest":"sha256:e592167d90af0e0f038143682c8f3da7aa2e039451aefce96f157c9962dc53ab","observation_id":"8428ffdb-bad7-4455-bcbc-f7e83beef7f1","resolution":{"observed_at":"2026-08-08T11:20:23.685607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17428","last_updated":"2025-02-25T00:35:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-27T17:59:45Z","title":"NV-Embed: Improved Techniques for Training LLMs as Generalist Embedding Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.17428","snapshot_observed_at":"2026-08-08T11:20:23.641838Z","title":"Nv-embed: Improved techniques for training llms as generalist embedding models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07972","last_updated":"2025-03-09T19:39:00Z","snapshot_observed_at":"2026-08-09T03:34:52.654329Z","submitted_at":"2025-02-11T21:36:31Z","title":"Training Sparse Mixture Of Experts Text Embedding Models","version":3},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-08T11:20:23.641838Z"},"links":{"cited_paper":"/paper/2405.17428","citing_paper":"/paper/2502.07972"},"observation_digest":"sha256:890e0187a1d32e5581a6cae62195618fbd22ede98eae86e829d3b46dc4bc7c72","observation_id":"58946727-309e-49e1-b5c5-632f98eeb282","resolution":{"observed_at":"2026-08-08T11:20:23.641838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.02116","last_updated":"2020-04-08T01:02:17Z","snapshot_observed_at":"2026-08-02T09:09:10.011185Z","submitted_at":"2019-11-05T22:42:00Z","title":"Unsupervised Cross-lingual Representation Learning at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.02116","snapshot_observed_at":"2026-08-08T11:20:23.598316Z","title":"Devlin, J., Chang, M.-W., Lee, K., and Toutanova, K","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2502.07972","last_updated":"2025-03-09T19:39:00Z","snapshot_observed_at":"2026-08-09T03:34:52.654329Z","submitted_at":"2025-02-11T21:36:31Z","title":"Training Sparse Mixture Of Experts Text Embedding Models","version":3},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-08T11:20:23.598316Z"},"links":{"cited_paper":"/paper/1911.02116","citing_paper":"/paper/2502.07972"},"observation_digest":"sha256:83bf6e0050dab9ee975455aeb3361658e6e79c74db6112509a9758018eb87043","observation_id":"ecb0018a-1d83-4c84-8e04-bc3731464401","resolution":{"observed_at":"2026-08-08T11:20:23.598316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.07412","last_updated":"2021-10-07T09:51:04Z","snapshot_observed_at":"2026-08-03T17:43:44.785835Z","submitted_at":"2021-04-15T12:26:12Z","title":"XTREME-R: Towards More Challenging and Nuanced Multilingual Evaluation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.07412","snapshot_observed_at":"2026-08-08T11:20:23.681129Z","title":"org/abs/2104.07412","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07972","last_updated":"2025-03-09T19:39:00Z","snapshot_observed_at":"2026-08-09T03:34:52.654329Z","submitted_at":"2025-02-11T21:36:31Z","title":"Training Sparse Mixture Of Experts Text Embedding Models","version":3},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-08T11:20:23.681129Z"},"links":{"cited_paper":"/paper/2104.07412","citing_paper":"/paper/2502.07972"},"observation_digest":"sha256:d70d071dd6fb910cda0dcc6b453e46b9507675eb2ca698dcf38b187097c104f2","observation_id":"c6e4e0bf-2868-4cc0-8abd-2a953ebc31bc","resolution":{"observed_at":"2026-08-08T11:20:23.681129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.03961","last_updated":"2022-06-16T20:36:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-01-11T16:11:52Z","title":"Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.03961","snapshot_observed_at":"2026-08-08T11:20:23.603364Z","title":"Gale, T., Narayanan, D., Young, C., and Zaharia, M","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07972","last_updated":"2025-03-09T19:39:00Z","snapshot_observed_at":"2026-08-09T03:34:52.654329Z","submitted_at":"2025-02-11T21:36:31Z","title":"Training Sparse Mixture Of Experts Text Embedding Models","version":3},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-08T11:20:23.603364Z"},"links":{"cited_paper":"/paper/2101.03961","citing_paper":"/paper/2502.07972"},"observation_digest":"sha256:7c9876a474ab2492850e28740f9c967494eb7421ec79c3a501c2936e586f13e2","observation_id":"4d7f054e-711a-4138-8d5d-f1144ade91be","resolution":{"observed_at":"2026-08-08T11:20:23.603364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.05055","last_updated":"2023-02-17T17:54:50Z","snapshot_observed_at":"2026-07-06T14:28:52.486524Z","submitted_at":"2022-12-09T18:57:37Z","title":"Sparse Upcycling: Training Mixture-of-Experts from Dense Checkpoints","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.05055","snapshot_observed_at":"2026-08-08T11:20:23.627982Z","title":"Krajewski, J., Ludziejewski, J., Adamczewski, K., Pi ´oro, M., Krutul, M., Antoniak, S., Ciebiera, K., Kr ´ol, K., Odrzyg´o´zd´z, T., Sankowski, P., Cygan, M., and Jaszczur, S","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07972","last_updated":"2025-03-09T19:39:00Z","snapshot_observed_at":"2026-08-09T03:34:52.654329Z","submitted_at":"2025-02-11T21:36:31Z","title":"Training Sparse Mixture Of Experts Text Embedding Models","version":3},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-08T11:20:23.627982Z"},"links":{"cited_paper":"/paper/2212.05055","citing_paper":"/paper/2502.07972"},"observation_digest":"sha256:2f5d8d73c013d27bdba9bc0a562db64add5111dd5ffe8409aba3bd9d2cef707c","observation_id":"04f50ded-00a7-460e-935f-a8e016755d0e","resolution":{"observed_at":"2026-08-08T11:20:23.627982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03216","last_updated":"2025-12-12T11:26:32Z","snapshot_observed_at":"2026-07-06T17:25:35.493362Z","submitted_at":"2024-02-05T17:26:49Z","title":"M3-Embedding: Multi-Linguality, Multi-Functionality, Multi-Granularity Text Embeddings Through Self-Knowledge Distillation","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03216","snapshot_observed_at":"2026-08-08T11:20:23.592597Z","title":"Conneau, A., Khandelwal, K., Goyal, N., Chaudhary, V ., Wenzek, G., Guzm ´an, F., Grave, E., Ott, M., Zettle- moyer, L., and Stoyanov, V","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07972","last_updated":"2025-03-09T19:39:00Z","snapshot_observed_at":"2026-08-09T03:34:52.654329Z","submitted_at":"2025-02-11T21:36:31Z","title":"Training Sparse Mixture Of Experts Text Embedding Models","version":3},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-08T11:20:23.592597Z"},"links":{"cited_paper":"/paper/2402.03216","citing_paper":"/paper/2502.07972"},"observation_digest":"sha256:077baae6220b0cd65f4398751e90e160edb626cc80e7dd3194ab2db62a333363","observation_id":"0797a83d-761a-49f1-9c8e-6bbdc8b5a63a","resolution":{"observed_at":"2026-08-08T11:20:23.592597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19048","last_updated":"2025-01-23T16:01:22Z","snapshot_observed_at":"2026-08-07T06:21:24.878689Z","submitted_at":"2024-12-26T04:05:28Z","title":"Jasper and Stella: distillation of SOTA embedding models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19048","snapshot_observed_at":"2026-08-08T11:20:23.713428Z","title":"Zhang, X., Thakur, N., Ogundepo, O., Kamalloo, E., Alfonso-Hermelo, D., Li, X., Liu, Q., Rezagholizadeh, M., and Lin, J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07972","last_updated":"2025-03-09T19:39:00Z","snapshot_observed_at":"2026-08-09T03:34:52.654329Z","submitted_at":"2025-02-11T21:36:31Z","title":"Training Sparse Mixture Of Experts Text Embedding Models","version":3},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-08T11:20:23.713428Z"},"links":{"cited_paper":"/paper/2412.19048","citing_paper":"/paper/2502.07972"},"observation_digest":"sha256:c736873daccca0026244a753535a3c7ed2cc4a06622c250052ad4ef065fcc984","observation_id":"eae619b5-756b-464e-93be-aceaccd2605b","resolution":{"observed_at":"2026-08-08T11:20:23.713428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.07972","last_updated":"2025-03-09T19:39:00Z","latest_version":3,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-09T03:34:52.654329Z","submitted_at":"2025-02-11T21:36:31Z","title":"Training Sparse Mixture Of Experts Text Embedding Models"},"reference_resolution":{"displayed":30,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":28,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":30},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 30 of 30 outbound references and 16 inbound Pith citation observations for arXiv:2502.07972."}