{"as_of":"2026-08-14T11:39:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:16932be5638704a12229d002cb839a15c347a06260d1ef82ce31d66d102ff1b4","coverage":[{"denominator":55,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":55,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T12:15:18.882438Z","state":"measured"},{"denominator":57,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":57,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T22:08:34.611294Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T10:19:47.065061Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.14528","last_updated":"2025-01-18T08:26:11Z","snapshot_observed_at":"2026-08-14T06:59:32.021931Z","submitted_at":"2024-12-19T04:51:06Z","title":"Multi-Level Optimal Transport for Universal Cross-Tokenizer Knowledge Distillation on Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14528","snapshot_observed_at":"2026-08-10T22:08:34.611294Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.02795","last_updated":"2025-02-17T03:49:14Z","snapshot_observed_at":"2026-08-13T14:51:28.608016Z","submitted_at":"2025-01-06T06:29:55Z","title":"InfiFusion: A Unified Framework for Enhanced Cross-Model Reasoning via LLM Fusion","version":3},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-10T22:08:34.611294Z"},"links":{"cited_paper":"/paper/2412.14528","citing_paper":"/paper/2501.02795"},"observation_digest":"sha256:d6e271f9ee094d6912e7fdf78a86bf2b28913d673eb1b16b4f12cb23261d6437","observation_id":"45d97f83-7a76-434c-92a1-7d40052ded02","resolution":{"observed_at":"2026-08-10T22:08:34.611294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14528","last_updated":"2025-01-18T08:26:11Z","snapshot_observed_at":"2026-08-14T06:59:32.021931Z","submitted_at":"2024-12-19T04:51:06Z","title":"Multi-Level Optimal Transport for Universal Cross-Tokenizer Knowledge Distillation on Language Models","version":2},"cited_work":{"arxiv_id":"2412.14528","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.14528","snapshot_observed_at":"2026-07-04T10:19:47.065061Z","title":"arXiv preprint arXiv:2412.14528 , year =","venue":null,"work_id":"b93e2b68-8403-4d08-aaa3-bd02241a9e0e","year":null},"citing_paper":{"arxiv_id":"2606.22793","last_updated":"2026-06-22T03:09:21Z","snapshot_observed_at":"2026-08-13T01:18:09.661706Z","submitted_at":"2026-06-22T03:09:21Z","title":"A Formula-Driven Survey and Research Agenda for On-Policy Distillation","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-06-26T09:02:13.340365Z"},"links":{"cited_paper":"/paper/2412.14528","citing_paper":"/paper/2606.22793"},"observation_digest":"sha256:0e3a7c4eb6466b0e02a41fb0c3b4d3c55554c8481645204146afd5f063122d07","observation_id":"38b05db8-0afb-4487-9866-6afa35b5eaee","resolution":{"observed_at":"2026-07-04T10:19:47.066476Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.14528/citation-record","integrity":"/paper/2412.14528/integrity","json":"/paper/2412.14528/citation-record.json","paper":"/paper/2412.14528"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:15:18.295550Z","title":", \" * write output.state after.block = add.period write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.14528","last_updated":"2025-01-18T08:26:11Z","snapshot_observed_at":"2026-08-14T06:59:32.021931Z","submitted_at":"2024-12-19T04:51:06Z","title":"Multi-Level Optimal Transport for Universal Cross-Tokenizer Knowledge Distillation on Language Models","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-11T12:15:18.295550Z"},"links":{"citing_paper":"/paper/2412.14528"},"observation_digest":"sha256:e5883bdcb57c1765283519ada80084b9b19e09a6c0eb591de983f4715c615857","observation_id":"04ccc695-312e-474e-9e37-298ac10b532c","resolution":{"observed_at":"2026-08-11T12:15:18.295550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:15:18.311764Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.14528","last_updated":"2025-01-18T08:26:11Z","snapshot_observed_at":"2026-08-14T06:59:32.021931Z","submitted_at":"2024-12-19T04:51:06Z","title":"Multi-Level Optimal Transport for Universal Cross-Tokenizer Knowledge Distillation on Language Models","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-11T12:15:18.311764Z"},"links":{"citing_paper":"/paper/2412.14528"},"observation_digest":"sha256:ec86b8093211d715fc587050ad6e098b4619f4072edc94b59704304ee2d9658e","observation_id":"0068c8f1-efa9-4a72-b648-05deb45a715b","resolution":{"observed_at":"2026-08-11T12:15:18.311764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:15:20.552063Z","title":"R.; Geist, M.; and Bachem, O","venue":null,"work_id":"b37a5246-5e2a-4cd4-a1ae-d1bf2d9b450c","year":2024},"citing_paper":{"arxiv_id":"2412.14528","last_updated":"2025-01-18T08:26:11Z","snapshot_observed_at":"2026-08-14T06:59:32.021931Z","submitted_at":"2024-12-19T04:51:06Z","title":"Multi-Level Optimal Transport for Universal Cross-Tokenizer Knowledge Distillation on Language Models","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-11T12:15:18.322795Z"},"links":{"citing_paper":"/paper/2412.14528"},"observation_digest":"sha256:980a88f0920e624280cd47101319d7b22da158faf1d009c2d0349f58212ea632","observation_id":"e1d39ebf-2dfc-4497-908a-c94c93f9a2a3","resolution":{"observed_at":"2026-08-11T12:15:20.558482Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:15:20.519281Z","title":null,"venue":null,"work_id":"d23f1d1f-27c9-4af7-b29a-41548458b9fb","year":2017},"citing_paper":{"arxiv_id":"2412.14528","last_updated":"2025-01-18T08:26:11Z","snapshot_observed_at":"2026-08-14T06:59:32.021931Z","submitted_at":"2024-12-19T04:51:06Z","title":"Multi-Level Optimal Transport for Universal Cross-Tokenizer Knowledge Distillation on Language Models","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-11T12:15:18.330331Z"},"links":{"citing_paper":"/paper/2412.14528"},"observation_digest":"sha256:ce428b1dc0094f55dccfc6bdcb728fb4f9f876c1a8ccc27974ea8adc6e003a1c","observation_id":"97ea795f-75df-45d6-bae8-bcd99091d7f7","resolution":{"observed_at":"2026-08-11T12:15:20.532683Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-11T12:15:18.342682Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.14528","last_updated":"2025-01-18T08:26:11Z","snapshot_observed_at":"2026-08-14T06:59:32.021931Z","submitted_at":"2024-12-19T04:51:06Z","title":"Multi-Level Optimal Transport for Universal Cross-Tokenizer Knowledge Distillation on Language Models","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-11T12:15:18.342682Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2412.14528"},"observation_digest":"sha256:6474c59add0fdf21b4d3ef303796555bd78a9ea1777cd1e6386a7d6909b3388e","observation_id":"2587f598-fb47-41e4-85c7-64977e00316a","resolution":{"observed_at":"2026-08-11T12:15:18.342682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.02432","last_updated":"2022-09-17T03:14:44Z","snapshot_observed_at":"2026-08-13T17:58:53.011242Z","submitted_at":"2021-10-06T00:44:00Z","title":"KNOT: Knowledge Distillation using Optimal Transport for Solving NLP Tasks","version":2},"cited_work":{"arxiv_id":"2110.02432","doi":null,"metadata_source":"pith","pith_arxiv_id":"2110.02432","snapshot_observed_at":"2026-08-11T12:15:19.494481Z","title":"KNOT: Knowledge Distillation using Optimal Transport for Solving NLP Tasks","venue":"cs.CL","work_id":"b1f2889f-4195-4f68-9242-1022025c0bfb","year":2021},"citing_paper":{"arxiv_id":"2412.14528","last_updated":"2025-01-18T08:26:11Z","snapshot_observed_at":"2026-08-14T06:59:32.021931Z","submitted_at":"2024-12-19T04:51:06Z","title":"Multi-Level Optimal Transport for Universal Cross-Tokenizer Knowledge Distillation on Language Models","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-11T12:15:18.351701Z"},"links":{"cited_paper":"/paper/2110.02432","citing_paper":"/paper/2412.14528"},"observation_digest":"sha256:a7e55f79445792affd3e5db85248d642c4b86dbf2b37b71d0b36d507d8174b4d","observation_id":"6f7d5b9d-bb50-4ae6-8522-3c0826902b5c","resolution":{"observed_at":"2026-08-11T12:15:19.503018Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:15:20.489598Z","title":"G.; Bradley, H.; O’Brien, K.; Hallahan, E.; Khan, M","venue":null,"work_id":"96374a3d-de23-4f8f-b0c2-a405df28a2fd","year":2023},"citing_paper":{"arxiv_id":"2412.14528","last_updated":"2025-01-18T08:26:11Z","snapshot_observed_at":"2026-08-14T06:59:32.021931Z","submitted_at":"2024-12-19T04:51:06Z","title":"Multi-Level Optimal Transport for Universal Cross-Tokenizer Knowledge Distillation on Language Models","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-11T12:15:18.357420Z"},"links":{"citing_paper":"/paper/2412.14528"},"observation_digest":"sha256:72e78050205353b7d8b8749e0030d228c46c5267aef32277e13653da00ad5f66","observation_id":"52bfb847-fa33-4299-97db-1ea7a9db5cbb","resolution":{"observed_at":"2026-08-11T12:15:20.503736Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12030","last_updated":"2025-01-27T10:02:44Z","snapshot_observed_at":"2026-08-14T02:27:45.906653Z","submitted_at":"2024-02-19T10:37:29Z","title":"Towards Cross-Tokenizer Distillation: the Universal Logit Distillation Loss for LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12030","snapshot_observed_at":"2026-08-11T12:15:18.369600Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14528","last_updated":"2025-01-18T08:26:11Z","snapshot_observed_at":"2026-08-14T06:59:32.021931Z","submitted_at":"2024-12-19T04:51:06Z","title":"Multi-Level Optimal Transport for Universal Cross-Tokenizer Knowledge Distillation on Language Models","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-11T12:15:18.369600Z"},"links":{"cited_paper":"/paper/2402.12030","citing_paper":"/paper/2412.14528"},"observation_digest":"sha256:78bddb7a7c4ddf85d68de6c83f18b5f25392b1b514d4bf483b2ebad60ecadc11","observation_id":"5566a76d-d839-4b2b-b587-0ab85f282843","resolution":{"observed_at":"2026-08-11T12:15:18.369600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:15:20.462679Z","title":"D.; Dhariwal, P.; Neelakantan, A.; Shyam, P.; Sastry, G.; Askell, A.; et al","venue":null,"work_id":"e83cb25d-8f63-4559-b52c-737ae14b0191","year":2020},"citing_paper":{"arxiv_id":"2412.14528","last_updated":"2025-01-18T08:26:11Z","snapshot_observed_at":"2026-08-14T06:59:32.021931Z","submitted_at":"2024-12-19T04:51:06Z","title":"Multi-Level Optimal Transport for Universal Cross-Tokenizer Knowledge Distillation on Language Models","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-11T12:15:18.377622Z"},"links":{"citing_paper":"/paper/2412.14528"},"observation_digest":"sha256:4159dc80966d0a9cb11013d33e4e1847f7716c585672e529323e92993e2d8e59","observation_id":"eaf90e5f-0e61-4363-8f57-75f50ad7888b","resolution":{"observed_at":"2026-08-11T12:15:20.473755Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:15:20.439346Z","title":null,"venue":null,"work_id":"dc9d86cb-7b94-4fe1-a819-87fe57dceb38","year":2022},"citing_paper":{"arxiv_id":"2412.14528","last_updated":"2025-01-18T08:26:11Z","snapshot_observed_at":"2026-08-14T06:59:32.021931Z","submitted_at":"2024-12-19T04:51:06Z","title":"Multi-Level Optimal Transport for Universal Cross-Tokenizer Knowledge Distillation on Language Models","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-11T12:15:18.386115Z"},"links":{"citing_paper":"/paper/2412.14528"},"observation_digest":"sha256:133e6087aecfeca305f310cccb277a6e95f041e4f40e27b9d6bf6e16026c95e4","observation_id":"b84ab0b6-0c70-4d92-ba73-727b7c89523e","resolution":{"observed_at":"2026-08-11T12:15:20.446387Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.06762","last_updated":"2021-06-16T06:34:42Z","snapshot_observed_at":"2026-08-14T08:32:43.824455Z","submitted_at":"2021-05-14T11:12:40Z","title":"DialogSum: A Real-Life Scenario Dialogue Summarization Dataset","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.06762","snapshot_observed_at":"2026-08-11T12:15:18.394005Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.14528","last_updated":"2025-01-18T08:26:11Z","snapshot_observed_at":"2026-08-14T06:59:32.021931Z","submitted_at":"2024-12-19T04:51:06Z","title":"Multi-Level Optimal Transport for Universal Cross-Tokenizer Knowledge Distillation on Language Models","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-11T12:15:18.394005Z"},"links":{"cited_paper":"/paper/2105.06762","citing_paper":"/paper/2412.14528"},"observation_digest":"sha256:cc33d45f2daee646ba5b4aff3043df1ae9a3a48da608f64a4390966f38497449","observation_id":"70a3bd14-b500-4211-9c0a-895cf87265c7","resolution":{"observed_at":"2026-08-11T12:15:18.394005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:15:20.405046Z","title":null,"venue":null,"work_id":"6c6cae71-7b49-4c35-a8cd-1d588e46f312","year":2024},"citing_paper":{"arxiv_id":"2412.14528","last_updated":"2025-01-18T08:26:11Z","snapshot_observed_at":"2026-08-14T06:59:32.021931Z","submitted_at":"2024-12-19T04:51:06Z","title":"Multi-Level Optimal Transport for Universal Cross-Tokenizer Knowledge Distillation on Language Models","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-11T12:15:18.402605Z"},"links":{"citing_paper":"/paper/2412.14528"},"observation_digest":"sha256:9e9e25101309be40492fb73cb41576f0d6bd1b0b025025177c3ee35b338e888a","observation_id":"ff3ed1a6-00fa-41ca-8263-d5821cc6c1e4","resolution":{"observed_at":"2026-08-11T12:15:20.413712Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:15:20.376520Z","title":null,"venue":null,"work_id":"6c7d6853-3863-4c89-b4d0-399c43828fed","year":2024},"citing_paper":{"arxiv_id":"2412.14528","last_updated":"2025-01-18T08:26:11Z","snapshot_observed_at":"2026-08-14T06:59:32.021931Z","submitted_at":"2024-12-19T04:51:06Z","title":"Multi-Level Optimal Transport for Universal Cross-Tokenizer Knowledge Distillation on Language Models","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-11T12:15:18.410305Z"},"links":{"citing_paper":"/paper/2412.14528"},"observation_digest":"sha256:6f077bd620f981a35be4e34d567c796849ed696f710a277b6dfa1df0c26e900f","observation_id":"3680b795-f89f-4aef-9daa-4d675ba72e21","resolution":{"observed_at":"2026-08-11T12:15:20.388597Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:15:20.336073Z","title":null,"venue":null,"work_id":"513628b0-b064-4072-be4b-3f0bd8a315bf","year":2013},"citing_paper":{"arxiv_id":"2412.14528","last_updated":"2025-01-18T08:26:11Z","snapshot_observed_at":"2026-08-14T06:59:32.021931Z","submitted_at":"2024-12-19T04:51:06Z","title":"Multi-Level Optimal Transport for Universal Cross-Tokenizer Knowledge Distillation on Language Models","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-11T12:15:18.420886Z"},"links":{"citing_paper":"/paper/2412.14528"},"observation_digest":"sha256:32451eb5deecbc0e5f38907c3089a1ce8070f85eba46a4233f8b17548ccc0976","observation_id":"d7714fd1-e183-4756-960c-b538a734c22b","resolution":{"observed_at":"2026-08-11T12:15:20.350269Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:15:20.313523Z","title":"R.; Pang, Y.; and Chen, H","venue":null,"work_id":"a485e628-7e47-4a24-b88e-aff7457f1c88","year":2023},"citing_paper":{"arxiv_id":"2412.14528","last_updated":"2025-01-18T08:26:11Z","snapshot_observed_at":"2026-08-14T06:59:32.021931Z","submitted_at":"2024-12-19T04:51:06Z","title":"Multi-Level Optimal Transport for Universal Cross-Tokenizer Knowledge Distillation on Language Models","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-11T12:15:18.429119Z"},"links":{"citing_paper":"/paper/2412.14528"},"observation_digest":"sha256:8b81a535e6cb2fd5ae77fb637f8cb2741656318a12dcce4cc01d92fe866a5025","observation_id":"07c21cb6-7e4c-459f-b7fe-c8394264ca76","resolution":{"observed_at":"2026-08-11T12:15:20.319787Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:15:20.291107Z","title":null,"venue":null,"work_id":"8a314ba7-f5ba-451a-b1e2-117ba6d9c7f0","year":2021},"citing_paper":{"arxiv_id":"2412.14528","last_updated":"2025-01-18T08:26:11Z","snapshot_observed_at":"2026-08-14T06:59:32.021931Z","submitted_at":"2024-12-19T04:51:06Z","title":"Multi-Level Optimal Transport for Universal Cross-Tokenizer Knowledge Distillation on Language Models","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-11T12:15:18.444654Z"},"links":{"citing_paper":"/paper/2412.14528"},"observation_digest":"sha256:0ff58d97f7b692a2394bdd413571c6bfd2d0d377b4fd0621dff7d8cb02207d47","observation_id":"28168265-d7f8-46a5-9a50-c13e91cd244b","resolution":{"observed_at":"2026-08-11T12:15:20.298231Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:15:20.271172Z","title":null,"venue":null,"work_id":"5d3d6660-d812-4244-be1b-614b0e85bf38","year":2023},"citing_paper":{"arxiv_id":"2412.14528","last_updated":"2025-01-18T08:26:11Z","snapshot_observed_at":"2026-08-14T06:59:32.021931Z","submitted_at":"2024-12-19T04:51:06Z","title":"Multi-Level Optimal Transport for Universal Cross-Tokenizer Knowledge Distillation on Language Models","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-11T12:15:18.459411Z"},"links":{"citing_paper":"/paper/2412.14528"},"observation_digest":"sha256:7f24e8e1d612fc0ef5359690dc6be7f183b278e88c29d19c0a474197c32a7070","observation_id":"128f002c-275e-4600-8308-eb2d2dd0339e","resolution":{"observed_at":"2026-08-11T12:15:20.276653Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:15:20.235630Z","title":null,"venue":null,"work_id":"5bcd0ca9-d0c2-4a1a-a692-91dae1e5d93b","year":2023},"citing_paper":{"arxiv_id":"2412.14528","last_updated":"2025-01-18T08:26:11Z","snapshot_observed_at":"2026-08-14T06:59:32.021931Z","submitted_at":"2024-12-19T04:51:06Z","title":"Multi-Level Optimal Transport for Universal Cross-Tokenizer Knowledge Distillation on Language Models","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-11T12:15:18.480693Z"},"links":{"citing_paper":"/paper/2412.14528"},"observation_digest":"sha256:2f36a206998c712a6c9b3acc9c13ffffbc2b3ca37d218d6861d3a3e1883d6a7f","observation_id":"d407abe0-01c3-4a52-9870-227943e871fd","resolution":{"observed_at":"2026-08-11T12:15:20.246467Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.08543","last_updated":"2026-01-31T09:16:35Z","snapshot_observed_at":"2026-08-13T16:04:46.474244Z","submitted_at":"2023-06-14T14:44:03Z","title":"MiniLLM: On-Policy Distillation of Large Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.08543","snapshot_observed_at":"2026-08-11T12:15:18.507800Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.14528","last_updated":"2025-01-18T08:26:11Z","snapshot_observed_at":"2026-08-14T06:59:32.021931Z","submitted_at":"2024-12-19T04:51:06Z","title":"Multi-Level Optimal Transport for Universal Cross-Tokenizer Knowledge Distillation on Language Models","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-11T12:15:18.507800Z"},"links":{"cited_paper":"/paper/2306.08543","citing_paper":"/paper/2412.14528"},"observation_digest":"sha256:8b27595d96ed49e4a0ce8717d8fede5a0ba38d12f6556f040f9be8c3e5c47a85","observation_id":"729dc30f-644a-4087-8c4a-7098a838f228","resolution":{"observed_at":"2026-08-11T12:15:18.507800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:15:20.203481Z","title":null,"venue":null,"work_id":"8ad996a4-6a62-41d6-84b3-43a5697204e1","year":2017},"citing_paper":{"arxiv_id":"2412.14528","last_updated":"2025-01-18T08:26:11Z","snapshot_observed_at":"2026-08-14T06:59:32.021931Z","submitted_at":"2024-12-19T04:51:06Z","title":"Multi-Level Optimal Transport for Universal Cross-Tokenizer Knowledge Distillation on Language Models","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-11T12:15:18.517192Z"},"links":{"citing_paper":"/paper/2412.14528"},"observation_digest":"sha256:5b8414bd79117c6ea21744a9af4b77c7f0d975bbca90595b68f419d1279c0afc","observation_id":"d6892209-0af8-452f-a47b-00c8e9164f5f","resolution":{"observed_at":"2026-08-11T12:15:20.211407Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:15:20.182456Z","title":null,"venue":null,"work_id":"0230a908-5c02-47f9-9548-7fe28cb8a368","year":2022},"citing_paper":{"arxiv_id":"2412.14528","last_updated":"2025-01-18T08:26:11Z","snapshot_observed_at":"2026-08-14T06:59:32.021931Z","submitted_at":"2024-12-19T04:51:06Z","title":"Multi-Level Optimal Transport for Universal Cross-Tokenizer Knowledge Distillation on Language Models","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-11T12:15:18.529941Z"},"links":{"citing_paper":"/paper/2412.14528"},"observation_digest":"sha256:2fa3d6cea620c1d85a1444979ce9adb3af0bb3fa5440ff9ce355f036c42ab355","observation_id":"8ff22af5-7b7e-4ffd-b38e-30f191f15b1a","resolution":{"observed_at":"2026-08-11T12:15:20.188577Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1503.02531","last_updated":"2015-03-09T15:44:49Z","snapshot_observed_at":"2026-07-06T04:11:24.157003Z","submitted_at":"2015-03-09T15:44:49Z","title":"Distilling the Knowledge in a Neural Network","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1503.02531","snapshot_observed_at":"2026-08-11T12:15:18.541778Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.14528","last_updated":"2025-01-18T08:26:11Z","snapshot_observed_at":"2026-08-14T06:59:32.021931Z","submitted_at":"2024-12-19T04:51:06Z","title":"Multi-Level Optimal Transport for Universal Cross-Tokenizer Knowledge Distillation on Language Models","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-11T12:15:18.541778Z"},"links":{"cited_paper":"/paper/1503.02531","citing_paper":"/paper/2412.14528"},"observation_digest":"sha256:a2c1b9dd3dee7514a33d8fc0af549cdb2e43e4160e240f0266fc0dc940c34cf5","observation_id":"118d794c-f23f-48df-bcd0-73c62482f5d0","resolution":{"observed_at":"2026-08-11T12:15:18.541778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-11T12:15:18.550293Z","title":"Q.; Sablayrolles, A.; Mensch, A.; Bamford, C.; Chaplot, D","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.14528","last_updated":"2025-01-18T08:26:11Z","snapshot_observed_at":"2026-08-14T06:59:32.021931Z","submitted_at":"2024-12-19T04:51:06Z","title":"Multi-Level Optimal Transport for Universal Cross-Tokenizer Knowledge Distillation on Language Models","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-11T12:15:18.550293Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2412.14528"},"observation_digest":"sha256:b4796c66d039495951df0e5068d082ae8bcac4ba3dd971c7f362db59eccc25e9","observation_id":"d6aad134-a144-4ba7-9e09-76a91671f9b7","resolution":{"observed_at":"2026-08-11T12:15:18.550293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.07947","last_updated":"2016-09-22T01:17:12Z","snapshot_observed_at":"2026-08-12T12:33:37.687350Z","submitted_at":"2016-06-25T18:16:39Z","title":"Sequence-Level Knowledge Distillation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.07947","snapshot_observed_at":"2026-08-11T12:15:18.559074Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.14528","last_updated":"2025-01-18T08:26:11Z","snapshot_observed_at":"2026-08-14T06:59:32.021931Z","submitted_at":"2024-12-19T04:51:06Z","title":"Multi-Level Optimal Transport for Universal Cross-Tokenizer Knowledge Distillation on Language Models","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-11T12:15:18.559074Z"},"links":{"cited_paper":"/paper/1606.07947","citing_paper":"/paper/2412.14528"},"observation_digest":"sha256:4daf50c60d6a37e098ec5965b9bb8e05ba56e6f76b218a8d50b8be17aa1ab51a","observation_id":"eb3a681f-d786-45f3-b255-bc6e73e66d3e","resolution":{"observed_at":"2026-08-11T12:15:18.559074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03898","last_updated":"2024-07-03T04:57:41Z","snapshot_observed_at":"2026-08-13T05:19:35.675322Z","submitted_at":"2024-02-06T11:10:35Z","title":"DistiLLM: Towards Streamlined Distillation for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03898","snapshot_observed_at":"2026-08-11T12:15:18.565667Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14528","last_updated":"2025-01-18T08:26:11Z","snapshot_observed_at":"2026-08-14T06:59:32.021931Z","submitted_at":"2024-12-19T04:51:06Z","title":"Multi-Level Optimal Transport for Universal Cross-Tokenizer Knowledge Distillation on Language Models","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-11T12:15:18.565667Z"},"links":{"cited_paper":"/paper/2402.03898","citing_paper":"/paper/2412.14528"},"observation_digest":"sha256:2147ba2275ed14c26bfc631a4d79fa1b89278d6ff3ac7d9729196feeb04987d3","observation_id":"381fdb64-d263-45d2-a983-52bb9588d22d","resolution":{"observed_at":"2026-08-11T12:15:18.565667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:15:20.145512Z","title":"B.; and Collins, M","venue":null,"work_id":"d086806e-8f33-47f8-b7ef-c78b5eb13254","year":2021},"citing_paper":{"arxiv_id":"2412.14528","last_updated":"2025-01-18T08:26:11Z","snapshot_observed_at":"2026-08-14T06:59:32.021931Z","submitted_at":"2024-12-19T04:51:06Z","title":"Multi-Level Optimal Transport for Universal Cross-Tokenizer Knowledge Distillation on Language Models","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-11T12:15:18.572644Z"},"links":{"citing_paper":"/paper/2412.14528"},"observation_digest":"sha256:d40d1c5b082bcf47f800fec91f94ef49d35cd5d41fa78497c9a84e06c671bf02","observation_id":"1de64825-1139-41e8-990c-fb76d8724286","resolution":{"observed_at":"2026-08-11T12:15:20.153578Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:15:20.118304Z","title":null,"venue":null,"work_id":"4a73e653-7a6f-4417-a018-d7e0c015ad96","year":2023},"citing_paper":{"arxiv_id":"2412.14528","last_updated":"2025-01-18T08:26:11Z","snapshot_observed_at":"2026-08-14T06:59:32.021931Z","submitted_at":"2024-12-19T04:51:06Z","title":"Multi-Level Optimal Transport for Universal Cross-Tokenizer Knowledge Distillation on Language Models","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-11T12:15:18.582666Z"},"links":{"citing_paper":"/paper/2412.14528"},"observation_digest":"sha256:b4f7608ab60869870b7468673512bf7c3c2cd20531f8777ca5170deb381d23bd","observation_id":"629266d3-4fc8-43da-83ae-0c9f91fb2bc4","resolution":{"observed_at":"2026-08-11T12:15:20.126692Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:15:20.092657Z","title":"J.; and Piccardi, M","venue":null,"work_id":"f68602da-8c18-40b2-ba12-a6ffcc0a4e22","year":2023},"citing_paper":{"arxiv_id":"2412.14528","last_updated":"2025-01-18T08:26:11Z","snapshot_observed_at":"2026-08-14T06:59:32.021931Z","submitted_at":"2024-12-19T04:51:06Z","title":"Multi-Level Optimal Transport for Universal Cross-Tokenizer Knowledge Distillation on Language Models","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-11T12:15:18.601743Z"},"links":{"citing_paper":"/paper/2412.14528"},"observation_digest":"sha256:87a0e5ba5a2aafba06bd2402a51891988263fc0322ed54a025f166738aa366c3","observation_id":"cab38dcb-3136-4721-b5ac-f5e68108580d","resolution":{"observed_at":"2026-08-11T12:15:20.102412Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:15:20.046530Z","title":null,"venue":null,"work_id":"b480ce7d-cff5-418d-8bc5-c425c1e39b6c","year":2022},"citing_paper":{"arxiv_id":"2412.14528","last_updated":"2025-01-18T08:26:11Z","snapshot_observed_at":"2026-08-14T06:59:32.021931Z","submitted_at":"2024-12-19T04:51:06Z","title":"Multi-Level Optimal Transport for Universal Cross-Tokenizer Knowledge Distillation on Language Models","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-11T12:15:18.610297Z"},"links":{"citing_paper":"/paper/2412.14528"},"observation_digest":"sha256:cf36f0ea2debebf11a35af469d10452704da6fe35f183a0a7f414ba32def9e56","observation_id":"350ae487-213e-4eae-98eb-153a2e2b6b98","resolution":{"observed_at":"2026-08-11T12:15:20.060441Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:15:20.013777Z","title":null,"venue":null,"work_id":"47d9fa7c-7ffa-4a5b-933f-e051c459bb44","year":2023},"citing_paper":{"arxiv_id":"2412.14528","last_updated":"2025-01-18T08:26:11Z","snapshot_observed_at":"2026-08-14T06:59:32.021931Z","submitted_at":"2024-12-19T04:51:06Z","title":"Multi-Level Optimal Transport for Universal Cross-Tokenizer Knowledge Distillation on Language Models","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-11T12:15:18.615608Z"},"links":{"citing_paper":"/paper/2412.14528"},"observation_digest":"sha256:40d66c213a85267f853f5f5de5da4542d454d1826f0a032e8fa9c578c51f1ee9","observation_id":"3293e023-829c-453c-9a5b-d315c3d826a1","resolution":{"observed_at":"2026-08-11T12:15:20.021740Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.11526","last_updated":"2022-09-28T01:43:56Z","snapshot_observed_at":"2026-08-14T02:25:50.344323Z","submitted_at":"2022-04-25T09:34:37Z","title":"Selective Cross-Task Distillation","version":3},"cited_work":{"arxiv_id":"2204.11526","doi":null,"metadata_source":"pith","pith_arxiv_id":"2204.11526","snapshot_observed_at":"2026-08-11T12:15:19.277018Z","title":"Selective Cross-Task Distillation","venue":"cs.LG","work_id":"3816d3ff-df2e-47e0-8de1-a93a4f435677","year":2022},"citing_paper":{"arxiv_id":"2412.14528","last_updated":"2025-01-18T08:26:11Z","snapshot_observed_at":"2026-08-14T06:59:32.021931Z","submitted_at":"2024-12-19T04:51:06Z","title":"Multi-Level Optimal Transport for Universal Cross-Tokenizer Knowledge Distillation on Language Models","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-11T12:15:18.623716Z"},"links":{"cited_paper":"/paper/2204.11526","citing_paper":"/paper/2412.14528"},"observation_digest":"sha256:30480edd9cf515d257c2eeac12e290f0b3841c062baa501f284aa6640e8f9fa6","observation_id":"41d9d3c4-fba4-402c-af90-8003942a3c9b","resolution":{"observed_at":"2026-08-11T12:15:19.283696Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:15:19.972925Z","title":null,"venue":null,"work_id":"df3bad39-530c-49b7-a445-e62442e10e61","year":2024},"citing_paper":{"arxiv_id":"2412.14528","last_updated":"2025-01-18T08:26:11Z","snapshot_observed_at":"2026-08-14T06:59:32.021931Z","submitted_at":"2024-12-19T04:51:06Z","title":"Multi-Level Optimal Transport for Universal Cross-Tokenizer Knowledge Distillation on Language Models","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-11T12:15:18.637728Z"},"links":{"citing_paper":"/paper/2412.14528"},"observation_digest":"sha256:680418de218a2294a01fb090ed6a1184188e6d951bf0b23e1d1b6cceb873cc0b","observation_id":"437d5050-7822-4d9b-9032-4fefac511783","resolution":{"observed_at":"2026-08-11T12:15:19.983337Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:15:19.924445Z","title":"S.; Shen, S.; Yong, Z","venue":null,"work_id":"79b9c63f-7368-4199-8007-b9456faaecf3","year":2023},"citing_paper":{"arxiv_id":"2412.14528","last_updated":"2025-01-18T08:26:11Z","snapshot_observed_at":"2026-08-14T06:59:32.021931Z","submitted_at":"2024-12-19T04:51:06Z","title":"Multi-Level Optimal Transport for Universal Cross-Tokenizer Knowledge Distillation on Language Models","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-11T12:15:18.646333Z"},"links":{"citing_paper":"/paper/2412.14528"},"observation_digest":"sha256:cc55937894ce6f3e82e0386dea05a0a4582ce7231c938b1d8f9d4a64c4183a84","observation_id":"87aed3fe-9fd8-473b-a13c-5d3828e81452","resolution":{"observed_at":"2026-08-11T12:15:19.936570Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:15:19.886450Z","title":"T.; and Luu, A","venue":null,"work_id":"83abd75d-8810-4e12-8093-b0167ea13e97","year":2022},"citing_paper":{"arxiv_id":"2412.14528","last_updated":"2025-01-18T08:26:11Z","snapshot_observed_at":"2026-08-14T06:59:32.021931Z","submitted_at":"2024-12-19T04:51:06Z","title":"Multi-Level Optimal Transport for Universal Cross-Tokenizer Knowledge Distillation on Language Models","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-11T12:15:18.660513Z"},"links":{"citing_paper":"/paper/2412.14528"},"observation_digest":"sha256:ad99ca9e935333c3044559eecbeaea9b1570480b428433158466501c7dcfe620","observation_id":"4a258fdb-eb11-4b93-b464-17d95a1afe88","resolution":{"observed_at":"2026-08-11T12:15:19.899054Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:15:19.856634Z","title":null,"venue":null,"work_id":"2ef2d7ae-c994-463b-ad58-171c656c74dd","year":2021},"citing_paper":{"arxiv_id":"2412.14528","last_updated":"2025-01-18T08:26:11Z","snapshot_observed_at":"2026-08-14T06:59:32.021931Z","submitted_at":"2024-12-19T04:51:06Z","title":"Multi-Level Optimal Transport for Universal Cross-Tokenizer Knowledge Distillation on Language Models","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-11T12:15:18.669407Z"},"links":{"citing_paper":"/paper/2412.14528"},"observation_digest":"sha256:b167b14e5dc2a1e17c62d1e559849bb0ff509d55a13ce702bcb5270daf1bf8bf","observation_id":"3f507bbb-23a2-4d46-a35e-35fae3f9103a","resolution":{"observed_at":"2026-08-11T12:15:19.864383Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:15:19.826582Z","title":null,"venue":null,"work_id":"47c19b76-2c0e-47b0-9b17-7b8ccb036faa","year":2019},"citing_paper":{"arxiv_id":"2412.14528","last_updated":"2025-01-18T08:26:11Z","snapshot_observed_at":"2026-08-14T06:59:32.021931Z","submitted_at":"2024-12-19T04:51:06Z","title":"Multi-Level Optimal Transport for Universal Cross-Tokenizer Knowledge Distillation on Language Models","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-11T12:15:18.690076Z"},"links":{"citing_paper":"/paper/2412.14528"},"observation_digest":"sha256:96379fee25a654f012ed9cc98baf8c9b2a236161a929a4b0fab0dc7c4c6531e3","observation_id":"eab64667-7d82-4a3e-9be1-fa0c897f28eb","resolution":{"observed_at":"2026-08-11T12:15:19.836193Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-11T12:15:18.697356Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.14528","last_updated":"2025-01-18T08:26:11Z","snapshot_observed_at":"2026-08-14T06:59:32.021931Z","submitted_at":"2024-12-19T04:51:06Z","title":"Multi-Level Optimal Transport for Universal Cross-Tokenizer Knowledge Distillation on Language Models","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-11T12:15:18.697356Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2412.14528"},"observation_digest":"sha256:ac4188e6b3c4c8abae7100dc82f48f45010f5d8ab388be575d40bc9a37320b5d","observation_id":"bfc705ea-11a3-45ec-af9d-a9691a80f167","resolution":{"observed_at":"2026-08-11T12:15:18.697356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-11T12:15:18.705471Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.14528","last_updated":"2025-01-18T08:26:11Z","snapshot_observed_at":"2026-08-14T06:59:32.021931Z","submitted_at":"2024-12-19T04:51:06Z","title":"Multi-Level Optimal Transport for Universal Cross-Tokenizer Knowledge Distillation on Language Models","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-11T12:15:18.705471Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2412.14528"},"observation_digest":"sha256:5c464e5bfd2abffdf3eee6d66bcd7b36f26410586e9488f6444c2adde4d12818","observation_id":"191b395f-aa90-4ead-97af-d72b707fea9c","resolution":{"observed_at":"2026-08-11T12:15:18.705471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.00850","last_updated":"2020-05-12T20:44:24Z","snapshot_observed_at":"2026-08-14T08:33:34.059280Z","submitted_at":"2020-05-02T15:06:47Z","title":"ENGINE: Energy-Based Inference Networks for Non-Autoregressive Machine Translation","version":2},"cited_work":{"arxiv_id":"2005.00850","doi":null,"metadata_source":"pith","pith_arxiv_id":"2005.00850","snapshot_observed_at":"2026-08-11T12:15:19.171048Z","title":"ENGINE: Energy-Based Inference Networks for Non-Autoregressive Machine Translation","venue":"cs.CL","work_id":"db31863a-af72-4c39-b697-355ebc81b9c8","year":2020},"citing_paper":{"arxiv_id":"2412.14528","last_updated":"2025-01-18T08:26:11Z","snapshot_observed_at":"2026-08-14T06:59:32.021931Z","submitted_at":"2024-12-19T04:51:06Z","title":"Multi-Level Optimal Transport for Universal Cross-Tokenizer Knowledge Distillation on Language Models","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-11T12:15:18.716270Z"},"links":{"cited_paper":"/paper/2005.00850","citing_paper":"/paper/2412.14528"},"observation_digest":"sha256:3edec4277841704197e0a85009f15dd85f520dc75d81d1cd8d28865869d4d4d0","observation_id":"38e18fdc-0bd7-43bb-aba9-f9c55148c6a0","resolution":{"observed_at":"2026-08-11T12:15:19.185826Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:15:19.797542Z","title":null,"venue":null,"work_id":"08c1fb0c-5e4e-4898-a3b4-f85923aa94e7","year":2009},"citing_paper":{"arxiv_id":"2412.14528","last_updated":"2025-01-18T08:26:11Z","snapshot_observed_at":"2026-08-14T06:59:32.021931Z","submitted_at":"2024-12-19T04:51:06Z","title":"Multi-Level Optimal Transport for Universal Cross-Tokenizer Knowledge Distillation on Language Models","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-11T12:15:18.733962Z"},"links":{"citing_paper":"/paper/2412.14528"},"observation_digest":"sha256:fa9593e98b92b4ae4a11648f2c32a1f0fc0e728fd09c15087ed7cb63d3d29b67","observation_id":"33cacb9e-6e53-4ad9-bf7c-096235f3647a","resolution":{"observed_at":"2026-08-11T12:15:19.804735Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10491","last_updated":"2024-01-22T17:16:37Z","snapshot_observed_at":"2026-08-14T02:25:46.836991Z","submitted_at":"2024-01-19T05:02:46Z","title":"Knowledge Fusion of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10491","snapshot_observed_at":"2026-08-11T12:15:18.741267Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14528","last_updated":"2025-01-18T08:26:11Z","snapshot_observed_at":"2026-08-14T06:59:32.021931Z","submitted_at":"2024-12-19T04:51:06Z","title":"Multi-Level Optimal Transport for Universal Cross-Tokenizer Knowledge Distillation on Language Models","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-11T12:15:18.741267Z"},"links":{"cited_paper":"/paper/2401.10491","citing_paper":"/paper/2412.14528"},"observation_digest":"sha256:4703043b643f015bb4d5e79f32e70804e06c477d350334ac3105522197fee4ca","observation_id":"1d2bb6e4-e4b4-4b24-acb4-977e5dac81c8","resolution":{"observed_at":"2026-08-11T12:15:18.741267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:15:19.769657Z","title":null,"venue":null,"work_id":"5d144786-35b1-4ad7-83f9-32397d4c08f9","year":2022},"citing_paper":{"arxiv_id":"2412.14528","last_updated":"2025-01-18T08:26:11Z","snapshot_observed_at":"2026-08-14T06:59:32.021931Z","submitted_at":"2024-12-19T04:51:06Z","title":"Multi-Level Optimal Transport for Universal Cross-Tokenizer Knowledge Distillation on Language Models","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-11T12:15:18.748962Z"},"links":{"citing_paper":"/paper/2412.14528"},"observation_digest":"sha256:e5a40fffe6a36e71a59d8f3978298843be95a329e5aba999f2e491c695c8fa73","observation_id":"6446808c-e008-49f8-9124-70b629098183","resolution":{"observed_at":"2026-08-11T12:15:19.778422Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:15:19.737703Z","title":null,"venue":null,"work_id":"aaaa2afb-262a-4169-9980-e1d2fad687f9","year":2023},"citing_paper":{"arxiv_id":"2412.14528","last_updated":"2025-01-18T08:26:11Z","snapshot_observed_at":"2026-08-14T06:59:32.021931Z","submitted_at":"2024-12-19T04:51:06Z","title":"Multi-Level Optimal Transport for Universal Cross-Tokenizer Knowledge Distillation on Language Models","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-11T12:15:18.756790Z"},"links":{"citing_paper":"/paper/2412.14528"},"observation_digest":"sha256:3fb7dfccf08a2f38475cfca4a806db863efa33402c3b7bac7f17f418943803a9","observation_id":"24e077ae-f6e3-43fb-9190-4a3ce21c5da1","resolution":{"observed_at":"2026-08-11T12:15:19.746679Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:15:19.709724Z","title":null,"venue":null,"work_id":"4168f78d-71d2-465d-b768-c03caa142f90","year":2023},"citing_paper":{"arxiv_id":"2412.14528","last_updated":"2025-01-18T08:26:11Z","snapshot_observed_at":"2026-08-14T06:59:32.021931Z","submitted_at":"2024-12-19T04:51:06Z","title":"Multi-Level Optimal Transport for Universal Cross-Tokenizer Knowledge Distillation on Language Models","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-11T12:15:18.763629Z"},"links":{"citing_paper":"/paper/2412.14528"},"observation_digest":"sha256:552f4a415155caa51ccf5f47434a738f11206524dc609d9dff4e866725448cb5","observation_id":"488f565d-2988-4b11-87f3-8dd30e24ea96","resolution":{"observed_at":"2026-08-11T12:15:19.718718Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02657","last_updated":"2024-12-08T13:03:38Z","snapshot_observed_at":"2026-08-13T00:38:33.059372Z","submitted_at":"2024-04-03T11:40:17Z","title":"Rethinking Kullback-Leibler Divergence in Knowledge Distillation for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02657","snapshot_observed_at":"2026-08-11T12:15:18.775519Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14528","last_updated":"2025-01-18T08:26:11Z","snapshot_observed_at":"2026-08-14T06:59:32.021931Z","submitted_at":"2024-12-19T04:51:06Z","title":"Multi-Level Optimal Transport for Universal Cross-Tokenizer Knowledge Distillation on Language Models","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-11T12:15:18.775519Z"},"links":{"cited_paper":"/paper/2404.02657","citing_paper":"/paper/2412.14528"},"observation_digest":"sha256:f17cedf63060f86da400d502d2a8bb80cc23b9d5936aa7b42fabf2cba3ee59f1","observation_id":"0bad64bc-4bfb-468e-9693-1f4dacf15406","resolution":{"observed_at":"2026-08-11T12:15:18.775519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:15:19.683069Z","title":null,"venue":null,"work_id":"8c7bbfb9-b86c-44db-a7bf-a68e1a29eb39","year":2023},"citing_paper":{"arxiv_id":"2412.14528","last_updated":"2025-01-18T08:26:11Z","snapshot_observed_at":"2026-08-14T06:59:32.021931Z","submitted_at":"2024-12-19T04:51:06Z","title":"Multi-Level Optimal Transport for Universal Cross-Tokenizer Knowledge Distillation on Language Models","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-11T12:15:18.785869Z"},"links":{"citing_paper":"/paper/2412.14528"},"observation_digest":"sha256:0b3f8e5fa3856af44d6e7c0f68af60a1ae67d820a14872973c321dfe9e9aa920","observation_id":"8f20a73e-b03c-4473-a59e-8db7cc5defff","resolution":{"observed_at":"2026-08-11T12:15:19.690785Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.13947","last_updated":"2022-03-26T00:20:05Z","snapshot_observed_at":"2026-08-13T16:15:03.499634Z","submitted_at":"2022-03-26T00:20:05Z","title":"Fantastic Questions and Where to Find Them: FairytaleQA -- An Authentic Dataset for Narrative Comprehension","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.13947","snapshot_observed_at":"2026-08-11T12:15:18.794521Z","title":"J.-J.; Bradford, N.; Sun, B.; et al","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.14528","last_updated":"2025-01-18T08:26:11Z","snapshot_observed_at":"2026-08-14T06:59:32.021931Z","submitted_at":"2024-12-19T04:51:06Z","title":"Multi-Level Optimal Transport for Universal Cross-Tokenizer Knowledge Distillation on Language Models","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-11T12:15:18.794521Z"},"links":{"cited_paper":"/paper/2203.13947","citing_paper":"/paper/2412.14528"},"observation_digest":"sha256:bd056539916ae5f1973d1fa0d98861e9f6bd80f344b265b3819c25de00983791","observation_id":"ed9bdabc-68c8-4b77-bb52-d022a441a88d","resolution":{"observed_at":"2026-08-11T12:15:18.794521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-11T12:15:18.808487Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14528","last_updated":"2025-01-18T08:26:11Z","snapshot_observed_at":"2026-08-14T06:59:32.021931Z","submitted_at":"2024-12-19T04:51:06Z","title":"Multi-Level Optimal Transport for Universal Cross-Tokenizer Knowledge Distillation on Language Models","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-11T12:15:18.808487Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2412.14528"},"observation_digest":"sha256:8ad94a232b41d17804ef735f88322622e70d34353031f0f798c2fe190c6be579","observation_id":"fba09a20-e202-47d0-a1e1-cc47abdbbc36","resolution":{"observed_at":"2026-08-11T12:15:18.808487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:15:19.660356Z","title":"M.; Li, Z.; Mallya, A.; Hoiem, D.; Jha, N","venue":null,"work_id":"51fceacb-d0f4-46cc-9bff-6847faa6dfcc","year":2020},"citing_paper":{"arxiv_id":"2412.14528","last_updated":"2025-01-18T08:26:11Z","snapshot_observed_at":"2026-08-14T06:59:32.021931Z","submitted_at":"2024-12-19T04:51:06Z","title":"Multi-Level Optimal Transport for Universal Cross-Tokenizer Knowledge Distillation on Language Models","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-11T12:15:18.825975Z"},"links":{"citing_paper":"/paper/2412.14528"},"observation_digest":"sha256:6ab57fdab4d1bb75d99cccd88813a2023a8b62d40155fbc283e11800ea70cf95","observation_id":"f3123002-0806-4aa1-bd15-90d3dd4578c0","resolution":{"observed_at":"2026-08-11T12:15:19.666830Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:15:19.637994Z","title":null,"venue":null,"work_id":"c468a4fe-9de2-4e1f-a112-066284cba2b6","year":2021},"citing_paper":{"arxiv_id":"2412.14528","last_updated":"2025-01-18T08:26:11Z","snapshot_observed_at":"2026-08-14T06:59:32.021931Z","submitted_at":"2024-12-19T04:51:06Z","title":"Multi-Level Optimal Transport for Universal Cross-Tokenizer Knowledge Distillation on Language Models","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-11T12:15:18.835689Z"},"links":{"citing_paper":"/paper/2412.14528"},"observation_digest":"sha256:66e99e8ab7aecf6172836596f1b62c749afb862a626f4041e2b712f4dd3c7f4e","observation_id":"5deef24b-9508-4410-a658-f37f9168e566","resolution":{"observed_at":"2026-08-11T12:15:19.644654Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:15:19.615792Z","title":null,"venue":null,"work_id":"f292547b-cf69-4f91-af80-7fa44d23fbe5","year":2023},"citing_paper":{"arxiv_id":"2412.14528","last_updated":"2025-01-18T08:26:11Z","snapshot_observed_at":"2026-08-14T06:59:32.021931Z","submitted_at":"2024-12-19T04:51:06Z","title":"Multi-Level Optimal Transport for Universal Cross-Tokenizer Knowledge Distillation on Language Models","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-11T12:15:18.844340Z"},"links":{"citing_paper":"/paper/2412.14528"},"observation_digest":"sha256:8b7eb977fc2f536a8d0e7cae3cc355f5529a325f4ab173c2ec32062a065bad16","observation_id":"44f7212e-e8f2-4b3b-84aa-27124f19b331","resolution":{"observed_at":"2026-08-11T12:15:19.623535Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:15:19.590072Z","title":null,"venue":null,"work_id":"3aeb6558-6dec-4438-aef3-e26b5e563217","year":2024},"citing_paper":{"arxiv_id":"2412.14528","last_updated":"2025-01-18T08:26:11Z","snapshot_observed_at":"2026-08-14T06:59:32.021931Z","submitted_at":"2024-12-19T04:51:06Z","title":"Multi-Level Optimal Transport for Universal Cross-Tokenizer Knowledge Distillation on Language Models","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-11T12:15:18.851372Z"},"links":{"citing_paper":"/paper/2412.14528"},"observation_digest":"sha256:9c7c726fba30472076efb81a9ed8c34f3b82b02191923743019aa545c6fe8ff7","observation_id":"8b406024-37f4-4235-8736-9b0732a84220","resolution":{"observed_at":"2026-08-11T12:15:19.595749Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-08-06T03:13:37.403059Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-08-11T12:15:18.862570Z","title":"V.; et al","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.14528","last_updated":"2025-01-18T08:26:11Z","snapshot_observed_at":"2026-08-14T06:59:32.021931Z","submitted_at":"2024-12-19T04:51:06Z","title":"Multi-Level Optimal Transport for Universal Cross-Tokenizer Knowledge Distillation on Language Models","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-11T12:15:18.862570Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2412.14528"},"observation_digest":"sha256:0490816b96c19667b94eafe2aa5fac6f83c967bba3ca2b169ac856afb686d69d","observation_id":"73458e47-922e-4aae-9b98-85cac2421a97","resolution":{"observed_at":"2026-08-11T12:15:18.862570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17328","last_updated":"2024-10-01T16:45:12Z","snapshot_observed_at":"2026-08-14T02:27:02.614503Z","submitted_at":"2024-06-25T07:25:15Z","title":"Dual-Space Knowledge Distillation for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.17328","snapshot_observed_at":"2026-08-11T12:15:18.870487Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14528","last_updated":"2025-01-18T08:26:11Z","snapshot_observed_at":"2026-08-14T06:59:32.021931Z","submitted_at":"2024-12-19T04:51:06Z","title":"Multi-Level Optimal Transport for Universal Cross-Tokenizer Knowledge Distillation on Language Models","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-11T12:15:18.870487Z"},"links":{"cited_paper":"/paper/2406.17328","citing_paper":"/paper/2412.14528"},"observation_digest":"sha256:0ab16773fabd041ac16bce9b477d9336847f21a8d86190b437fce9d6f038b5fb","observation_id":"8dbdda11-5339-42a4-b8d8-b20e1c0d0f4f","resolution":{"observed_at":"2026-08-11T12:15:18.870487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:15:19.566644Z","title":null,"venue":null,"work_id":"c96719f5-ffe1-4bde-8dd8-20a01e0df0c8","year":2022},"citing_paper":{"arxiv_id":"2412.14528","last_updated":"2025-01-18T08:26:11Z","snapshot_observed_at":"2026-08-14T06:59:32.021931Z","submitted_at":"2024-12-19T04:51:06Z","title":"Multi-Level Optimal Transport for Universal Cross-Tokenizer Knowledge Distillation on Language Models","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-11T12:15:18.882438Z"},"links":{"citing_paper":"/paper/2412.14528"},"observation_digest":"sha256:28654384f7d16d2735a29a19ac82a492efe135c9b69145e51f11ed3b02c8a51c","observation_id":"d0f2b1b2-299d-47e8-a1dc-e8244411b051","resolution":{"observed_at":"2026-08-11T12:15:19.574628Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.14528","last_updated":"2025-01-18T08:26:11Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-14T06:59:32.021931Z","submitted_at":"2024-12-19T04:51:06Z","title":"Multi-Level Optimal Transport for Universal Cross-Tokenizer Knowledge Distillation on Language Models"},"reference_resolution":{"displayed":55,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":43,"verified_exact":2,"verified_fuzzy":9},"total_outbound_references":55},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 55 of 55 outbound references and 2 inbound Pith citation observations for arXiv:2412.14528."}