{"as_of":"2026-08-15T03:19:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0f11984e16ba1be278df4f072971fe9fcaed273fa75fc2c8bbee179a25eebbfe","coverage":[{"denominator":23,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":23,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T15:31:04.126947Z","state":"measured"},{"denominator":28,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":28,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T13:37:15.652974Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-10T19:55:19.662938Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"1908.01851","last_updated":"2019-08-02T15:17:27Z","snapshot_observed_at":"2026-08-14T15:26:13.826711Z","submitted_at":"2019-08-02T15:17:27Z","title":"Self-Knowledge Distillation in Natural Language Processing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.01851","snapshot_observed_at":"2026-08-12T13:37:15.652974Z","title":"Self-Knowledge Distillation in Natural Language Processing,","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2411.16122","last_updated":"2025-06-20T07:03:19Z","snapshot_observed_at":"2026-08-13T00:39:32.293946Z","submitted_at":"2024-11-25T06:14:20Z","title":"From Collapse to Stability: A Knowledge-Driven Ensemble Framework for Scaling Up Click-Through Rate Prediction Models","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T13:37:15.652974Z"},"links":{"cited_paper":"/paper/1908.01851","citing_paper":"/paper/2411.16122"},"observation_digest":"sha256:62ea44ee9e3a832b5ca454ce19f6817015d25dfd83a1a4f4946e0cafb58067db","observation_id":"ca2580fb-a6a5-4b10-8507-ab7f943e905b","resolution":{"observed_at":"2026-08-12T13:37:15.652974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.01851","last_updated":"2019-08-02T15:17:27Z","snapshot_observed_at":"2026-08-14T15:26:13.826711Z","submitted_at":"2019-08-02T15:17:27Z","title":"Self-Knowledge Distillation in Natural Language Processing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.01851","snapshot_observed_at":"2026-08-12T12:45:19.910575Z","title":"Self-knowledge distillation in natural language processing.arXiv preprint arXiv:1908.01851,","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2411.16991","last_updated":"2024-11-25T23:37:48Z","snapshot_observed_at":"2026-08-14T09:19:58.622460Z","submitted_at":"2024-11-25T23:37:48Z","title":"Dynamic Self-Distillation via Previous Mini-batches for Fine-tuning Small Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T12:45:19.910575Z"},"links":{"cited_paper":"/paper/1908.01851","citing_paper":"/paper/2411.16991"},"observation_digest":"sha256:50ab61ce247fbdd9223c780d2a4cfa4a06d60debfda2f306626a70e6b7f9b3ba","observation_id":"15a08c71-bb43-4622-9580-fd57349bdcea","resolution":{"observed_at":"2026-08-12T12:45:19.910575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.01851","last_updated":"2019-08-02T15:17:27Z","snapshot_observed_at":"2026-08-14T15:26:13.826711Z","submitted_at":"2019-08-02T15:17:27Z","title":"Self-Knowledge Distillation in Natural Language Processing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.01851","snapshot_observed_at":"2026-08-12T11:06:35.859787Z","title":"Self-knowledge dis- tillation in natural language processing","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2411.18674","last_updated":"2025-05-05T14:25:01Z","snapshot_observed_at":"2026-08-14T14:04:12.371424Z","submitted_at":"2024-11-27T18:50:15Z","title":"Active Data Curation Effectively Distills Large-Scale Multimodal Models","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T11:06:35.859787Z"},"links":{"cited_paper":"/paper/1908.01851","citing_paper":"/paper/2411.18674"},"observation_digest":"sha256:fcf392ae97e5f2063ff840dac695348455f6d3e7de852b3cbe5094c11cdac807","observation_id":"b6dbf92f-aca6-4612-8e90-019fecc013a1","resolution":{"observed_at":"2026-08-12T11:06:35.859787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.01851","last_updated":"2019-08-02T15:17:27Z","snapshot_observed_at":"2026-08-14T15:26:13.826711Z","submitted_at":"2019-08-02T15:17:27Z","title":"Self-Knowledge Distillation in Natural Language Processing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.01851","snapshot_observed_at":"2026-08-11T17:24:33.944728Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.08939","last_updated":"2024-12-17T06:30:00Z","snapshot_observed_at":"2026-08-11T17:19:13.623717Z","submitted_at":"2024-12-12T05:01:17Z","title":"Dynamic Contrastive Knowledge Distillation for Efficient Image Restoration","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-11T17:24:33.944728Z"},"links":{"cited_paper":"/paper/1908.01851","citing_paper":"/paper/2412.08939"},"observation_digest":"sha256:a42895977af476c29b7c606fc77ca18d7881478055a2a432bf7ef91c81ab8f9e","observation_id":"ff185a2e-87b2-4ac6-bb02-198ca0273c23","resolution":{"observed_at":"2026-08-11T17:24:33.944728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.01851","last_updated":"2019-08-02T15:17:27Z","snapshot_observed_at":"2026-08-14T15:26:13.826711Z","submitted_at":"2019-08-02T15:17:27Z","title":"Self-Knowledge Distillation in Natural Language Processing","version":1},"cited_work":{"arxiv_id":"1908.01851","doi":null,"metadata_source":"pith","pith_arxiv_id":"1908.01851","snapshot_observed_at":"2026-08-10T19:55:19.662938Z","title":"Self-Knowledge Distillation in Natural Language Processing","venue":"cs.CL","work_id":"b914fadd-9f99-4cb9-8da2-5e7fda51f9bb","year":2019},"citing_paper":{"arxiv_id":"2501.09608","last_updated":"2025-01-16T15:32:41Z","snapshot_observed_at":"2026-08-12T07:43:24.320466Z","submitted_at":"2025-01-16T15:32:41Z","title":"Metric Learning with Progressive Self-Distillation for Audio-Visual Embedding Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T19:55:19.029364Z"},"links":{"cited_paper":"/paper/1908.01851","citing_paper":"/paper/2501.09608"},"observation_digest":"sha256:d7544110a56551735706db790dc316c55833d2b3709e44fc1bcc8eee94217f40","observation_id":"bb92b290-8b76-48c0-ae93-33978bd4e03f","resolution":{"observed_at":"2026-08-10T19:55:19.672289Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/1908.01851/citation-record","integrity":"/paper/1908.01851/integrity","json":"/paper/1908.01851/citation-record.json","paper":"/paper/1908.01851"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:31:04.022810Z","title":", \" * write output.state after.block = add.period write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"1908.01851","last_updated":"2019-08-02T15:17:27Z","snapshot_observed_at":"2026-08-14T15:26:13.826711Z","submitted_at":"2019-08-02T15:17:27Z","title":"Self-Knowledge Distillation in Natural Language Processing","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-14T15:31:04.022810Z"},"links":{"citing_paper":"/paper/1908.01851"},"observation_digest":"sha256:8ed25c42c18a4583872f4ed1a90ab87857b9b539b60c2c8c2fc42f853e40809b","observation_id":"a21611f2-14e9-4ef2-9cbf-a237cbcf96e9","resolution":{"observed_at":"2026-08-14T15:31:04.022810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:31:04.028598Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"1908.01851","last_updated":"2019-08-02T15:17:27Z","snapshot_observed_at":"2026-08-14T15:26:13.826711Z","submitted_at":"2019-08-02T15:17:27Z","title":"Self-Knowledge Distillation in Natural Language Processing","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-14T15:31:04.028598Z"},"links":{"citing_paper":"/paper/1908.01851"},"observation_digest":"sha256:c86e380e8c8d3f66d66d4851ba2e865109a88ca9973a1a67e562290e87027d59","observation_id":"e5d7251c-1e88-4a30-8e56-5821601f46e6","resolution":{"observed_at":"2026-08-14T15:31:04.028598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1608.00318","last_updated":"2017-03-02T15:34:01Z","snapshot_observed_at":"2026-08-14T21:46:00.335518Z","submitted_at":"2016-08-01T04:42:49Z","title":"A Neural Knowledge Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1608.00318","snapshot_observed_at":"2026-08-14T15:31:04.033651Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"1908.01851","last_updated":"2019-08-02T15:17:27Z","snapshot_observed_at":"2026-08-14T15:26:13.826711Z","submitted_at":"2019-08-02T15:17:27Z","title":"Self-Knowledge Distillation in Natural Language Processing","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-14T15:31:04.033651Z"},"links":{"cited_paper":"/paper/1608.00318","citing_paper":"/paper/1908.01851"},"observation_digest":"sha256:969901f23dc6a686e9a61b9b60175c52f6480f20f30ed77b31d0f8f880d05a91","observation_id":"87405898-0a0c-41a5-8f91-814dbca2ff1b","resolution":{"observed_at":"2026-08-14T15:31:04.033651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:31:04.451542Z","title":null,"venue":null,"work_id":"a3d0edbf-f66f-4743-b224-1c6891825780","year":2015},"citing_paper":{"arxiv_id":"1908.01851","last_updated":"2019-08-02T15:17:27Z","snapshot_observed_at":"2026-08-14T15:26:13.826711Z","submitted_at":"2019-08-02T15:17:27Z","title":"Self-Knowledge Distillation in Natural Language Processing","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-14T15:31:04.038443Z"},"links":{"citing_paper":"/paper/1908.01851"},"observation_digest":"sha256:eba64485d102ecf685465d9051bb0526bae57474d280ba37d307c09f5901a540","observation_id":"3a1635a3-16b1-4e5a-bd52-fb078592a2f9","resolution":{"observed_at":"2026-08-14T15:31:04.455870Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:31:04.438536Z","title":"Courville, and Pascal Vincent","venue":null,"work_id":"07a391ed-ea72-4d14-b4d8-8f0597cf0d64","year":2013},"citing_paper":{"arxiv_id":"1908.01851","last_updated":"2019-08-02T15:17:27Z","snapshot_observed_at":"2026-08-14T15:26:13.826711Z","submitted_at":"2019-08-02T15:17:27Z","title":"Self-Knowledge Distillation in Natural Language Processing","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-14T15:31:04.044773Z"},"links":{"citing_paper":"/paper/1908.01851"},"observation_digest":"sha256:c97bb7f18888a3e22a33f39249bafd8e1ab4647004ac0f8bdf9c6ae21074f137","observation_id":"2f4c5b4c-2db0-4873-9389-a9de7a48cb09","resolution":{"observed_at":"2026-08-14T15:31:04.442685Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:31:04.425056Z","title":null,"venue":null,"work_id":"7352ef45-d1c7-4902-8bf9-eb0f8434141c","year":2003},"citing_paper":{"arxiv_id":"1908.01851","last_updated":"2019-08-02T15:17:27Z","snapshot_observed_at":"2026-08-14T15:26:13.826711Z","submitted_at":"2019-08-02T15:17:27Z","title":"Self-Knowledge Distillation in Natural Language Processing","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-14T15:31:04.049556Z"},"links":{"citing_paper":"/paper/1908.01851"},"observation_digest":"sha256:7b1cad4448051db245a2f25b26a58ff90da7cf43940f92a53a25735aec611f98","observation_id":"0f892ffb-c0e8-47a8-975e-558b39a9fe1d","resolution":{"observed_at":"2026-08-14T15:31:04.429255Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:31:04.411734Z","title":null,"venue":null,"work_id":"f20c0394-1997-4e4f-8ac1-0c70912bcbd0","year":2017},"citing_paper":{"arxiv_id":"1908.01851","last_updated":"2019-08-02T15:17:27Z","snapshot_observed_at":"2026-08-14T15:26:13.826711Z","submitted_at":"2019-08-02T15:17:27Z","title":"Self-Knowledge Distillation in Natural Language Processing","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-14T15:31:04.054003Z"},"links":{"citing_paper":"/paper/1908.01851"},"observation_digest":"sha256:65d131e7204d9702d281a53b38d6f500c4b6bb58683edee90dfafc570acb3b6d","observation_id":"1a11ca05-ecd2-49f4-af43-d08f1a8fee06","resolution":{"observed_at":"2026-08-14T15:31:04.416063Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:31:04.398439Z","title":null,"venue":null,"work_id":"15cc5a61-92aa-43f2-a69d-b05ecf197622","year":2018},"citing_paper":{"arxiv_id":"1908.01851","last_updated":"2019-08-02T15:17:27Z","snapshot_observed_at":"2026-08-14T15:26:13.826711Z","submitted_at":"2019-08-02T15:17:27Z","title":"Self-Knowledge Distillation in Natural Language Processing","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-14T15:31:04.058191Z"},"links":{"citing_paper":"/paper/1908.01851"},"observation_digest":"sha256:2092d9a29d52ea2b92d5faa7157c830ab82006c61a6e7bc3af99816ea209ab33","observation_id":"cbba6648-86bb-4701-a054-f5ba5293906b","resolution":{"observed_at":"2026-08-14T15:31:04.402742Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:31:04.384672Z","title":null,"venue":null,"work_id":"48cbf5fd-9840-49f8-9dd9-d6a999fde038","year":2016},"citing_paper":{"arxiv_id":"1908.01851","last_updated":"2019-08-02T15:17:27Z","snapshot_observed_at":"2026-08-14T15:26:13.826711Z","submitted_at":"2019-08-02T15:17:27Z","title":"Self-Knowledge Distillation in Natural Language Processing","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-14T15:31:04.063402Z"},"links":{"citing_paper":"/paper/1908.01851"},"observation_digest":"sha256:271a5ba6ac5424918623f60ed2ebd118e0757906c9a7317575bcbf0d2b10766a","observation_id":"bd76decd-4a7c-4ed1-90e5-9e449c7d154d","resolution":{"observed_at":"2026-08-14T15:31:04.389030Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1503.02531","last_updated":"2015-03-09T15:44:49Z","snapshot_observed_at":"2026-08-14T22:57:08.956233Z","submitted_at":"2015-03-09T15:44:49Z","title":"Distilling the Knowledge in a Neural Network","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1503.02531","snapshot_observed_at":"2026-08-14T15:31:04.067654Z","title":"Hinton, Oriol Vinyals, and Jeffrey Dean","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"1908.01851","last_updated":"2019-08-02T15:17:27Z","snapshot_observed_at":"2026-08-14T15:26:13.826711Z","submitted_at":"2019-08-02T15:17:27Z","title":"Self-Knowledge Distillation in Natural Language Processing","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-14T15:31:04.067654Z"},"links":{"cited_paper":"/paper/1503.02531","citing_paper":"/paper/1908.01851"},"observation_digest":"sha256:6dc691d67d59587c61576be3a50258faccf7a0d244fb06b2a738e7b78f4e1c61","observation_id":"1d63484d-b2c4-42ea-8a0c-780317e075c4","resolution":{"observed_at":"2026-08-14T15:31:04.067654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:31:04.369983Z","title":"Le, Maxim Krikun, Yonghui Wu, Zhifeng Chen, Nikhil Thorat, Fernanda B","venue":null,"work_id":"4e624b71-1dd4-4dea-a630-31271ea12648","year":2017},"citing_paper":{"arxiv_id":"1908.01851","last_updated":"2019-08-02T15:17:27Z","snapshot_observed_at":"2026-08-14T15:26:13.826711Z","submitted_at":"2019-08-02T15:17:27Z","title":"Self-Knowledge Distillation in Natural Language Processing","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-14T15:31:04.072275Z"},"links":{"citing_paper":"/paper/1908.01851"},"observation_digest":"sha256:1b286f9e7c8cb6b7af3457a7fa18dc01b1f9f293909c209a0987815fe37b991e","observation_id":"2bf2810d-d55f-474b-8e66-10267cbeae2f","resolution":{"observed_at":"2026-08-14T15:31:04.374833Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00941","last_updated":"2015-04-07T22:39:18Z","snapshot_observed_at":"2026-08-14T22:53:42.853028Z","submitted_at":"2015-04-03T21:22:52Z","title":"A Simple Way to Initialize Recurrent Networks of Rectified Linear Units","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1504.00941","snapshot_observed_at":"2026-08-14T15:31:04.076309Z","title":"Le, Navdeep Jaitly, and Geoffrey E","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"1908.01851","last_updated":"2019-08-02T15:17:27Z","snapshot_observed_at":"2026-08-14T15:26:13.826711Z","submitted_at":"2019-08-02T15:17:27Z","title":"Self-Knowledge Distillation in Natural Language Processing","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-14T15:31:04.076309Z"},"links":{"cited_paper":"/paper/1504.00941","citing_paper":"/paper/1908.01851"},"observation_digest":"sha256:08101b58289d70a8e8d5cd629224c384ea148d0c6399b5c5cf89adaa056aca1e","observation_id":"88278ac1-ce16-4a17-b9f9-8350abae15e5","resolution":{"observed_at":"2026-08-14T15:31:04.076309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:31:04.355279Z","title":null,"venue":null,"work_id":"23f8e723-344c-4099-a24b-f38cbddc6813","year":1993},"citing_paper":{"arxiv_id":"1908.01851","last_updated":"2019-08-02T15:17:27Z","snapshot_observed_at":"2026-08-14T15:26:13.826711Z","submitted_at":"2019-08-02T15:17:27Z","title":"Self-Knowledge Distillation in Natural Language Processing","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-14T15:31:04.081018Z"},"links":{"citing_paper":"/paper/1908.01851"},"observation_digest":"sha256:8f5a1308cc266ac45aadbbada087dbdf1e857c893e95c8a0f943efcaf89f29d2","observation_id":"c0eac101-051a-460f-88fa-49d692c9758e","resolution":{"observed_at":"2026-08-14T15:31:04.360133Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.07843","last_updated":"2016-09-26T04:06:13Z","snapshot_observed_at":"2026-07-06T05:12:10.387914Z","submitted_at":"2016-09-26T04:06:13Z","title":"Pointer Sentinel Mixture Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.07843","snapshot_observed_at":"2026-08-14T15:31:04.085434Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"1908.01851","last_updated":"2019-08-02T15:17:27Z","snapshot_observed_at":"2026-08-14T15:26:13.826711Z","submitted_at":"2019-08-02T15:17:27Z","title":"Self-Knowledge Distillation in Natural Language Processing","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-14T15:31:04.085434Z"},"links":{"cited_paper":"/paper/1609.07843","citing_paper":"/paper/1908.01851"},"observation_digest":"sha256:9780ff58117f3286b81f24c457136d0bc71f9b89c9043022cf761e227ebb6b88","observation_id":"d3b3b52d-d3a0-44c2-80e4-d8e9cbe859fd","resolution":{"observed_at":"2026-08-14T15:31:04.085434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:31:04.340446Z","title":null,"venue":null,"work_id":"edd1fd8a-18b3-45f2-b1de-7308cba1db25","year":2013},"citing_paper":{"arxiv_id":"1908.01851","last_updated":"2019-08-02T15:17:27Z","snapshot_observed_at":"2026-08-14T15:26:13.826711Z","submitted_at":"2019-08-02T15:17:27Z","title":"Self-Knowledge Distillation in Natural Language Processing","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-14T15:31:04.090026Z"},"links":{"citing_paper":"/paper/1908.01851"},"observation_digest":"sha256:85cce986921fbe4d06e7f62363abd3b9865fe41873184b4b13d6be67d864b624","observation_id":"f8c90d4d-2ccf-49d7-ad17-ce15c120a4ee","resolution":{"observed_at":"2026-08-14T15:31:04.345548Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:31:04.325777Z","title":null,"venue":null,"work_id":"0e1df750-fe21-42bf-a1af-5d21084997d0","year":2010},"citing_paper":{"arxiv_id":"1908.01851","last_updated":"2019-08-02T15:17:27Z","snapshot_observed_at":"2026-08-14T15:26:13.826711Z","submitted_at":"2019-08-02T15:17:27Z","title":"Self-Knowledge Distillation in Natural Language Processing","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-14T15:31:04.094883Z"},"links":{"citing_paper":"/paper/1908.01851"},"observation_digest":"sha256:2b0d04736aef47019d0b7994bff2a1a7a6d522cba07ca63f002fd9f07052626f","observation_id":"b97a718b-3e7a-4b8f-9cb4-7312bb0551c3","resolution":{"observed_at":"2026-08-14T15:31:04.330248Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:31:04.309856Z","title":null,"venue":null,"work_id":"1d18fe2a-c627-4db1-a615-9c8e35aafbbb","year":2014},"citing_paper":{"arxiv_id":"1908.01851","last_updated":"2019-08-02T15:17:27Z","snapshot_observed_at":"2026-08-14T15:26:13.826711Z","submitted_at":"2019-08-02T15:17:27Z","title":"Self-Knowledge Distillation in Natural Language Processing","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-14T15:31:04.099919Z"},"links":{"citing_paper":"/paper/1908.01851"},"observation_digest":"sha256:b571c2424daa5f7eae8c188f6d80b745eac419ab5ea905ac8d2848e825cd7b57","observation_id":"5c878aea-7f95-4eb4-87ab-c5cbcbc4b6c8","resolution":{"observed_at":"2026-08-14T15:31:04.315053Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:31:04.294837Z","title":null,"venue":null,"work_id":"47ab94d1-75c3-4661-b510-69d2b5050fef","year":2017},"citing_paper":{"arxiv_id":"1908.01851","last_updated":"2019-08-02T15:17:27Z","snapshot_observed_at":"2026-08-14T15:26:13.826711Z","submitted_at":"2019-08-02T15:17:27Z","title":"Self-Knowledge Distillation in Natural Language Processing","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-14T15:31:04.104287Z"},"links":{"citing_paper":"/paper/1908.01851"},"observation_digest":"sha256:7a73e777a0f9b15109ce5289966770e471a5ec8b71646607bde0789ff6314881","observation_id":"fc764649-6309-4044-ab76-4a369308231a","resolution":{"observed_at":"2026-08-14T15:31:04.299017Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6550","last_updated":"2015-03-27T11:52:28Z","snapshot_observed_at":"2026-07-06T04:04:16.777653Z","submitted_at":"2014-12-19T22:40:51Z","title":"FitNets: Hints for Thin Deep Nets","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6550","snapshot_observed_at":"2026-08-14T15:31:04.108762Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"1908.01851","last_updated":"2019-08-02T15:17:27Z","snapshot_observed_at":"2026-08-14T15:26:13.826711Z","submitted_at":"2019-08-02T15:17:27Z","title":"Self-Knowledge Distillation in Natural Language Processing","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-14T15:31:04.108762Z"},"links":{"cited_paper":"/paper/1412.6550","citing_paper":"/paper/1908.01851"},"observation_digest":"sha256:8f5242480f17ffb1be7b25be00702800275454ddd93690239c98920979ad9ba0","observation_id":"e4045c16-5396-41d1-95e7-442107ea81d9","resolution":{"observed_at":"2026-08-14T15:31:04.108762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:31:04.280238Z","title":null,"venue":null,"work_id":"b18d4eb7-2956-48f2-b618-08a84d14c77a","year":2016},"citing_paper":{"arxiv_id":"1908.01851","last_updated":"2019-08-02T15:17:27Z","snapshot_observed_at":"2026-08-14T15:26:13.826711Z","submitted_at":"2019-08-02T15:17:27Z","title":"Self-Knowledge Distillation in Natural Language Processing","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-14T15:31:04.113715Z"},"links":{"citing_paper":"/paper/1908.01851"},"observation_digest":"sha256:4fec7c23dda327f1775904e740032715ae90152b3e1a270619fb915c1a21bec7","observation_id":"b158ed1c-5a41-41a6-970f-234265b1ab2f","resolution":{"observed_at":"2026-08-14T15:31:04.284879Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:31:04.265595Z","title":null,"venue":null,"work_id":"4560bd17-2c1b-45bc-a46f-ae231786ed27","year":2017},"citing_paper":{"arxiv_id":"1908.01851","last_updated":"2019-08-02T15:17:27Z","snapshot_observed_at":"2026-08-14T15:26:13.826711Z","submitted_at":"2019-08-02T15:17:27Z","title":"Self-Knowledge Distillation in Natural Language Processing","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-14T15:31:04.118069Z"},"links":{"citing_paper":"/paper/1908.01851"},"observation_digest":"sha256:046f9acd3457691b1e2389cd35de089b4c648fc306f5cd2c55b154258d0e8830","observation_id":"327ec771-0a91-40d8-b670-1253ae986974","resolution":{"observed_at":"2026-08-14T15:31:04.270021Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:31:04.250118Z","title":null,"venue":null,"work_id":"5ff5d796-223c-4e50-9501-62b3138c2ef9","year":2014},"citing_paper":{"arxiv_id":"1908.01851","last_updated":"2019-08-02T15:17:27Z","snapshot_observed_at":"2026-08-14T15:26:13.826711Z","submitted_at":"2019-08-02T15:17:27Z","title":"Self-Knowledge Distillation in Natural Language Processing","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-14T15:31:04.122443Z"},"links":{"citing_paper":"/paper/1908.01851"},"observation_digest":"sha256:45a49282feee025e2ed1f14eb0a9bb02fd4909865ed8216c661213e33f99941d","observation_id":"033b3bd9-fd6f-4edd-8ae3-dda2ee7f55f8","resolution":{"observed_at":"2026-08-14T15:31:04.254850Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:31:04.233539Z","title":"Gomez, Lukasz Kaiser, and Illia Polosukhin","venue":null,"work_id":"c187210c-b1ca-4898-92bf-fe37ec2733a2","year":2017},"citing_paper":{"arxiv_id":"1908.01851","last_updated":"2019-08-02T15:17:27Z","snapshot_observed_at":"2026-08-14T15:26:13.826711Z","submitted_at":"2019-08-02T15:17:27Z","title":"Self-Knowledge Distillation in Natural Language Processing","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-14T15:31:04.126947Z"},"links":{"citing_paper":"/paper/1908.01851"},"observation_digest":"sha256:c86c2460de9d79f1ca5f081870db876eac7439a676b79d5f511062d80e7e7c44","observation_id":"ca6c4753-1c24-4ed7-ba1b-3a0b6366abe4","resolution":{"observed_at":"2026-08-14T15:31:04.239594Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"1908.01851","last_updated":"2019-08-02T15:17:27Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-14T15:26:13.826711Z","submitted_at":"2019-08-02T15:17:27Z","title":"Self-Knowledge Distillation in Natural Language Processing"},"reference_resolution":{"displayed":23,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":20,"verified_exact":0,"verified_fuzzy":3},"total_outbound_references":23},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 23 of 23 outbound references and 5 inbound Pith citation observations for arXiv:1908.01851."}