{"as_of":"2026-08-11T11:28:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d6e2037640d6c68b63e08cedddaaed6a35c091294000f76a1baa781dc3d2b238","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":16,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":16,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":16,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":16,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T22:48:56.719676Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":152,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"1804.03235","last_updated":"2020-08-20T22:04:36Z","snapshot_observed_at":"2026-08-03T00:20:05.793800Z","submitted_at":"2018-04-09T20:56:03Z","title":"Large scale distributed neural network training through online distillation","version":2},"cited_work":{"arxiv_id":"1804.03235","doi":"10.48550/arxiv.1804.03235","metadata_source":"arxiv_reference","pith_arxiv_id":"1804.03235","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Large Scale Distributed Neural Network Training through Online Distillation","venue":"arXiv (Cornell University)","work_id":"eaf8922f-efbd-41b1-b29e-d4589ef7f01d","year":2018},"citing_paper":{"arxiv_id":"2104.14294","last_updated":"2021-05-24T17:49:18Z","snapshot_observed_at":"2026-08-04T11:32:10.695202Z","submitted_at":"2021-04-29T12:28:51Z","title":"Emerging Properties in Self-Supervised Vision Transformers","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-16T14:04:51.458382Z"},"links":{"cited_paper":"/paper/1804.03235","citing_paper":"/paper/2104.14294"},"observation_digest":"sha256:ea52c797c964790afd832b8ee5e66d7b519f5170ea2c27dc563d0e89a2b76b73","observation_id":"b4290041-96f0-4152-9a82-96f990142131","resolution":{"observed_at":"2026-05-16T14:04:51.498387Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1804.03235","last_updated":"2020-08-20T22:04:36Z","snapshot_observed_at":"2026-08-03T00:20:05.793800Z","submitted_at":"2018-04-09T20:56:03Z","title":"Large scale distributed neural network training through online distillation","version":2},"cited_work":{"arxiv_id":"1804.03235","doi":"10.48550/arxiv.1804.03235","metadata_source":"arxiv_reference","pith_arxiv_id":"1804.03235","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Large Scale Distributed Neural Network Training through Online Distillation","venue":"arXiv (Cornell University)","work_id":"eaf8922f-efbd-41b1-b29e-d4589ef7f01d","year":2018},"citing_paper":{"arxiv_id":"2309.16588","last_updated":"2024-04-12T09:38:33Z","snapshot_observed_at":"2026-08-07T09:40:32.614733Z","submitted_at":"2023-09-28T16:45:46Z","title":"Vision Transformers Need Registers","version":2},"reference_index":182,"source":"arxiv_source","source_observed_at":"2026-05-13T09:41:37.937046Z"},"links":{"cited_paper":"/paper/1804.03235","citing_paper":"/paper/2309.16588"},"observation_digest":"sha256:58cdc072e14f9845a39248f235088e274ecdc2f447d5ab873c3baf93947ab800","observation_id":"b717688e-bec4-43c8-9fe5-b5d3e8375e3b","resolution":{"observed_at":"2026-05-13T09:41:38.167514Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1804.03235","last_updated":"2020-08-20T22:04:36Z","snapshot_observed_at":"2026-08-03T00:20:05.793800Z","submitted_at":"2018-04-09T20:56:03Z","title":"Large scale distributed neural network training through online distillation","version":2},"cited_work":{"arxiv_id":"1804.03235","doi":"10.48550/arxiv.1804.03235","metadata_source":"arxiv_reference","pith_arxiv_id":"1804.03235","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Large Scale Distributed Neural Network Training through Online Distillation","venue":"arXiv (Cornell University)","work_id":"eaf8922f-efbd-41b1-b29e-d4589ef7f01d","year":2018},"citing_paper":{"arxiv_id":"2408.00118","last_updated":"2024-10-02T15:22:49Z","snapshot_observed_at":"2026-08-02T16:20:09.773989Z","submitted_at":"2024-07-31T19:13:07Z","title":"Gemma 2: Improving Open Language Models at a Practical Size","version":3},"reference_index":159,"source":"arxiv_source","source_observed_at":"2026-05-10T12:11:16.326752Z"},"links":{"cited_paper":"/paper/1804.03235","citing_paper":"/paper/2408.00118"},"observation_digest":"sha256:73980ae8ce379ee7e2853b12e28af65ed05edb4cf6f7c477867c8a843b8cad21","observation_id":"ce14800f-1557-42fb-87fc-dd9ac110c15d","resolution":{"observed_at":"2026-05-10T12:11:16.544210Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1804.03235","last_updated":"2020-08-20T22:04:36Z","snapshot_observed_at":"2026-08-03T00:20:05.793800Z","submitted_at":"2018-04-09T20:56:03Z","title":"Large scale distributed neural network training through online distillation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1804.03235","snapshot_observed_at":"2026-08-10T22:48:56.719676Z","title":"Large scale distributed neural network training through online distillation,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.00693","last_updated":"2025-01-01T01:11:16Z","snapshot_observed_at":"2026-08-11T05:54:52.990865Z","submitted_at":"2025-01-01T01:11:16Z","title":"Beyond Model Scale Limits: End-Edge-Cloud Federated Learning with Self-Rectified Knowledge Agglomeration","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T22:48:56.719676Z"},"links":{"cited_paper":"/paper/1804.03235","citing_paper":"/paper/2501.00693"},"observation_digest":"sha256:387ec5e0c22d1478e7b44226cda60c63556cec79663ccefd48036635ad1dcac7","observation_id":"1b6250d1-edef-448b-a617-b70536537829","resolution":{"observed_at":"2026-08-10T22:48:56.719676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1804.03235","last_updated":"2020-08-20T22:04:36Z","snapshot_observed_at":"2026-08-03T00:20:05.793800Z","submitted_at":"2018-04-09T20:56:03Z","title":"Large scale distributed neural network training through online distillation","version":2},"cited_work":{"arxiv_id":"1804.03235","doi":"10.48550/arxiv.1804.03235","metadata_source":"arxiv_reference","pith_arxiv_id":"1804.03235","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Large Scale Distributed Neural Network Training through Online Distillation","venue":"arXiv (Cornell University)","work_id":"eaf8922f-efbd-41b1-b29e-d4589ef7f01d","year":2018},"citing_paper":{"arxiv_id":"2503.19786","last_updated":"2025-03-25T15:52:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-25T15:52:34Z","title":"Gemma 3 Technical Report","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-22T22:18:55.976503Z"},"links":{"cited_paper":"/paper/1804.03235","citing_paper":"/paper/2503.19786"},"observation_digest":"sha256:0801291e5ceb3d49e4fa69b54279f749dcbf339420d2f66b4b2793c24d932295","observation_id":"23fca9e2-d940-40cc-919f-24fd1e71bf8e","resolution":{"observed_at":"2026-05-22T22:22:12.260167Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1804.03235","last_updated":"2020-08-20T22:04:36Z","snapshot_observed_at":"2026-08-03T00:20:05.793800Z","submitted_at":"2018-04-09T20:56:03Z","title":"Large scale distributed neural network training through online distillation","version":2},"cited_work":{"arxiv_id":"1804.03235","doi":"10.48550/arxiv.1804.03235","metadata_source":"arxiv_reference","pith_arxiv_id":"1804.03235","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Large Scale Distributed Neural Network Training through Online Distillation","venue":"arXiv (Cornell University)","work_id":"eaf8922f-efbd-41b1-b29e-d4589ef7f01d","year":2018},"citing_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-05-19T05:48:02.828938Z"},"links":{"cited_paper":"/paper/1804.03235","citing_paper":"/paper/2507.06261"},"observation_digest":"sha256:e04c5298ecf6b3c85071bd7e321d075494ff6b03c67d6d8dcfa107954ed82c9e","observation_id":"d8b87f14-6a0b-4696-b8be-4cb61f993b47","resolution":{"observed_at":"2026-05-19T05:52:07.665258Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1804.03235","last_updated":"2020-08-20T22:04:36Z","snapshot_observed_at":"2026-08-03T00:20:05.793800Z","submitted_at":"2018-04-09T20:56:03Z","title":"Large scale distributed neural network training through online distillation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1804.03235","snapshot_observed_at":"2026-08-06T15:43:46.990439Z","title":"Large scale distributed neural network training t hrough online distillation,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.15256","last_updated":"2025-07-21T05:37:08Z","snapshot_observed_at":"2026-08-06T15:34:07.438124Z","submitted_at":"2025-07-21T05:37:08Z","title":"Optimal Transceiver Design in Over-the-Air Federated Distillation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T15:43:46.990439Z"},"links":{"cited_paper":"/paper/1804.03235","citing_paper":"/paper/2507.15256"},"observation_digest":"sha256:c4cb4c978ab46ea521d200ea342cd0ba7b7f03538aff99e1ebf4d1dcb03672f2","observation_id":"c4c0afed-2076-466a-a5b2-92dd9baf6b6c","resolution":{"observed_at":"2026-08-06T15:43:46.990439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1804.03235","last_updated":"2020-08-20T22:04:36Z","snapshot_observed_at":"2026-08-03T00:20:05.793800Z","submitted_at":"2018-04-09T20:56:03Z","title":"Large scale distributed neural network training through online distillation","version":2},"cited_work":{"arxiv_id":"1804.03235","doi":"10.48550/arxiv.1804.03235","metadata_source":"arxiv_reference","pith_arxiv_id":"1804.03235","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Large Scale Distributed Neural Network Training through Online Distillation","venue":"arXiv (Cornell University)","work_id":"eaf8922f-efbd-41b1-b29e-d4589ef7f01d","year":2018},"citing_paper":{"arxiv_id":"2507.21166","last_updated":"2026-06-22T12:55:50Z","snapshot_observed_at":"2026-08-09T18:52:49.528708Z","submitted_at":"2025-07-25T13:05:01Z","title":"The Ratchet Effect in Silico: How Interaction Drives Cumulative Intelligence in Large Language Models","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-05-19T02:38:27.510872Z"},"links":{"cited_paper":"/paper/1804.03235","citing_paper":"/paper/2507.21166"},"observation_digest":"sha256:704069b916a60bd982c57faf09f16102e83875f022be0811c243e6aaf0ade1fe","observation_id":"2b55ff7a-7fd7-4257-9a7e-274e60bbda3f","resolution":{"observed_at":"2026-05-19T02:42:00.002358Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1804.03235","last_updated":"2020-08-20T22:04:36Z","snapshot_observed_at":"2026-08-03T00:20:05.793800Z","submitted_at":"2018-04-09T20:56:03Z","title":"Large scale distributed neural network training through online distillation","version":2},"cited_work":{"arxiv_id":"1804.03235","doi":"10.48550/arxiv.1804.03235","metadata_source":"arxiv_reference","pith_arxiv_id":"1804.03235","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Large Scale Distributed Neural Network Training through Online Distillation","venue":"arXiv (Cornell University)","work_id":"eaf8922f-efbd-41b1-b29e-d4589ef7f01d","year":2018},"citing_paper":{"arxiv_id":"2604.21027","last_updated":"2026-08-02T16:15:42Z","snapshot_observed_at":"2026-08-10T23:41:30.183421Z","submitted_at":"2026-04-22T19:18:36Z","title":"HypEHR: Hyperbolic Modeling of Electronic Health Records for Efficient Question Answering","version":1},"reference_index":178,"source":"arxiv_source","source_observed_at":"2026-05-09T23:51:47.724033Z"},"links":{"cited_paper":"/paper/1804.03235","citing_paper":"/paper/2604.21027"},"observation_digest":"sha256:b9b9146f0551a956e7154d14d8f0bf4a50dae1d1d4b9fd5632ac7939c5c89a4b","observation_id":"95e477ed-9046-42c0-96bd-44e82e0536af","resolution":{"observed_at":"2026-05-09T23:54:45.166952Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1804.03235","last_updated":"2020-08-20T22:04:36Z","snapshot_observed_at":"2026-08-03T00:20:05.793800Z","submitted_at":"2018-04-09T20:56:03Z","title":"Large scale distributed neural network training through online distillation","version":2},"cited_work":{"arxiv_id":"1804.03235","doi":"10.48550/arxiv.1804.03235","metadata_source":"arxiv_reference","pith_arxiv_id":"1804.03235","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Large Scale Distributed Neural Network Training through Online Distillation","venue":"arXiv (Cornell University)","work_id":"eaf8922f-efbd-41b1-b29e-d4589ef7f01d","year":2018},"citing_paper":{"arxiv_id":"2604.23268","last_updated":"2026-04-25T12:19:33Z","snapshot_observed_at":"2026-07-06T23:09:29.537323Z","submitted_at":"2026-04-25T12:19:33Z","title":"LatentBurst: A Fast and Efficient Multi Frame Super-Resolution for Hexadeca-Bayer Pattern CIS images","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-08T08:48:09.398221Z"},"links":{"cited_paper":"/paper/1804.03235","citing_paper":"/paper/2604.23268"},"observation_digest":"sha256:dd24d2b00f6816c4f59db556d27c216ed02918ba1804616266fc4b1c96ffffc8","observation_id":"2c0d22fa-eedf-4fff-adbc-f7a777f31145","resolution":{"observed_at":"2026-05-11T20:31:11.968340Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1804.03235","last_updated":"2020-08-20T22:04:36Z","snapshot_observed_at":"2026-08-03T00:20:05.793800Z","submitted_at":"2018-04-09T20:56:03Z","title":"Large scale distributed neural network training through online distillation","version":2},"cited_work":{"arxiv_id":"1804.03235","doi":"10.48550/arxiv.1804.03235","metadata_source":"arxiv_reference","pith_arxiv_id":"1804.03235","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Large Scale Distributed Neural Network Training through Online Distillation","venue":"arXiv (Cornell University)","work_id":"eaf8922f-efbd-41b1-b29e-d4589ef7f01d","year":2018},"citing_paper":{"arxiv_id":"2605.05718","last_updated":"2026-05-07T06:08:06Z","snapshot_observed_at":"2026-08-06T15:59:58.345614Z","submitted_at":"2026-05-07T06:08:06Z","title":"Enabling Federated Inference via Unsupervised Consensus Embedding","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-08T15:06:27.437479Z"},"links":{"cited_paper":"/paper/1804.03235","citing_paper":"/paper/2605.05718"},"observation_digest":"sha256:b266bba79e84f0019d53994a82ac82102ccfb7b9ae9e4bec8479d9ad037136b4","observation_id":"59aebcfc-3205-4747-9a21-72a29377f62c","resolution":{"observed_at":"2026-05-11T18:36:07.875551Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1804.03235","last_updated":"2020-08-20T22:04:36Z","snapshot_observed_at":"2026-08-03T00:20:05.793800Z","submitted_at":"2018-04-09T20:56:03Z","title":"Large scale distributed neural network training through online distillation","version":2},"cited_work":{"arxiv_id":"1804.03235","doi":"10.48550/arxiv.1804.03235","metadata_source":"arxiv_reference","pith_arxiv_id":"1804.03235","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Large Scale Distributed Neural Network Training through Online Distillation","venue":"arXiv (Cornell University)","work_id":"eaf8922f-efbd-41b1-b29e-d4589ef7f01d","year":2018},"citing_paper":{"arxiv_id":"2605.09356","last_updated":"2026-05-10T06:11:46Z","snapshot_observed_at":"2026-07-06T23:21:26.017420Z","submitted_at":"2026-05-10T06:11:46Z","title":"Function-Space ADMM for Decentralized Federated Learning: A Control Theoretic Perspective","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-12T04:07:54.716306Z"},"links":{"cited_paper":"/paper/1804.03235","citing_paper":"/paper/2605.09356"},"observation_digest":"sha256:59d1176acb7673b4d4c39bc6829376fe19e2d9576cddccbeaeec87d355a276ef","observation_id":"65ed5b5e-5cc9-4a64-9119-4dc667e6c3ef","resolution":{"observed_at":"2026-05-12T06:36:26.935644Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1804.03235","last_updated":"2020-08-20T22:04:36Z","snapshot_observed_at":"2026-08-03T00:20:05.793800Z","submitted_at":"2018-04-09T20:56:03Z","title":"Large scale distributed neural network training through online distillation","version":2},"cited_work":{"arxiv_id":"1804.03235","doi":"10.48550/arxiv.1804.03235","metadata_source":"arxiv_reference","pith_arxiv_id":"1804.03235","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Large Scale Distributed Neural Network Training through Online Distillation","venue":"arXiv (Cornell University)","work_id":"eaf8922f-efbd-41b1-b29e-d4589ef7f01d","year":2018},"citing_paper":{"arxiv_id":"2605.21322","last_updated":"2026-05-20T15:50:49Z","snapshot_observed_at":"2026-08-03T23:38:37.609037Z","submitted_at":"2026-05-20T15:50:49Z","title":"Optimized Federated Knowledge Distillation with Distributed Neural Architecture Search","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-21T05:42:32.050913Z"},"links":{"cited_paper":"/paper/1804.03235","citing_paper":"/paper/2605.21322"},"observation_digest":"sha256:ce769b8d3b9467e99a5672760eef964f4d9d817d2c63cfdb9857ea82461fe182","observation_id":"7ba269ad-7474-4973-a851-add08194d938","resolution":{"observed_at":"2026-05-21T05:43:58.955772Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1804.03235","last_updated":"2020-08-20T22:04:36Z","snapshot_observed_at":"2026-08-03T00:20:05.793800Z","submitted_at":"2018-04-09T20:56:03Z","title":"Large scale distributed neural network training through online distillation","version":2},"cited_work":{"arxiv_id":"1804.03235","doi":"10.48550/arxiv.1804.03235","metadata_source":"arxiv_reference","pith_arxiv_id":"1804.03235","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Large Scale Distributed Neural Network Training through Online Distillation","venue":"arXiv (Cornell University)","work_id":"eaf8922f-efbd-41b1-b29e-d4589ef7f01d","year":2018},"citing_paper":{"arxiv_id":"2606.24747","last_updated":"2026-06-23T16:09:57Z","snapshot_observed_at":"2026-08-10T15:30:02.152769Z","submitted_at":"2026-06-23T16:09:57Z","title":"Scaling Laws for Task-Specific LLM Distillation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-25T23:29:49.787477Z"},"links":{"cited_paper":"/paper/1804.03235","citing_paper":"/paper/2606.24747"},"observation_digest":"sha256:7442e3b85e302223042604b6328c5c831e52a6f6f1ad9ccda177d3af451e0f8a","observation_id":"f719f77c-941f-4a0f-8cc4-af0a02c5fb75","resolution":{"observed_at":"2026-07-04T17:40:00.752562Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1804.03235","last_updated":"2020-08-20T22:04:36Z","snapshot_observed_at":"2026-08-03T00:20:05.793800Z","submitted_at":"2018-04-09T20:56:03Z","title":"Large scale distributed neural network training through online distillation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1804.03235","snapshot_observed_at":"2026-08-01T03:02:01.645052Z","title":"and Hinton, Geoffrey E","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25271","last_updated":"2026-07-28T04:18:49Z","snapshot_observed_at":"2026-08-10T14:39:39.683275Z","submitted_at":"2026-07-28T04:18:49Z","title":"Bridging Compute- and Data-Optimal Pretraining","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-01T03:02:01.645052Z"},"links":{"cited_paper":"/paper/1804.03235","citing_paper":"/paper/2607.25271"},"observation_digest":"sha256:24aa9814cb98049b0b49beaaad7be46555bb6dfbb61013876d8ee0b25d9347ad","observation_id":"82af35fa-8f92-4ab7-93cb-f7edf6ec8898","resolution":{"observed_at":"2026-08-01T03:02:01.645052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1804.03235","last_updated":"2020-08-20T22:04:36Z","snapshot_observed_at":"2026-08-03T00:20:05.793800Z","submitted_at":"2018-04-09T20:56:03Z","title":"Large scale distributed neural network training through online distillation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1804.03235","snapshot_observed_at":"2026-08-06T00:10:37.428710Z","title":"arXiv preprint arXiv:1804.03235 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01473","last_updated":"2026-08-02T20:09:45Z","snapshot_observed_at":"2026-08-10T08:41:27.286983Z","submitted_at":"2026-08-02T20:09:45Z","title":"Slot2Text: Object-Centric Visual Tokenization for Efficient and Spatially Traceable Surgical MLLMs","version":1},"reference_index":116,"source":"arxiv_source","source_observed_at":"2026-08-06T00:10:37.428710Z"},"links":{"cited_paper":"/paper/1804.03235","citing_paper":"/paper/2608.01473"},"observation_digest":"sha256:f78e72d21a6d1c569f4fef190459a7effb4fbcbcccd9c6c7bf3a606f73e597ac","observation_id":"82fd8473-1d5f-43ee-9503-fddb8d10444f","resolution":{"observed_at":"2026-08-06T00:10:37.428710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/1804.03235/citation-record","integrity":"/paper/1804.03235/integrity","json":"/paper/1804.03235/citation-record.json","paper":"/paper/1804.03235"},"outbound":[],"paper":{"arxiv_id":"1804.03235","last_updated":"2020-08-20T22:04:36Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-03T00:20:05.793800Z","submitted_at":"2018-04-09T20:56:03Z","title":"Large scale distributed neural network training through online distillation"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 16 inbound Pith citation observations for arXiv:1804.03235."}