{"as_of":"2026-08-19T01:03:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e3185bb8c1b8c57e06e2319ccd7149fb870c4f52219842f5f9cd2f508302992a","coverage":[{"denominator":49,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":49,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T00:41:45.400805Z","state":"measured"},{"denominator":49,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":49,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.00129/citation-record","integrity":"/paper/2608.00129/integrity","json":"/paper/2608.00129/citation-record.json","paper":"/paper/2608.00129"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:41:41.845238Z","title":"Maximum likelihood estimation of intrinsic dimension,","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2608.00129","last_updated":"2026-07-31T13:19:08Z","snapshot_observed_at":"2026-08-13T01:57:23.335554Z","submitted_at":"2026-07-31T13:19:08Z","title":"Progressive$^2$: A Teacher-Student Progressive Co-Evolving Knowledge Distillation Method for Substantial Model Compression","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T00:41:41.845238Z"},"links":{"citing_paper":"/paper/2608.00129"},"observation_digest":"sha256:7d12707029383d5dd0146e632a9db7d05dce8eb56a76fd73e4dd641b08cc0cee","observation_id":"54d30d06-2e1a-4f50-8a32-23f85b8719b7","resolution":{"observed_at":"2026-08-04T00:41:41.845238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:41:41.915913Z","title":"Estimating the intrinsic dimension of datasets by a minimal neighborhood information,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.00129","last_updated":"2026-07-31T13:19:08Z","snapshot_observed_at":"2026-08-13T01:57:23.335554Z","submitted_at":"2026-07-31T13:19:08Z","title":"Progressive$^2$: A Teacher-Student Progressive Co-Evolving Knowledge Distillation Method for Substantial Model Compression","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T00:41:41.915913Z"},"links":{"citing_paper":"/paper/2608.00129"},"observation_digest":"sha256:753b457ea6e0cfb3bf3a2a01e7f29afe1d14b06c38beeb17d9e5579d1608a57c","observation_id":"29ece130-2877-44a6-b02b-1234ae9b39a4","resolution":{"observed_at":"2026-08-04T00:41:41.915913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:41:41.996537Z","title":"Intrinsic dimension of data representations in deep neural networks,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.00129","last_updated":"2026-07-31T13:19:08Z","snapshot_observed_at":"2026-08-13T01:57:23.335554Z","submitted_at":"2026-07-31T13:19:08Z","title":"Progressive$^2$: A Teacher-Student Progressive Co-Evolving Knowledge Distillation Method for Substantial Model Compression","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T00:41:41.996537Z"},"links":{"citing_paper":"/paper/2608.00129"},"observation_digest":"sha256:5fc3588bdf164f65de3395d972365b2df02ca18ec344dac1401ae1c285af35f7","observation_id":"25f6940a-6c0e-428c-9e09-f32dd68950bb","resolution":{"observed_at":"2026-08-04T00:41:41.996537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:41:42.102457Z","title":"Rethinking feature-based knowledge distillation for face recognition,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.00129","last_updated":"2026-07-31T13:19:08Z","snapshot_observed_at":"2026-08-13T01:57:23.335554Z","submitted_at":"2026-07-31T13:19:08Z","title":"Progressive$^2$: A Teacher-Student Progressive Co-Evolving Knowledge Distillation Method for Substantial Model Compression","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T00:41:42.102457Z"},"links":{"citing_paper":"/paper/2608.00129"},"observation_digest":"sha256:b2544a76d6a9fba803a5ddfdc7d54dce6399d1246e841d0369f15be461ed5b6c","observation_id":"bdc76e4b-8641-430b-9016-aa33edab9801","resolution":{"observed_at":"2026-08-04T00:41:42.102457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:41:42.191100Z","title":"Understand- ing deep learning requires rethinking generalization,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.00129","last_updated":"2026-07-31T13:19:08Z","snapshot_observed_at":"2026-08-13T01:57:23.335554Z","submitted_at":"2026-07-31T13:19:08Z","title":"Progressive$^2$: A Teacher-Student Progressive Co-Evolving Knowledge Distillation Method for Substantial Model Compression","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T00:41:42.191100Z"},"links":{"citing_paper":"/paper/2608.00129"},"observation_digest":"sha256:e1f7d814992b9a4c5060989e729833261c9c20d77d710024c586a1d2f56fe54f","observation_id":"48b77857-2091-4507-98c8-9129c4152d58","resolution":{"observed_at":"2026-08-04T00:41:42.191100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1511.06068","last_updated":"2016-06-10T10:59:37Z","snapshot_observed_at":"2026-08-14T22:22:16.965995Z","submitted_at":"2015-11-19T06:23:09Z","title":"Reducing Overfitting in Deep Networks by Decorrelating Representations","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.06068","snapshot_observed_at":"2026-08-04T00:41:42.271034Z","title":"Reduc- ing overfitting in deep networks by decorrelating representations,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2608.00129","last_updated":"2026-07-31T13:19:08Z","snapshot_observed_at":"2026-08-13T01:57:23.335554Z","submitted_at":"2026-07-31T13:19:08Z","title":"Progressive$^2$: A Teacher-Student Progressive Co-Evolving Knowledge Distillation Method for Substantial Model Compression","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T00:41:42.271034Z"},"links":{"cited_paper":"/paper/1511.06068","citing_paper":"/paper/2608.00129"},"observation_digest":"sha256:49dc0c6eb1102065907863ff14844d62528c4096c59447935d6a60408b5846e1","observation_id":"7dda9964-5885-400d-bff1-b60be9e45c53","resolution":{"observed_at":"2026-08-04T00:41:42.271034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:41:42.350556Z","title":"Rethinking the value of network pruning,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.00129","last_updated":"2026-07-31T13:19:08Z","snapshot_observed_at":"2026-08-13T01:57:23.335554Z","submitted_at":"2026-07-31T13:19:08Z","title":"Progressive$^2$: A Teacher-Student Progressive Co-Evolving Knowledge Distillation Method for Substantial Model Compression","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T00:41:42.350556Z"},"links":{"citing_paper":"/paper/2608.00129"},"observation_digest":"sha256:fe3e2820bfaf0f2f41fdd00c98143c904a8efde60148cfdfef9f7c31576773f1","observation_id":"58c69924-75d9-4e4b-a4bc-515c942ec7e7","resolution":{"observed_at":"2026-08-04T00:41:42.350556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:41:42.409843Z","title":"Separability and geometry of object manifolds in deep neural networks,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.00129","last_updated":"2026-07-31T13:19:08Z","snapshot_observed_at":"2026-08-13T01:57:23.335554Z","submitted_at":"2026-07-31T13:19:08Z","title":"Progressive$^2$: A Teacher-Student Progressive Co-Evolving Knowledge Distillation Method for Substantial Model Compression","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T00:41:42.409843Z"},"links":{"citing_paper":"/paper/2608.00129"},"observation_digest":"sha256:18fced37b4e96f29a490fa4c79aa8db72b57266c0c277e6e890a9f6e5a9aef5f","observation_id":"45e9a17d-7924-464e-a35c-f35a08211f40","resolution":{"observed_at":"2026-08-04T00:41:42.409843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:41:42.493973Z","title":"The cityscapes dataset for semantic urban scene understanding,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2608.00129","last_updated":"2026-07-31T13:19:08Z","snapshot_observed_at":"2026-08-13T01:57:23.335554Z","submitted_at":"2026-07-31T13:19:08Z","title":"Progressive$^2$: A Teacher-Student Progressive Co-Evolving Knowledge Distillation Method for Substantial Model Compression","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T00:41:42.493973Z"},"links":{"citing_paper":"/paper/2608.00129"},"observation_digest":"sha256:51ca4afb8e1c92d7e83400419fb89735fd76166ae87dc927d3a3ef5c9e3e7085","observation_id":"a8733015-ea0e-4630-aec8-c0bfda921dc0","resolution":{"observed_at":"2026-08-04T00:41:42.493973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:41:42.572258Z","title":"Segnet: A deep con- volutional encoder-decoder architecture for image segmentation,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.00129","last_updated":"2026-07-31T13:19:08Z","snapshot_observed_at":"2026-08-13T01:57:23.335554Z","submitted_at":"2026-07-31T13:19:08Z","title":"Progressive$^2$: A Teacher-Student Progressive Co-Evolving Knowledge Distillation Method for Substantial Model Compression","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T00:41:42.572258Z"},"links":{"citing_paper":"/paper/2608.00129"},"observation_digest":"sha256:e20cbf2f7b3ca4865b1a9fd0a185cb3adb2c4c97caa85aa7124a2361db895cdc","observation_id":"42877d43-5794-4e0e-adfb-24ae6d70e468","resolution":{"observed_at":"2026-08-04T00:41:42.572258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:41:42.631420Z","title":"Deep residual learning for image recognition,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2608.00129","last_updated":"2026-07-31T13:19:08Z","snapshot_observed_at":"2026-08-13T01:57:23.335554Z","submitted_at":"2026-07-31T13:19:08Z","title":"Progressive$^2$: A Teacher-Student Progressive Co-Evolving Knowledge Distillation Method for Substantial Model Compression","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T00:41:42.631420Z"},"links":{"citing_paper":"/paper/2608.00129"},"observation_digest":"sha256:0cf9add410399f70ada7c291d49db458d1aef05c6b89585adb4627deaeba8852","observation_id":"cd7895d0-b1ce-4f2e-8de5-f244d387d43e","resolution":{"observed_at":"2026-08-04T00:41:42.631420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:41:42.685429Z","title":"Learning multiple layers of features from tiny images,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2608.00129","last_updated":"2026-07-31T13:19:08Z","snapshot_observed_at":"2026-08-13T01:57:23.335554Z","submitted_at":"2026-07-31T13:19:08Z","title":"Progressive$^2$: A Teacher-Student Progressive Co-Evolving Knowledge Distillation Method for Substantial Model Compression","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T00:41:42.685429Z"},"links":{"citing_paper":"/paper/2608.00129"},"observation_digest":"sha256:af3b75b46cb5aae4971881a0a5c80cc53ed594312252130e3aafedf323c8276b","observation_id":"44bdb5af-71f4-4d98-a10b-e43596ca69e5","resolution":{"observed_at":"2026-08-04T00:41:42.685429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:41:42.740798Z","title":"Pruning filters for efficient convnets,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.00129","last_updated":"2026-07-31T13:19:08Z","snapshot_observed_at":"2026-08-13T01:57:23.335554Z","submitted_at":"2026-07-31T13:19:08Z","title":"Progressive$^2$: A Teacher-Student Progressive Co-Evolving Knowledge Distillation Method for Substantial Model Compression","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T00:41:42.740798Z"},"links":{"citing_paper":"/paper/2608.00129"},"observation_digest":"sha256:895c0e85188718e875b38065e04d2b76f3288a359cea6d824aa378d32497c989","observation_id":"0e816b68-970f-4911-a5b8-0d430d0b3cd0","resolution":{"observed_at":"2026-08-04T00:41:42.740798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:41:42.820937Z","title":"Distilling the knowledge in a neural network,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2608.00129","last_updated":"2026-07-31T13:19:08Z","snapshot_observed_at":"2026-08-13T01:57:23.335554Z","submitted_at":"2026-07-31T13:19:08Z","title":"Progressive$^2$: A Teacher-Student Progressive Co-Evolving Knowledge Distillation Method for Substantial Model Compression","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T00:41:42.820937Z"},"links":{"citing_paper":"/paper/2608.00129"},"observation_digest":"sha256:3b2d4e7eab3cfbeae818c830b31b9acbec63b6f8f8176581692add31cd13fce8","observation_id":"0ffa45fa-ac20-445a-85b7-5254302d442a","resolution":{"observed_at":"2026-08-04T00:41:42.820937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:41:42.879307Z","title":"Improved knowledge distillation via teacher assis- tant,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.00129","last_updated":"2026-07-31T13:19:08Z","snapshot_observed_at":"2026-08-13T01:57:23.335554Z","submitted_at":"2026-07-31T13:19:08Z","title":"Progressive$^2$: A Teacher-Student Progressive Co-Evolving Knowledge Distillation Method for Substantial Model Compression","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T00:41:42.879307Z"},"links":{"citing_paper":"/paper/2608.00129"},"observation_digest":"sha256:c6114aeeba4681d5f8506ce4448f53ece6f51ae52a1cf104b813c5f34009e10b","observation_id":"373c1a3d-c105-4419-af27-5063b675503e","resolution":{"observed_at":"2026-08-04T00:41:42.879307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:41:42.925512Z","title":"Knowledge distillation from a stronger teacher,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.00129","last_updated":"2026-07-31T13:19:08Z","snapshot_observed_at":"2026-08-13T01:57:23.335554Z","submitted_at":"2026-07-31T13:19:08Z","title":"Progressive$^2$: A Teacher-Student Progressive Co-Evolving Knowledge Distillation Method for Substantial Model Compression","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T00:41:42.925512Z"},"links":{"citing_paper":"/paper/2608.00129"},"observation_digest":"sha256:1bf98e09d7fd9e11eb8c8f191b211f763097fa8fc8e961f6cffdafd3a98ca9f7","observation_id":"c79ff685-4b04-4198-836a-b11fc996e34b","resolution":{"observed_at":"2026-08-04T00:41:42.925512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:41:43.036651Z","title":"Conflict-averse gradi- ent descent for multi-task learning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.00129","last_updated":"2026-07-31T13:19:08Z","snapshot_observed_at":"2026-08-13T01:57:23.335554Z","submitted_at":"2026-07-31T13:19:08Z","title":"Progressive$^2$: A Teacher-Student Progressive Co-Evolving Knowledge Distillation Method for Substantial Model Compression","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T00:41:43.036651Z"},"links":{"citing_paper":"/paper/2608.00129"},"observation_digest":"sha256:0689f3a2041413f23c38a695da6cbf836ea7386558106232c51d74a33cf28c3c","observation_id":"3fd47dc6-395d-420e-ac95-b9205d43335e","resolution":{"observed_at":"2026-08-04T00:41:43.036651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.09355","last_updated":"2019-08-25T16:13:24Z","snapshot_observed_at":"2026-08-14T21:37:39.248967Z","submitted_at":"2019-08-25T16:13:24Z","title":"Patient Knowledge Distillation for BERT Model Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.09355","snapshot_observed_at":"2026-08-04T00:41:43.093855Z","title":"Patient knowledge distillation for bert model compression,","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2608.00129","last_updated":"2026-07-31T13:19:08Z","snapshot_observed_at":"2026-08-13T01:57:23.335554Z","submitted_at":"2026-07-31T13:19:08Z","title":"Progressive$^2$: A Teacher-Student Progressive Co-Evolving Knowledge Distillation Method for Substantial Model Compression","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T00:41:43.093855Z"},"links":{"cited_paper":"/paper/1908.09355","citing_paper":"/paper/2608.00129"},"observation_digest":"sha256:bba1512f91627ffedc060e0479d80cb879ae9c43ddfe9ff5724a9247d418b4e4","observation_id":"fd44600d-a514-43ac-ab1d-bc1b4840391a","resolution":{"observed_at":"2026-08-04T00:41:43.093855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:41:43.156779Z","title":"Curriculum temperature for knowledge distillation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.00129","last_updated":"2026-07-31T13:19:08Z","snapshot_observed_at":"2026-08-13T01:57:23.335554Z","submitted_at":"2026-07-31T13:19:08Z","title":"Progressive$^2$: A Teacher-Student Progressive Co-Evolving Knowledge Distillation Method for Substantial Model Compression","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T00:41:43.156779Z"},"links":{"citing_paper":"/paper/2608.00129"},"observation_digest":"sha256:b2c88963939ed4d9cc3e9763177a3b02b0ba234dcb4cc5964d53f8c5d5d7543a","observation_id":"9030a84c-9a0b-4b18-bdc3-45a0dc5d431f","resolution":{"observed_at":"2026-08-04T00:41:43.156779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:41:43.227117Z","title":"Rethinking soft labels for knowledge distillation: A bias–variance tradeoff perspective,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.00129","last_updated":"2026-07-31T13:19:08Z","snapshot_observed_at":"2026-08-13T01:57:23.335554Z","submitted_at":"2026-07-31T13:19:08Z","title":"Progressive$^2$: A Teacher-Student Progressive Co-Evolving Knowledge Distillation Method for Substantial Model Compression","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T00:41:43.227117Z"},"links":{"citing_paper":"/paper/2608.00129"},"observation_digest":"sha256:6b6d138a003e7c37e4f81e99a883199ff9844f699751fa10cdd54c85ef58b92f","observation_id":"77ddb675-da69-4a63-9d3d-618c68925add","resolution":{"observed_at":"2026-08-04T00:41:43.227117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:41:43.305427Z","title":"Controllable dynamic multi- task architectures,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.00129","last_updated":"2026-07-31T13:19:08Z","snapshot_observed_at":"2026-08-13T01:57:23.335554Z","submitted_at":"2026-07-31T13:19:08Z","title":"Progressive$^2$: A Teacher-Student Progressive Co-Evolving Knowledge Distillation Method for Substantial Model Compression","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T00:41:43.305427Z"},"links":{"citing_paper":"/paper/2608.00129"},"observation_digest":"sha256:266eb5f02e42d8c0c413c00f41f23208af01c7c977a66b97fd92452ae598b93d","observation_id":"b55e39f0-b369-4498-b6de-9205450a91e8","resolution":{"observed_at":"2026-08-04T00:41:43.305427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-04T00:41:43.369475Z","title":"Gpt-4 technical report,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.00129","last_updated":"2026-07-31T13:19:08Z","snapshot_observed_at":"2026-08-13T01:57:23.335554Z","submitted_at":"2026-07-31T13:19:08Z","title":"Progressive$^2$: A Teacher-Student Progressive Co-Evolving Knowledge Distillation Method for Substantial Model Compression","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T00:41:43.369475Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2608.00129"},"observation_digest":"sha256:7f756222449134de027373aa9c5b2ffe34e9f197ccc157ca485d072758c02b52","observation_id":"8e0e6295-45e0-44b0-93c2-fb9a94c6e9a2","resolution":{"observed_at":"2026-08-04T00:41:43.369475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-18T18:18:37.449517Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-04T00:41:43.429602Z","title":"Deepseek-v3 technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.00129","last_updated":"2026-07-31T13:19:08Z","snapshot_observed_at":"2026-08-13T01:57:23.335554Z","submitted_at":"2026-07-31T13:19:08Z","title":"Progressive$^2$: A Teacher-Student Progressive Co-Evolving Knowledge Distillation Method for Substantial Model Compression","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T00:41:43.429602Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2608.00129"},"observation_digest":"sha256:e3b3e915d7bf05be8ff3aa7b7cb9630fe8a823239631480c1135ca3a3b0a639f","observation_id":"1e1bafa9-c788-4ad8-a806-f43d9475171a","resolution":{"observed_at":"2026-08-04T00:41:43.429602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:41:43.469735Z","title":"Student customized knowledge distillation: Bridging the gap between student and teacher,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.00129","last_updated":"2026-07-31T13:19:08Z","snapshot_observed_at":"2026-08-13T01:57:23.335554Z","submitted_at":"2026-07-31T13:19:08Z","title":"Progressive$^2$: A Teacher-Student Progressive Co-Evolving Knowledge Distillation Method for Substantial Model Compression","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T00:41:43.469735Z"},"links":{"citing_paper":"/paper/2608.00129"},"observation_digest":"sha256:76769805d4eed0920792dbf176c8a57c558e84326ba1b1232145c0a92954a823","observation_id":"7802ae2d-e4a9-49ff-947a-ac1424018c3f","resolution":{"observed_at":"2026-08-04T00:41:43.469735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:41:43.546896Z","title":"Gra- dient surgery for multi-task learning,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.00129","last_updated":"2026-07-31T13:19:08Z","snapshot_observed_at":"2026-08-13T01:57:23.335554Z","submitted_at":"2026-07-31T13:19:08Z","title":"Progressive$^2$: A Teacher-Student Progressive Co-Evolving Knowledge Distillation Method for Substantial Model Compression","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T00:41:43.546896Z"},"links":{"citing_paper":"/paper/2608.00129"},"observation_digest":"sha256:32e5e2fc792d28e5653f2551f4389f567ee5c2463a709f68acb01b93e14ad029","observation_id":"0e4e2623-3070-4c1e-8f09-d624f806328d","resolution":{"observed_at":"2026-08-04T00:41:43.546896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:41:43.625895Z","title":"Famo: Fast adaptive multitask optimization,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.00129","last_updated":"2026-07-31T13:19:08Z","snapshot_observed_at":"2026-08-13T01:57:23.335554Z","submitted_at":"2026-07-31T13:19:08Z","title":"Progressive$^2$: A Teacher-Student Progressive Co-Evolving Knowledge Distillation Method for Substantial Model Compression","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T00:41:43.625895Z"},"links":{"citing_paper":"/paper/2608.00129"},"observation_digest":"sha256:1c039cf0de9cd341f7301ab59e0af0af04bf489ae5d84b029b58754009d995a5","observation_id":"b2b3ec1b-8d84-4a5b-b008-30184620d1dc","resolution":{"observed_at":"2026-08-04T00:41:43.625895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:41:43.713723Z","title":"Knowledge distillation for multi-task learning,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.00129","last_updated":"2026-07-31T13:19:08Z","snapshot_observed_at":"2026-08-13T01:57:23.335554Z","submitted_at":"2026-07-31T13:19:08Z","title":"Progressive$^2$: A Teacher-Student Progressive Co-Evolving Knowledge Distillation Method for Substantial Model Compression","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-04T00:41:43.713723Z"},"links":{"citing_paper":"/paper/2608.00129"},"observation_digest":"sha256:17b7110ac9a5ed4ad98c59fae78a6abcee3471c0224be7f77df8be7f71dd059b","observation_id":"f0c87c78-f12d-4320-8373-6aa39e099c55","resolution":{"observed_at":"2026-08-04T00:41:43.713723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:41:43.791007Z","title":"Contrastive representation distilla- tion,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.00129","last_updated":"2026-07-31T13:19:08Z","snapshot_observed_at":"2026-08-13T01:57:23.335554Z","submitted_at":"2026-07-31T13:19:08Z","title":"Progressive$^2$: A Teacher-Student Progressive Co-Evolving Knowledge Distillation Method for Substantial Model Compression","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T00:41:43.791007Z"},"links":{"citing_paper":"/paper/2608.00129"},"observation_digest":"sha256:837ba47e74b808fca491a3ebfefefffc3d05615e1ee4613a5052b972627d2bdb","observation_id":"b4fd4dcb-10f9-4bb4-ac47-196bacfc23a7","resolution":{"observed_at":"2026-08-04T00:41:43.791007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:41:43.876346Z","title":"Cross-layer distillation with semantic calibration,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.00129","last_updated":"2026-07-31T13:19:08Z","snapshot_observed_at":"2026-08-13T01:57:23.335554Z","submitted_at":"2026-07-31T13:19:08Z","title":"Progressive$^2$: A Teacher-Student Progressive Co-Evolving Knowledge Distillation Method for Substantial Model Compression","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-04T00:41:43.876346Z"},"links":{"citing_paper":"/paper/2608.00129"},"observation_digest":"sha256:b52236fb5c0c95b263a7bea889af8a88f201e5a096936d3c79279c9279d4a096","observation_id":"c6c8d4a5-e74f-42c5-b6be-319e2b6f79a2","resolution":{"observed_at":"2026-08-04T00:41:43.876346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:41:43.954965Z","title":"On the efficacy of knowledge distillation,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.00129","last_updated":"2026-07-31T13:19:08Z","snapshot_observed_at":"2026-08-13T01:57:23.335554Z","submitted_at":"2026-07-31T13:19:08Z","title":"Progressive$^2$: A Teacher-Student Progressive Co-Evolving Knowledge Distillation Method for Substantial Model Compression","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T00:41:43.954965Z"},"links":{"citing_paper":"/paper/2608.00129"},"observation_digest":"sha256:22ad4de752784b32bc38037ed01bcd775d2a45d527a0662982442d91b20cd422","observation_id":"c966cd39-c4df-4366-b0ac-937dd634ee5f","resolution":{"observed_at":"2026-08-04T00:41:43.954965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:41:44.033714Z","title":"Segformer: Simple and efficient design for semantic segmentation with transformers,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.00129","last_updated":"2026-07-31T13:19:08Z","snapshot_observed_at":"2026-08-13T01:57:23.335554Z","submitted_at":"2026-07-31T13:19:08Z","title":"Progressive$^2$: A Teacher-Student Progressive Co-Evolving Knowledge Distillation Method for Substantial Model Compression","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-04T00:41:44.033714Z"},"links":{"citing_paper":"/paper/2608.00129"},"observation_digest":"sha256:171f19a2d98cc1cdd1194e5ce3f7573cb559d670e8a2645af129a45dc8abc694","observation_id":"ca0ad48d-4f1a-4f6e-87fc-6e37d5bb778c","resolution":{"observed_at":"2026-08-04T00:41:44.033714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-08-14T18:16:28.847993Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-04T00:41:44.116618Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.00129","last_updated":"2026-07-31T13:19:08Z","snapshot_observed_at":"2026-08-13T01:57:23.335554Z","submitted_at":"2026-07-31T13:19:08Z","title":"Progressive$^2$: A Teacher-Student Progressive Co-Evolving Knowledge Distillation Method for Substantial Model Compression","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-04T00:41:44.116618Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2608.00129"},"observation_digest":"sha256:9999396c5442d13c811149004e5604f48df7aaa6042fe8f4878c383244245fd7","observation_id":"42ca9a07-8e5e-4dfd-9024-692f4cf1110f","resolution":{"observed_at":"2026-08-04T00:41:44.116618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:41:44.225038Z","title":"Distilbert, a distilled version of bert: smaller, faster, cheaper and lighter","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.00129","last_updated":"2026-07-31T13:19:08Z","snapshot_observed_at":"2026-08-13T01:57:23.335554Z","submitted_at":"2026-07-31T13:19:08Z","title":"Progressive$^2$: A Teacher-Student Progressive Co-Evolving Knowledge Distillation Method for Substantial Model Compression","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-04T00:41:44.225038Z"},"links":{"citing_paper":"/paper/2608.00129"},"observation_digest":"sha256:6adf07f29c192a299c6a36bc21a0a2eb3df4876b1b79125f093b7af8497af9bc","observation_id":"66964b90-1d97-41b3-8022-b9ebe4035c7d","resolution":{"observed_at":"2026-08-04T00:41:44.225038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:41:44.301067Z","title":"Tinybert: Distilling bert for natural language understanding,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.00129","last_updated":"2026-07-31T13:19:08Z","snapshot_observed_at":"2026-08-13T01:57:23.335554Z","submitted_at":"2026-07-31T13:19:08Z","title":"Progressive$^2$: A Teacher-Student Progressive Co-Evolving Knowledge Distillation Method for Substantial Model Compression","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-04T00:41:44.301067Z"},"links":{"citing_paper":"/paper/2608.00129"},"observation_digest":"sha256:9b7bd56913185e9ba6afbdd3cd8866c8ad5934a62f32d3c5927c1c2137d42c5d","observation_id":"a392c23c-ce01-4817-bcbd-cb71c25b26cb","resolution":{"observed_at":"2026-08-04T00:41:44.301067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:41:44.354192Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.00129","last_updated":"2026-07-31T13:19:08Z","snapshot_observed_at":"2026-08-13T01:57:23.335554Z","submitted_at":"2026-07-31T13:19:08Z","title":"Progressive$^2$: A Teacher-Student Progressive Co-Evolving Knowledge Distillation Method for Substantial Model Compression","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-04T00:41:44.354192Z"},"links":{"citing_paper":"/paper/2608.00129"},"observation_digest":"sha256:43831dbb7175ed261cd8b04967a267bde9db780a7e950770b1d84910562f462d","observation_id":"f03b68cc-c611-45e2-ba1c-45702754f605","resolution":{"observed_at":"2026-08-04T00:41:44.354192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:41:44.438195Z","title":"Learning multiple dense prediction tasks from partially annotated data,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.00129","last_updated":"2026-07-31T13:19:08Z","snapshot_observed_at":"2026-08-13T01:57:23.335554Z","submitted_at":"2026-07-31T13:19:08Z","title":"Progressive$^2$: A Teacher-Student Progressive Co-Evolving Knowledge Distillation Method for Substantial Model Compression","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-04T00:41:44.438195Z"},"links":{"citing_paper":"/paper/2608.00129"},"observation_digest":"sha256:6335963f7a0e7486a0eb30542dc18dbe3d0b0c23b5735413aec6688b7d2fb31d","observation_id":"6fef3917-e48c-48b8-9321-6fe7bd0752a2","resolution":{"observed_at":"2026-08-04T00:41:44.438195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:41:44.519861Z","title":"Does knowledge distillation really work?","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.00129","last_updated":"2026-07-31T13:19:08Z","snapshot_observed_at":"2026-08-13T01:57:23.335554Z","submitted_at":"2026-07-31T13:19:08Z","title":"Progressive$^2$: A Teacher-Student Progressive Co-Evolving Knowledge Distillation Method for Substantial Model Compression","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-04T00:41:44.519861Z"},"links":{"citing_paper":"/paper/2608.00129"},"observation_digest":"sha256:eee45f983d641362a28fb356904ecf9739bc82bb5d1fa68e1f43cccbbc15d0a3","observation_id":"67fea1e5-6302-4981-91f4-57d8090260ad","resolution":{"observed_at":"2026-08-04T00:41:44.519861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:41:44.600707Z","title":"The platonic representation hypothesis,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.00129","last_updated":"2026-07-31T13:19:08Z","snapshot_observed_at":"2026-08-13T01:57:23.335554Z","submitted_at":"2026-07-31T13:19:08Z","title":"Progressive$^2$: A Teacher-Student Progressive Co-Evolving Knowledge Distillation Method for Substantial Model Compression","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-04T00:41:44.600707Z"},"links":{"citing_paper":"/paper/2608.00129"},"observation_digest":"sha256:b2d2b0e53be64b6a039000e91dfd9169d5af667b74a1cec04c9c28fa2caded47","observation_id":"ca4ff926-6eff-49ed-824b-6aa7d5c57072","resolution":{"observed_at":"2026-08-04T00:41:44.600707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:41:44.686417Z","title":"Densely guided knowledge distillation using multiple teacher assistants,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.00129","last_updated":"2026-07-31T13:19:08Z","snapshot_observed_at":"2026-08-13T01:57:23.335554Z","submitted_at":"2026-07-31T13:19:08Z","title":"Progressive$^2$: A Teacher-Student Progressive Co-Evolving Knowledge Distillation Method for Substantial Model Compression","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-04T00:41:44.686417Z"},"links":{"citing_paper":"/paper/2608.00129"},"observation_digest":"sha256:cbce32c09f0784d9c9bbc62ec054aa689735d39a31f807dfb505b08f11d95da1","observation_id":"235a84e6-e2e1-4861-8819-7fc7b363a5d4","resolution":{"observed_at":"2026-08-04T00:41:44.686417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:41:44.771420Z","title":"Monotakd: Teaching assistant knowledge distillation for monocular 3d object detection,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.00129","last_updated":"2026-07-31T13:19:08Z","snapshot_observed_at":"2026-08-13T01:57:23.335554Z","submitted_at":"2026-07-31T13:19:08Z","title":"Progressive$^2$: A Teacher-Student Progressive Co-Evolving Knowledge Distillation Method for Substantial Model Compression","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-04T00:41:44.771420Z"},"links":{"citing_paper":"/paper/2608.00129"},"observation_digest":"sha256:d796e749b285b579ed51b73cfac1851af3d7dafe7ca70185173b0f2da46e26af","observation_id":"62b3711e-258e-431c-90dd-e675931152a3","resolution":{"observed_at":"2026-08-04T00:41:44.771420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:41:44.849892Z","title":"An overview of statistical learning theory,","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2608.00129","last_updated":"2026-07-31T13:19:08Z","snapshot_observed_at":"2026-08-13T01:57:23.335554Z","submitted_at":"2026-07-31T13:19:08Z","title":"Progressive$^2$: A Teacher-Student Progressive Co-Evolving Knowledge Distillation Method for Substantial Model Compression","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-04T00:41:44.849892Z"},"links":{"citing_paper":"/paper/2608.00129"},"observation_digest":"sha256:8c05e5ee15f592946ae7bd4771eb825280ccf9a9ee8098aa2f386199657c417b","observation_id":"245f2a91-cea5-4728-829c-5f9810986897","resolution":{"observed_at":"2026-08-04T00:41:44.849892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1511.03643","last_updated":"2016-02-26T02:21:52Z","snapshot_observed_at":"2026-08-17T20:00:39.118176Z","submitted_at":"2015-11-11T20:27:54Z","title":"Unifying distillation and privileged information","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.03643","snapshot_observed_at":"2026-08-04T00:41:44.932796Z","title":"Unifying dis- tillation and privileged information,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2608.00129","last_updated":"2026-07-31T13:19:08Z","snapshot_observed_at":"2026-08-13T01:57:23.335554Z","submitted_at":"2026-07-31T13:19:08Z","title":"Progressive$^2$: A Teacher-Student Progressive Co-Evolving Knowledge Distillation Method for Substantial Model Compression","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-04T00:41:44.932796Z"},"links":{"cited_paper":"/paper/1511.03643","citing_paper":"/paper/2608.00129"},"observation_digest":"sha256:fb9de957f00ab9c5fcc9def01217358413affdfa1b53d0f2c892ef1bab5f6b7f","observation_id":"b3e74537-92e8-4095-9887-e29665bada42","resolution":{"observed_at":"2026-08-04T00:41:44.932796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:41:44.996213Z","title":"On the difficulty of training recurrent neural networks,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2608.00129","last_updated":"2026-07-31T13:19:08Z","snapshot_observed_at":"2026-08-13T01:57:23.335554Z","submitted_at":"2026-07-31T13:19:08Z","title":"Progressive$^2$: A Teacher-Student Progressive Co-Evolving Knowledge Distillation Method for Substantial Model Compression","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-04T00:41:44.996213Z"},"links":{"citing_paper":"/paper/2608.00129"},"observation_digest":"sha256:56b5fcf75b5c147e05f86159f97c2b4882089dd918053f29c25228fb03f47b67","observation_id":"51c7dd8b-cb5a-4686-abd5-5a7c45066fa5","resolution":{"observed_at":"2026-08-04T00:41:44.996213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.06162","last_updated":"2018-12-14T20:49:09Z","snapshot_observed_at":"2026-08-14T17:43:20.166812Z","submitted_at":"2018-12-14T20:49:09Z","title":"An Empirical Model of Large-Batch Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.06162","snapshot_observed_at":"2026-08-04T00:41:45.069859Z","title":"An empirical model of large-batch training,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.00129","last_updated":"2026-07-31T13:19:08Z","snapshot_observed_at":"2026-08-13T01:57:23.335554Z","submitted_at":"2026-07-31T13:19:08Z","title":"Progressive$^2$: A Teacher-Student Progressive Co-Evolving Knowledge Distillation Method for Substantial Model Compression","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-04T00:41:45.069859Z"},"links":{"cited_paper":"/paper/1812.06162","citing_paper":"/paper/2608.00129"},"observation_digest":"sha256:7c4f8befff2da9d0a4d32991f220f75b09e569ce48c925757027f10e245f1201","observation_id":"ff3e5545-6769-478e-9994-bc2755430aaa","resolution":{"observed_at":"2026-08-04T00:41:45.069859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:41:45.125272Z","title":"Gradnorm: Gradient normalization for adaptive loss balancing in deep multitask networks,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.00129","last_updated":"2026-07-31T13:19:08Z","snapshot_observed_at":"2026-08-13T01:57:23.335554Z","submitted_at":"2026-07-31T13:19:08Z","title":"Progressive$^2$: A Teacher-Student Progressive Co-Evolving Knowledge Distillation Method for Substantial Model Compression","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-04T00:41:45.125272Z"},"links":{"citing_paper":"/paper/2608.00129"},"observation_digest":"sha256:09122a967d966c60e3226ae024763c494e651a5c8f013d21101d12bc3d5c3ee3","observation_id":"f5941856-39a2-4413-b3b9-d8d2c1d858bc","resolution":{"observed_at":"2026-08-04T00:41:45.125272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2007.04532","last_updated":"2020-07-09T03:23:10Z","snapshot_observed_at":"2026-08-18T21:44:02.436181Z","submitted_at":"2020-07-09T03:23:10Z","title":"A Study of Gradient Variance in Deep Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2007.04532","snapshot_observed_at":"2026-08-04T00:41:45.205816Z","title":"A study of gradient variance in deep learning,","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2608.00129","last_updated":"2026-07-31T13:19:08Z","snapshot_observed_at":"2026-08-13T01:57:23.335554Z","submitted_at":"2026-07-31T13:19:08Z","title":"Progressive$^2$: A Teacher-Student Progressive Co-Evolving Knowledge Distillation Method for Substantial Model Compression","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-04T00:41:45.205816Z"},"links":{"cited_paper":"/paper/2007.04532","citing_paper":"/paper/2608.00129"},"observation_digest":"sha256:c27b644e6bbb870894216914424a6ebc1055da9e530dc5588339bee68a574704","observation_id":"707b3328-6f5e-4522-bb94-1ef4f70af353","resolution":{"observed_at":"2026-08-04T00:41:45.205816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:41:45.282613Z","title":"Decoupled knowledge distillation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.00129","last_updated":"2026-07-31T13:19:08Z","snapshot_observed_at":"2026-08-13T01:57:23.335554Z","submitted_at":"2026-07-31T13:19:08Z","title":"Progressive$^2$: A Teacher-Student Progressive Co-Evolving Knowledge Distillation Method for Substantial Model Compression","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-04T00:41:45.282613Z"},"links":{"citing_paper":"/paper/2608.00129"},"observation_digest":"sha256:ab3ff3e375960275538319b30c8c628b8749940aeb66393d840b5f955398670e","observation_id":"123b12bd-af4b-4ec0-b70c-5fe2a9797b6e","resolution":{"observed_at":"2026-08-04T00:41:45.282613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:41:45.341638Z","title":"End-to-end multi-task learning with attention,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.00129","last_updated":"2026-07-31T13:19:08Z","snapshot_observed_at":"2026-08-13T01:57:23.335554Z","submitted_at":"2026-07-31T13:19:08Z","title":"Progressive$^2$: A Teacher-Student Progressive Co-Evolving Knowledge Distillation Method for Substantial Model Compression","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-04T00:41:45.341638Z"},"links":{"citing_paper":"/paper/2608.00129"},"observation_digest":"sha256:57aa9ad8dafafad7073b35c31f72ad24b5b0a085db7599d8997c7b5dcefbc79f","observation_id":"3836c3af-2be0-4d7d-8bfb-615999f8f3aa","resolution":{"observed_at":"2026-08-04T00:41:45.341638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:41:45.400805Z","title":"Inverted pyramid multi-task transformer for dense scene understanding,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.00129","last_updated":"2026-07-31T13:19:08Z","snapshot_observed_at":"2026-08-13T01:57:23.335554Z","submitted_at":"2026-07-31T13:19:08Z","title":"Progressive$^2$: A Teacher-Student Progressive Co-Evolving Knowledge Distillation Method for Substantial Model Compression","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-04T00:41:45.400805Z"},"links":{"citing_paper":"/paper/2608.00129"},"observation_digest":"sha256:d3adf5ce1ba623af5a766773042e430acd3b4b5e91e1be877d4c20f784257226","observation_id":"011fa260-d639-435b-8e6f-7e1305d9a681","resolution":{"observed_at":"2026-08-04T00:41:45.400805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.00129","last_updated":"2026-07-31T13:19:08Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-13T01:57:23.335554Z","submitted_at":"2026-07-31T13:19:08Z","title":"Progressive$^2$: A Teacher-Student Progressive Co-Evolving Knowledge Distillation Method for Substantial Model Compression"},"reference_resolution":{"displayed":49,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":49,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":49},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 49 of 49 outbound references and 0 inbound Pith citation observations for arXiv:2608.00129."}