{"as_of":"2026-08-09T09:48:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c606113bacfe19d0ef0563a043158cec9b3f78dcca150105e4287b0a2eef86af","coverage":[{"denominator":20,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":20,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T12:50:14.759452Z","state":"measured"},{"denominator":21,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":21,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T23:29:02.457697Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.07436","last_updated":"2025-02-11T10:24:57Z","snapshot_observed_at":"2026-08-09T06:30:27.956129Z","submitted_at":"2025-02-11T10:24:57Z","title":"Optimizing Knowledge Distillation in Transformers: Enabling Multi-Head Attention without Alignment Barriers","version":1},"cited_work":{"arxiv_id":"2502.07436","doi":"10.48550/arxiv.2502.07436","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.07436","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Optimizing Knowledge Distillation in Transformers: Enabling Multi-Head Attention without Alignment Barriers , url =","venue":"ArXiv.org","work_id":"b8146edb-587c-4815-9ead-ee019e0cbd52","year":null},"citing_paper":{"arxiv_id":"2606.07604","last_updated":"2026-05-29T09:40:38Z","snapshot_observed_at":"2026-08-03T04:00:50.272221Z","submitted_at":"2026-05-29T09:40:38Z","title":"Contribution Weights: A Geometrical Analysis of Self-Attention Transformers","version":1},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-06-28T23:29:02.457697Z"},"links":{"cited_paper":"/paper/2502.07436","citing_paper":"/paper/2606.07604"},"observation_digest":"sha256:dfe4c8ea0026316ef21a32b2935e0b7278a57b2f163efb1630537e535fb5830b","observation_id":"66acbb21-a70f-4f7b-a051-e73e82b6bed4","resolution":{"observed_at":"2026-06-28T23:32:46.667666Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2502.07436/citation-record","integrity":"/paper/2502.07436/integrity","json":"/paper/2502.07436/citation-record.json","paper":"/paper/2502.07436"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-08T12:50:14.653697Z","title":"L., Almeida, D., Altenschmidt, J., Altman, S., Anadkat, S., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07436","last_updated":"2025-02-11T10:24:57Z","snapshot_observed_at":"2026-08-09T06:30:27.956129Z","submitted_at":"2025-02-11T10:24:57Z","title":"Optimizing Knowledge Distillation in Transformers: Enabling Multi-Head Attention without Alignment Barriers","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-08T12:50:14.653697Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2502.07436"},"observation_digest":"sha256:7fd885f810804120be25dfc9872e3d24f02a2e398d51e3fcc50da0783f20751d","observation_id":"ab335bab-23d2-4e4f-ad30-f0bae640aea8","resolution":{"observed_at":"2026-08-08T12:50:14.653697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-08T12:50:14.674642Z","title":null,"venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2502.07436","last_updated":"2025-02-11T10:24:57Z","snapshot_observed_at":"2026-08-09T06:30:27.956129Z","submitted_at":"2025-02-11T10:24:57Z","title":"Optimizing Knowledge Distillation in Transformers: Enabling Multi-Head Attention without Alignment Barriers","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-08T12:50:14.674642Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2502.07436"},"observation_digest":"sha256:4a26c620c6bdd53a40a6a64c9649fb63a6ece39db861a4f6bd0498d7b9571e7c","observation_id":"e7f6d786-4436-4c22-983f-bab6d53ca99f","resolution":{"observed_at":"2026-08-08T12:50:14.674642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-08T12:50:14.679833Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07436","last_updated":"2025-02-11T10:24:57Z","snapshot_observed_at":"2026-08-09T06:30:27.956129Z","submitted_at":"2025-02-11T10:24:57Z","title":"Optimizing Knowledge Distillation in Transformers: Enabling Multi-Head Attention without Alignment Barriers","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-08T12:50:14.679833Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2502.07436"},"observation_digest":"sha256:30b68e1b04421284163bc9ac54398d06449615990ed7751e0c9fc665e1727cfa","observation_id":"9068f8ac-0ddf-4406-b958-8d7da0fa1248","resolution":{"observed_at":"2026-08-08T12:50:14.679833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:50:15.056910Z","title":"For language pretraining tasks, we trained LLaMA models on the BabyLM dataset","venue":null,"work_id":"40ef4fde-c7b7-46bd-8664-efc8fe16a46b","year":2025},"citing_paper":{"arxiv_id":"2502.07436","last_updated":"2025-02-11T10:24:57Z","snapshot_observed_at":"2026-08-09T06:30:27.956129Z","submitted_at":"2025-02-11T10:24:57Z","title":"Optimizing Knowledge Distillation in Transformers: Enabling Multi-Head Attention without Alignment Barriers","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-08T12:50:14.754909Z"},"links":{"citing_paper":"/paper/2502.07436"},"observation_digest":"sha256:c1879b9c94112dd462e093aa3b1661385735be8922d4dd428c3605e032ddff38","observation_id":"f78b8bee-6c67-4fe5-ad22-3bce9a60a19f","resolution":{"observed_at":"2026-08-08T12:50:15.062540Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1503.02531","last_updated":"2015-03-09T15:44:49Z","snapshot_observed_at":"2026-07-06T04:11:24.157003Z","submitted_at":"2015-03-09T15:44:49Z","title":"Distilling the Knowledge in a Neural Network","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1503.02531","snapshot_observed_at":"2026-08-08T12:50:14.689647Z","title":"Distilling the knowledge in a neural network","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07436","last_updated":"2025-02-11T10:24:57Z","snapshot_observed_at":"2026-08-09T06:30:27.956129Z","submitted_at":"2025-02-11T10:24:57Z","title":"Optimizing Knowledge Distillation in Transformers: Enabling Multi-Head Attention without Alignment Barriers","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-08T12:50:14.689647Z"},"links":{"cited_paper":"/paper/1503.02531","citing_paper":"/paper/2502.07436"},"observation_digest":"sha256:ea7e23c8223dd9521a9e5818b2d14086d5fee8c23d61b03bd4d0006798f1e840","observation_id":"64ee1a55-faa9-42fc-9d83-6d4ad651d957","resolution":{"observed_at":"2026-08-08T12:50:14.689647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:50:15.040990Z","title":"11 Submission and Formatting Instructions for ICML 2025 Figure","venue":null,"work_id":"a1e96302-2a13-4885-82dc-19d4c553c447","year":2025},"citing_paper":{"arxiv_id":"2502.07436","last_updated":"2025-02-11T10:24:57Z","snapshot_observed_at":"2026-08-09T06:30:27.956129Z","submitted_at":"2025-02-11T10:24:57Z","title":"Optimizing Knowledge Distillation in Transformers: Enabling Multi-Head Attention without Alignment Barriers","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-08T12:50:14.759452Z"},"links":{"citing_paper":"/paper/2502.07436"},"observation_digest":"sha256:8ee0be5b161965cd674a9e0f23254b0d8a64bbf8aacbb99b9302b48e3c9dc801","observation_id":"e4387d8a-7692-4398-be93-7dd99ac5b25b","resolution":{"observed_at":"2026-08-08T12:50:15.046119Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.06991","last_updated":"2019-10-30T12:33:29Z","snapshot_observed_at":"2026-07-06T07:46:06.039145Z","submitted_at":"2019-04-15T12:20:32Z","title":"Improved Precision and Recall Metric for Assessing Generative Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.06991","snapshot_observed_at":"2026-08-08T12:50:14.704900Z","title":"org/abs/1904.06991","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2502.07436","last_updated":"2025-02-11T10:24:57Z","snapshot_observed_at":"2026-08-09T06:30:27.956129Z","submitted_at":"2025-02-11T10:24:57Z","title":"Optimizing Knowledge Distillation in Transformers: Enabling Multi-Head Attention without Alignment Barriers","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-08T12:50:14.704900Z"},"links":{"cited_paper":"/paper/1904.06991","citing_paper":"/paper/2502.07436"},"observation_digest":"sha256:f9131899ebc0ef9d74ae9c46cbaf20e582ad0a31d99a103077b78b761a7f6b16","observation_id":"c4c4921f-a0c1-45ed-be5e-db6e6fb75890","resolution":{"observed_at":"2026-08-08T12:50:14.704900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01108","last_updated":"2020-03-01T02:57:50Z","snapshot_observed_at":"2026-08-07T19:07:36.327251Z","submitted_at":"2019-10-02T17:56:28Z","title":"DistilBERT, a distilled version of BERT: smaller, faster, cheaper and lighter","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.01108","snapshot_observed_at":"2026-08-08T12:50:14.720671Z","title":"Shazeer, N","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2502.07436","last_updated":"2025-02-11T10:24:57Z","snapshot_observed_at":"2026-08-09T06:30:27.956129Z","submitted_at":"2025-02-11T10:24:57Z","title":"Optimizing Knowledge Distillation in Transformers: Enabling Multi-Head Attention without Alignment Barriers","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-08T12:50:14.720671Z"},"links":{"cited_paper":"/paper/1910.01108","citing_paper":"/paper/2502.07436"},"observation_digest":"sha256:93f37b5e7a32fd8d33d9c505002d189d7898a35d56014a052ed85712874f2514","observation_id":"83aac50c-a978-43d1-abf3-aa3bbc9611b5","resolution":{"observed_at":"2026-08-08T12:50:14.720671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.09355","last_updated":"2019-08-25T16:13:24Z","snapshot_observed_at":"2026-08-07T14:15:56.428313Z","submitted_at":"2019-08-25T16:13:24Z","title":"Patient Knowledge Distillation for BERT Model Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.09355","snapshot_observed_at":"2026-08-08T12:50:14.725290Z","title":"Patient knowledge distillation for bert model compression","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2502.07436","last_updated":"2025-02-11T10:24:57Z","snapshot_observed_at":"2026-08-09T06:30:27.956129Z","submitted_at":"2025-02-11T10:24:57Z","title":"Optimizing Knowledge Distillation in Transformers: Enabling Multi-Head Attention without Alignment Barriers","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-08T12:50:14.725290Z"},"links":{"cited_paper":"/paper/1908.09355","citing_paper":"/paper/2502.07436"},"observation_digest":"sha256:a0423da4cc4a4354e7c2f318d652ac067b6fae7cb114a3e5aec9ae3692cfac8b","observation_id":"3a7de572-72d7-4a51-80b2-fa93d0779bc4","resolution":{"observed_at":"2026-08-08T12:50:14.725290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.02984","last_updated":"2020-04-14T23:54:36Z","snapshot_observed_at":"2026-08-06T09:03:09.275283Z","submitted_at":"2020-04-06T20:20:58Z","title":"MobileBERT: a Compact Task-Agnostic BERT for Resource-Limited Devices","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.02984","snapshot_observed_at":"2026-08-08T12:50:14.730479Z","title":"Mobilebert: a compact task-agnostic bert for resource- limited devices","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2502.07436","last_updated":"2025-02-11T10:24:57Z","snapshot_observed_at":"2026-08-09T06:30:27.956129Z","submitted_at":"2025-02-11T10:24:57Z","title":"Optimizing Knowledge Distillation in Transformers: Enabling Multi-Head Attention without Alignment Barriers","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-08T12:50:14.730479Z"},"links":{"cited_paper":"/paper/2004.02984","citing_paper":"/paper/2502.07436"},"observation_digest":"sha256:38bfe3f326a4c26efee6405a3184c8978b910b10b44828c2d298ce251a8a601c","observation_id":"a1a4deb7-9465-4e06-8cf2-3d522917c86e","resolution":{"observed_at":"2026-08-08T12:50:14.730479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-08T12:50:14.739767Z","title":"Llama 2: Open foundation and fine- tuned chat models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07436","last_updated":"2025-02-11T10:24:57Z","snapshot_observed_at":"2026-08-09T06:30:27.956129Z","submitted_at":"2025-02-11T10:24:57Z","title":"Optimizing Knowledge Distillation in Transformers: Enabling Multi-Head Attention without Alignment Barriers","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-08T12:50:14.739767Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2502.07436"},"observation_digest":"sha256:3f33a90d5265cd47a98dd64c72504cd856f6cf751ac41d37d584d433941ca49d","observation_id":"c86c0533-4ef1-46a9-b04b-f9bc814c9412","resolution":{"observed_at":"2026-08-08T12:50:14.739767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.09418","last_updated":"2019-06-07T14:00:58Z","snapshot_observed_at":"2026-08-01T19:51:24.042109Z","submitted_at":"2019-05-23T01:13:24Z","title":"Analyzing Multi-Head Self-Attention: Specialized Heads Do the Heavy Lifting, the Rest Can Be Pruned","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.09418","snapshot_observed_at":"2026-08-08T12:50:14.744931Z","title":"Analyzing multi-head self-attention: Specialized heads do the heavy lifting, the rest can be pruned.arXiv preprint arXiv:1905.09418,","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2502.07436","last_updated":"2025-02-11T10:24:57Z","snapshot_observed_at":"2026-08-09T06:30:27.956129Z","submitted_at":"2025-02-11T10:24:57Z","title":"Optimizing Knowledge Distillation in Transformers: Enabling Multi-Head Attention without Alignment Barriers","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-08T12:50:14.744931Z"},"links":{"cited_paper":"/paper/1905.09418","citing_paper":"/paper/2502.07436"},"observation_digest":"sha256:34563fbfba4cb21cf1b63f203dc114e8237e929ca06658bc86b8ca34e8631de4","observation_id":"6f1e988b-8ccc-4f1b-872a-b7e935942d91","resolution":{"observed_at":"2026-08-08T12:50:14.744931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.02432","last_updated":"2022-09-06T11:52:46Z","snapshot_observed_at":"2026-07-06T13:49:19.502478Z","submitted_at":"2022-09-06T11:52:46Z","title":"ViTKD: Practical Guidelines for ViT feature knowledge distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.02432","snapshot_observed_at":"2026-08-08T12:50:14.749967Z","title":"Vitkd: Practical guidelines for vit feature knowledge distillation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07436","last_updated":"2025-02-11T10:24:57Z","snapshot_observed_at":"2026-08-09T06:30:27.956129Z","submitted_at":"2025-02-11T10:24:57Z","title":"Optimizing Knowledge Distillation in Transformers: Enabling Multi-Head Attention without Alignment Barriers","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-08T12:50:14.749967Z"},"links":{"cited_paper":"/paper/2209.02432","citing_paper":"/paper/2502.07436"},"observation_digest":"sha256:156e30b77aa91a43eeebfc32158c7d67c529c61144c08dacf6ef16b5d037e322","observation_id":"ad6542bb-8d4f-49ac-9436-755170fbc72c","resolution":{"observed_at":"2026-08-08T12:50:14.749967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.01219","last_updated":"2017-12-18T22:35:22Z","snapshot_observed_at":"2026-07-06T05:49:47.734250Z","submitted_at":"2017-07-05T05:44:02Z","title":"Like What You Like: Knowledge Distill via Neuron Selectivity Transfer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.01219","snapshot_observed_at":"2026-08-08T12:50:14.694727Z","title":"and Wang, N","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07436","last_updated":"2025-02-11T10:24:57Z","snapshot_observed_at":"2026-08-09T06:30:27.956129Z","submitted_at":"2025-02-11T10:24:57Z","title":"Optimizing Knowledge Distillation in Transformers: Enabling Multi-Head Attention without Alignment Barriers","version":1},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-08T12:50:14.694727Z"},"links":{"cited_paper":"/paper/1707.01219","citing_paper":"/paper/2502.07436"},"observation_digest":"sha256:a9807a9a0dcd10935fce896cffefd9f0beeb5b693f83fe37b7c27fef77a5ea06","observation_id":"c1b7c2b1-06b6-4e3b-9cef-0ebb3902576c","resolution":{"observed_at":"2026-08-08T12:50:14.694727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.10351","last_updated":"2020-10-16T02:12:46Z","snapshot_observed_at":"2026-08-07T22:21:53.513424Z","submitted_at":"2019-09-23T13:05:35Z","title":"TinyBERT: Distilling BERT for Natural Language Understanding","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.10351","snapshot_observed_at":"2026-08-08T12:50:14.699745Z","title":"Tinybert: Distill- ing BERT for natural language understanding","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2502.07436","last_updated":"2025-02-11T10:24:57Z","snapshot_observed_at":"2026-08-09T06:30:27.956129Z","submitted_at":"2025-02-11T10:24:57Z","title":"Optimizing Knowledge Distillation in Transformers: Enabling Multi-Head Attention without Alignment Barriers","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-08T12:50:14.699745Z"},"links":{"cited_paper":"/paper/1909.10351","citing_paper":"/paper/2502.07436"},"observation_digest":"sha256:7e0d28d51c6e1687960f489b83de3277e88544ba2c179410d36ee36c05933a26","observation_id":"ce1c0edc-2323-4c8f-8410-c35cf4074639","resolution":{"observed_at":"2026-08-08T12:50:14.699745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.04063","last_updated":"2019-04-05T15:15:45Z","snapshot_observed_at":"2026-07-06T07:44:40.937729Z","submitted_at":"2019-04-05T15:15:45Z","title":"Analyzing and Interpreting Neural Networks for NLP: A Report on the First BlackboxNLP Workshop","version":1},"cited_work":{"arxiv_id":"1904.04063","doi":null,"metadata_source":"pith","pith_arxiv_id":"1904.04063","snapshot_observed_at":"2026-08-08T12:50:14.989677Z","title":"Analyzing and Interpreting Neural Networks for NLP: A Report on the First BlackboxNLP Workshop","venue":"cs.CL","work_id":"7a12e3fa-dd3a-4fcb-92d5-9201768c690f","year":2019},"citing_paper":{"arxiv_id":"2502.07436","last_updated":"2025-02-11T10:24:57Z","snapshot_observed_at":"2026-08-09T06:30:27.956129Z","submitted_at":"2025-02-11T10:24:57Z","title":"Optimizing Knowledge Distillation in Transformers: Enabling Multi-Head Attention without Alignment Barriers","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-08T12:50:14.669993Z"},"links":{"cited_paper":"/paper/1904.04063","citing_paper":"/paper/2502.07436"},"observation_digest":"sha256:638696e54ad0b87955fa0aa32acca5bf3f85c0aac6f2543076b76978c55a8127","observation_id":"0f6afcf6-867a-4516-9a2e-ebf2d6212a11","resolution":{"observed_at":"2026-08-08T12:50:14.996941Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:50:15.072701Z","title":"Training data-efficient image transform- ers & distillation through attention","venue":null,"work_id":"dc11b413-7bb7-4673-84f9-a967b5ef300b","year":2025},"citing_paper":{"arxiv_id":"2502.07436","last_updated":"2025-02-11T10:24:57Z","snapshot_observed_at":"2026-08-09T06:30:27.956129Z","submitted_at":"2025-02-11T10:24:57Z","title":"Optimizing Knowledge Distillation in Transformers: Enabling Multi-Head Attention without Alignment Barriers","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-08T12:50:14.735333Z"},"links":{"citing_paper":"/paper/2502.07436"},"observation_digest":"sha256:74574116fd6f20c0d3c5b74fe0b7e2f7a9e819cb7339c533b97273ddb5355f9b","observation_id":"4f8a83dc-2af1-42c6-8018-1a4e84847cda","resolution":{"observed_at":"2026-08-08T12:50:15.077756Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:50:15.087970Z","title":"Esser, P., Kulal, S., Blattmann, A., Entezari, R., M¨uller, J., Saini, H., Levi, Y ., Lorenz, D., Sauer, A., Boesel, F., et al","venue":null,"work_id":"a288e09c-5f7e-40d3-96d1-2afdefa2fb15","year":2021},"citing_paper":{"arxiv_id":"2502.07436","last_updated":"2025-02-11T10:24:57Z","snapshot_observed_at":"2026-08-09T06:30:27.956129Z","submitted_at":"2025-02-11T10:24:57Z","title":"Optimizing Knowledge Distillation in Transformers: Enabling Multi-Head Attention without Alignment Barriers","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-08T12:50:14.684755Z"},"links":{"citing_paper":"/paper/2502.07436"},"observation_digest":"sha256:95a3f6be2299f180bda4e6bf17bd343209bf9f8c50ac9934391afd46791d0100","observation_id":"e1812a03-25c2-4ecc-b1cf-253c2d026f34","resolution":{"observed_at":"2026-08-08T12:50:15.093065Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13245","last_updated":"2023-12-23T17:55:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-22T17:16:38Z","title":"GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13245","snapshot_observed_at":"2026-08-08T12:50:14.659381Z","title":"Gqa: Training generalized multi-query transformer models from multi-head check- points","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07436","last_updated":"2025-02-11T10:24:57Z","snapshot_observed_at":"2026-08-09T06:30:27.956129Z","submitted_at":"2025-02-11T10:24:57Z","title":"Optimizing Knowledge Distillation in Transformers: Enabling Multi-Head Attention without Alignment Barriers","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-08T12:50:14.659381Z"},"links":{"cited_paper":"/paper/2305.13245","citing_paper":"/paper/2502.07436"},"observation_digest":"sha256:536a445d3f77cbb73a70d296757b83d3b03d347f644f1dcf8f2cae1989f89c62","observation_id":"71d1e575-f4af-4a1e-8231-19ee730fd4bc","resolution":{"observed_at":"2026-08-08T12:50:14.659381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.06213","last_updated":"2024-03-10T13:26:24Z","snapshot_observed_at":"2026-07-06T17:42:16.039458Z","submitted_at":"2024-03-10T13:26:24Z","title":"$V_kD:$ Improving Knowledge Distillation using Orthogonal Projections","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.06213","snapshot_observed_at":"2026-08-08T12:50:14.710201Z","title":"Mirzadeh, S","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07436","last_updated":"2025-02-11T10:24:57Z","snapshot_observed_at":"2026-08-09T06:30:27.956129Z","submitted_at":"2025-02-11T10:24:57Z","title":"Optimizing Knowledge Distillation in Transformers: Enabling Multi-Head Attention without Alignment Barriers","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-08T12:50:14.710201Z"},"links":{"cited_paper":"/paper/2403.06213","citing_paper":"/paper/2502.07436"},"observation_digest":"sha256:57f6d8d92dcc7f4d6720eeb52e6ed62b99558aa4d76ae65038ed23b89cc4592d","observation_id":"8af8114e-bc56-40e5-9dba-d72d80ca3b10","resolution":{"observed_at":"2026-08-08T12:50:14.710201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.07436","last_updated":"2025-02-11T10:24:57Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T06:30:27.956129Z","submitted_at":"2025-02-11T10:24:57Z","title":"Optimizing Knowledge Distillation in Transformers: Enabling Multi-Head Attention without Alignment Barriers"},"reference_resolution":{"displayed":20,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":15,"verified_exact":1,"verified_fuzzy":4},"total_outbound_references":20},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 20 of 20 outbound references and 1 inbound Pith citation observation for arXiv:2502.07436."}