{"as_of":"2026-08-08T23:12:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ac5395f2c6e7ca9923104f6187c1b9f8fe1f06e119f4abe8bcd3da0408785a51","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":29,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":29,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":29,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":29,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:05:17.834796Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":273,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"1909.11556","last_updated":"2019-09-25T15:35:03Z","snapshot_observed_at":"2026-08-08T18:02:18.011077Z","submitted_at":"2019-09-25T15:35:03Z","title":"Reducing Transformer Depth on Demand with Structured Dropout","version":1},"cited_work":{"arxiv_id":"1909.11556","doi":"10.48550/arxiv.1909.11556","metadata_source":"arxiv_reference","pith_arxiv_id":"1909.11556","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:1909.11556 (2019)","venue":"arXiv (Cornell University)","work_id":"2309ff43-c4f2-41b0-8dbe-92332c15716f","year":1909},"citing_paper":{"arxiv_id":"2006.15704","last_updated":"2020-06-28T20:39:45Z","snapshot_observed_at":"2026-07-06T09:33:26.082100Z","submitted_at":"2020-06-28T20:39:45Z","title":"PyTorch Distributed: Experiences on Accelerating Data Parallel Training","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-17T19:15:26.764929Z"},"links":{"cited_paper":"/paper/1909.11556","citing_paper":"/paper/2006.15704"},"observation_digest":"sha256:f2839719d88d82e127a3f7f8b33b8b644b7a642653271fb1010242d0080c198a","observation_id":"e1ad9f5c-7c94-4fca-b410-26e8483eec12","resolution":{"observed_at":"2026-05-17T19:15:26.852762Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.11556","last_updated":"2019-09-25T15:35:03Z","snapshot_observed_at":"2026-08-08T18:02:18.011077Z","submitted_at":"2019-09-25T15:35:03Z","title":"Reducing Transformer Depth on Demand with Structured Dropout","version":1},"cited_work":{"arxiv_id":"1909.11556","doi":"10.48550/arxiv.1909.11556","metadata_source":"arxiv_reference","pith_arxiv_id":"1909.11556","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:1909.11556 (2019)","venue":"arXiv (Cornell University)","work_id":"2309ff43-c4f2-41b0-8dbe-92332c15716f","year":1909},"citing_paper":{"arxiv_id":"2303.08112","last_updated":"2025-11-11T01:13:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-14T17:47:09Z","title":"Eliciting Latent Predictions from Transformers with the Tuned Lens","version":6},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-05-12T16:54:37.382049Z"},"links":{"cited_paper":"/paper/1909.11556","citing_paper":"/paper/2303.08112"},"observation_digest":"sha256:bd0638e68a0f91c426965793b5f920fdc9443aa852008739ea2b2ddd485d8fe0","observation_id":"686627a5-f0e5-4e24-a436-285b6556240f","resolution":{"observed_at":"2026-05-12T16:54:37.594176Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.11556","last_updated":"2019-09-25T15:35:03Z","snapshot_observed_at":"2026-08-08T18:02:18.011077Z","submitted_at":"2019-09-25T15:35:03Z","title":"Reducing Transformer Depth on Demand with Structured Dropout","version":1},"cited_work":{"arxiv_id":"1909.11556","doi":"10.48550/arxiv.1909.11556","metadata_source":"arxiv_reference","pith_arxiv_id":"1909.11556","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:1909.11556 (2019)","venue":"arXiv (Cornell University)","work_id":"2309ff43-c4f2-41b0-8dbe-92332c15716f","year":1909},"citing_paper":{"arxiv_id":"2502.05171","last_updated":"2025-02-17T17:14:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-07T18:55:02Z","title":"Scaling up Test-Time Compute with Latent Reasoning: A Recurrent Depth Approach","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-05-12T15:39:40.845703Z"},"links":{"cited_paper":"/paper/1909.11556","citing_paper":"/paper/2502.05171"},"observation_digest":"sha256:b1b9c73e05d7ac9ae65466286a3a777c745ce9fbfee685954d2cda7d9d8dda70","observation_id":"2a778857-1a0e-42dd-9422-7548c2e75db6","resolution":{"observed_at":"2026-05-12T15:39:41.141062Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.11556","last_updated":"2019-09-25T15:35:03Z","snapshot_observed_at":"2026-08-08T18:02:18.011077Z","submitted_at":"2019-09-25T15:35:03Z","title":"Reducing Transformer Depth on Demand with Structured Dropout","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.11556","snapshot_observed_at":"2026-08-07T15:05:17.834796Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.16463","last_updated":"2025-06-18T18:55:01Z","snapshot_observed_at":"2026-08-08T01:31:47.483168Z","submitted_at":"2025-05-22T09:44:44Z","title":"AnchorFormer: Differentiable Anchor Attention for Efficient Vision Transformer","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:17.834796Z"},"links":{"cited_paper":"/paper/1909.11556","citing_paper":"/paper/2505.16463"},"observation_digest":"sha256:ba068f99156ca10778e1b51f2982aef0776fd24b5815df91e3e2ad2c46723fb8","observation_id":"2ac5c55d-a864-4dac-b941-0025254eda76","resolution":{"observed_at":"2026-08-07T15:05:17.834796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.11556","last_updated":"2019-09-25T15:35:03Z","snapshot_observed_at":"2026-08-08T18:02:18.011077Z","submitted_at":"2019-09-25T15:35:03Z","title":"Reducing Transformer Depth on Demand with Structured Dropout","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.11556","snapshot_observed_at":"2026-08-07T12:40:36.354788Z","title":"Reducing transformer depth on demand with structured dropout","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2505.23947","last_updated":"2025-05-29T18:56:45Z","snapshot_observed_at":"2026-08-07T12:35:46.392086Z","submitted_at":"2025-05-29T18:56:45Z","title":"Position: The Future of Bayesian Prediction Is Prior-Fitted","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:36.354788Z"},"links":{"cited_paper":"/paper/1909.11556","citing_paper":"/paper/2505.23947"},"observation_digest":"sha256:8e027ea74e8fd0e7a37b3cb184e7b82c082a61fc51d5eb9f53bb9914c6a9ab62","observation_id":"211c76de-123e-4481-a77a-df405572e788","resolution":{"observed_at":"2026-08-07T12:40:36.354788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.11556","last_updated":"2019-09-25T15:35:03Z","snapshot_observed_at":"2026-08-08T18:02:18.011077Z","submitted_at":"2019-09-25T15:35:03Z","title":"Reducing Transformer Depth on Demand with Structured Dropout","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.11556","snapshot_observed_at":"2026-08-06T22:40:53.679247Z","title":"Reducing Transformer Depth on Demand with Structured Dropout , September 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.21103","last_updated":"2025-06-26T09:01:19Z","snapshot_observed_at":"2026-08-06T22:31:44.262653Z","submitted_at":"2025-06-26T09:01:19Z","title":"Learning to Skip the Middle Layers of Transformers","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T22:40:53.679247Z"},"links":{"cited_paper":"/paper/1909.11556","citing_paper":"/paper/2506.21103"},"observation_digest":"sha256:751f8fb4194e73f3675a916b423533ce1e03c4a1e75cfe2e16d1264f3df6a4e5","observation_id":"3223e1a1-e09b-4363-b4b1-f661be8cbb40","resolution":{"observed_at":"2026-08-06T22:40:53.679247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.11556","last_updated":"2019-09-25T15:35:03Z","snapshot_observed_at":"2026-08-08T18:02:18.011077Z","submitted_at":"2019-09-25T15:35:03Z","title":"Reducing Transformer Depth on Demand with Structured Dropout","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.11556","snapshot_observed_at":"2026-08-06T22:17:42.899383Z","title":"Reducing transformer depth on demand with structured dropout","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2506.22015","last_updated":"2025-07-03T07:20:35Z","snapshot_observed_at":"2026-08-06T22:10:47.087808Z","submitted_at":"2025-06-27T08:28:21Z","title":"Towards Universal & Efficient Model Compression via Exponential Torque Pruning","version":3},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-06T22:17:42.899383Z"},"links":{"cited_paper":"/paper/1909.11556","citing_paper":"/paper/2506.22015"},"observation_digest":"sha256:4c9d356d932e40347d13f9754ee62362c2e4b72402227b210b55c06218d1fd83","observation_id":"282d4541-9bd4-46a8-b938-768d71b1ce3b","resolution":{"observed_at":"2026-08-06T22:17:42.899383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.11556","last_updated":"2019-09-25T15:35:03Z","snapshot_observed_at":"2026-08-08T18:02:18.011077Z","submitted_at":"2019-09-25T15:35:03Z","title":"Reducing Transformer Depth on Demand with Structured Dropout","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.11556","snapshot_observed_at":"2026-08-06T18:33:19.194766Z","title":"Reducing transformer depth on demand with structured dropout","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2507.07996","last_updated":"2025-07-10T17:59:53Z","snapshot_observed_at":"2026-08-06T18:25:28.097317Z","submitted_at":"2025-07-10T17:59:53Z","title":"Skip a Layer or Loop it? Test-Time Depth Adaptation of Pretrained LLMs","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T18:33:19.194766Z"},"links":{"cited_paper":"/paper/1909.11556","citing_paper":"/paper/2507.07996"},"observation_digest":"sha256:dbe1f05fd09828aa50fb12e3ef8ed1d27cec3e8147cdc440b8e390fc8f5580c1","observation_id":"54e80b2d-9a4e-45cd-b894-d3ffe7f781a1","resolution":{"observed_at":"2026-08-06T18:33:19.194766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.11556","last_updated":"2019-09-25T15:35:03Z","snapshot_observed_at":"2026-08-08T18:02:18.011077Z","submitted_at":"2019-09-25T15:35:03Z","title":"Reducing Transformer Depth on Demand with Structured Dropout","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.11556","snapshot_observed_at":"2026-08-06T18:24:51.447217Z","title":null,"venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2507.08567","last_updated":"2025-08-07T11:18:14Z","snapshot_observed_at":"2026-08-06T23:11:17.291536Z","submitted_at":"2025-07-11T13:11:11Z","title":"AbbIE: Autoregressive Block-Based Iterative Encoder for Efficient Sequence Modeling","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T18:24:51.447217Z"},"links":{"cited_paper":"/paper/1909.11556","citing_paper":"/paper/2507.08567"},"observation_digest":"sha256:17e663382d6d110321138998a88aadc8d2667cc5280fc898e637045b544cc38c","observation_id":"ec931f3a-5d9b-4e1a-b351-2bc27cd39f80","resolution":{"observed_at":"2026-08-06T18:24:51.447217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.11556","last_updated":"2019-09-25T15:35:03Z","snapshot_observed_at":"2026-08-08T18:02:18.011077Z","submitted_at":"2019-09-25T15:35:03Z","title":"Reducing Transformer Depth on Demand with Structured Dropout","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.11556","snapshot_observed_at":"2026-08-06T13:22:44.726762Z","title":"arXiv preprint arXiv:1909.11556 (2019)","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.20749","last_updated":"2025-07-28T11:57:52Z","snapshot_observed_at":"2026-08-08T16:13:24.324121Z","submitted_at":"2025-07-28T11:57:52Z","title":"Investigating Structural Pruning and Recovery Techniques for Compressing Multimodal Large Language Models: An Empirical Study","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T13:22:44.726762Z"},"links":{"cited_paper":"/paper/1909.11556","citing_paper":"/paper/2507.20749"},"observation_digest":"sha256:22a5133c671bd082ce5ee0a7e19d5e8f691aebc83d990613fed453d7d6d2c0e2","observation_id":"3776073e-b025-4559-a80c-f2d61610c801","resolution":{"observed_at":"2026-08-06T13:22:44.726762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.11556","last_updated":"2019-09-25T15:35:03Z","snapshot_observed_at":"2026-08-08T18:02:18.011077Z","submitted_at":"2019-09-25T15:35:03Z","title":"Reducing Transformer Depth on Demand with Structured Dropout","version":1},"cited_work":{"arxiv_id":"1909.11556","doi":"10.48550/arxiv.1909.11556","metadata_source":"arxiv_reference","pith_arxiv_id":"1909.11556","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:1909.11556 (2019)","venue":"arXiv (Cornell University)","work_id":"2309ff43-c4f2-41b0-8dbe-92332c15716f","year":1909},"citing_paper":{"arxiv_id":"2508.03949","last_updated":"2026-04-14T17:16:30Z","snapshot_observed_at":"2026-08-04T01:34:07.529496Z","submitted_at":"2025-08-05T22:32:32Z","title":"Model Compression vs. Adversarial Robustness: An Empirical Study on Language Models for Code","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-19T00:01:42.228190Z"},"links":{"cited_paper":"/paper/1909.11556","citing_paper":"/paper/2508.03949"},"observation_digest":"sha256:dda3b2625675ff44406ded1b9af04cefe804679316e2914715d36d2e6464990b","observation_id":"b220cf03-cacc-40ac-99fe-602821af9ace","resolution":{"observed_at":"2026-05-19T00:01:55.897855Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.11556","last_updated":"2019-09-25T15:35:03Z","snapshot_observed_at":"2026-08-08T18:02:18.011077Z","submitted_at":"2019-09-25T15:35:03Z","title":"Reducing Transformer Depth on Demand with Structured Dropout","version":1},"cited_work":{"arxiv_id":"1909.11556","doi":"10.48550/arxiv.1909.11556","metadata_source":"arxiv_reference","pith_arxiv_id":"1909.11556","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:1909.11556 (2019)","venue":"arXiv (Cornell University)","work_id":"2309ff43-c4f2-41b0-8dbe-92332c15716f","year":1909},"citing_paper":{"arxiv_id":"2508.04427","last_updated":"2026-06-11T09:27:03Z","snapshot_observed_at":"2026-08-08T19:09:09.885765Z","submitted_at":"2025-08-06T13:14:20Z","title":"Decoding the Multimodal Maze: A Systematic Review on the Adoption of Explainability in Multimodal Attention-based Models","version":1},"reference_index":105,"source":"pdf_text","source_observed_at":"2026-05-19T00:34:38.247099Z"},"links":{"cited_paper":"/paper/1909.11556","citing_paper":"/paper/2508.04427"},"observation_digest":"sha256:eb230dd950353349fc099e3081740265330f06ecf28c66f250874165b941e702","observation_id":"e4d35bd6-cf40-4be1-9924-1ff35b2f3be8","resolution":{"observed_at":"2026-05-19T00:36:56.313975Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.11556","last_updated":"2019-09-25T15:35:03Z","snapshot_observed_at":"2026-08-08T18:02:18.011077Z","submitted_at":"2019-09-25T15:35:03Z","title":"Reducing Transformer Depth on Demand with Structured Dropout","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.11556","snapshot_observed_at":"2026-08-06T00:02:58.946950Z","title":null,"venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2508.04427","last_updated":"2026-06-11T09:27:03Z","snapshot_observed_at":"2026-08-08T19:09:09.885765Z","submitted_at":"2025-08-06T13:14:20Z","title":"Decoding the Multimodal Maze: A Systematic Review on the Adoption of Explainability in Multimodal Attention-based Models","version":2},"reference_index":105,"source":"pdf_text","source_observed_at":"2026-08-06T00:02:58.946950Z"},"links":{"cited_paper":"/paper/1909.11556","citing_paper":"/paper/2508.04427"},"observation_digest":"sha256:49506018e22102894e99edb4846c6c9443d215dcae2547851530f248f148bfab","observation_id":"8b34d409-72f4-470e-8e2e-b23b693ea384","resolution":{"observed_at":"2026-08-06T00:02:58.946950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.11556","last_updated":"2019-09-25T15:35:03Z","snapshot_observed_at":"2026-08-08T18:02:18.011077Z","submitted_at":"2019-09-25T15:35:03Z","title":"Reducing Transformer Depth on Demand with Structured Dropout","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.11556","snapshot_observed_at":"2026-08-05T21:16:22.237618Z","title":"Reducing transformer depth on demand with structured dropout","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2508.09262","last_updated":"2025-08-12T18:05:33Z","snapshot_observed_at":"2026-08-08T09:26:18.699272Z","submitted_at":"2025-08-12T18:05:33Z","title":"Harnessing Input-Adaptive Inference for Efficient VLN","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T21:16:22.237618Z"},"links":{"cited_paper":"/paper/1909.11556","citing_paper":"/paper/2508.09262"},"observation_digest":"sha256:03b3c4f0fd9360b60a1228ee31244501269d919cc482c67c4a504d347a288cf0","observation_id":"1beebdf1-25db-475a-9bc5-eb1303dad0e5","resolution":{"observed_at":"2026-08-05T21:16:22.237618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.11556","last_updated":"2019-09-25T15:35:03Z","snapshot_observed_at":"2026-08-08T18:02:18.011077Z","submitted_at":"2019-09-25T15:35:03Z","title":"Reducing Transformer Depth on Demand with Structured Dropout","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.11556","snapshot_observed_at":"2026-08-05T12:07:37.008912Z","title":"ArXivabs/1909.11556 (2019), https://api.semanticscholar","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2509.01903","last_updated":"2025-09-02T02:51:23Z","snapshot_observed_at":"2026-08-07T03:39:34.754728Z","submitted_at":"2025-09-02T02:51:23Z","title":"VISP: Volatility Informed Stochastic Projection for Adaptive Regularization","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T12:07:37.008912Z"},"links":{"cited_paper":"/paper/1909.11556","citing_paper":"/paper/2509.01903"},"observation_digest":"sha256:e2a906151f5365a131d9558112f9113672403dab2e30aab5f0251518a44b966d","observation_id":"483f8e97-ee2b-4ef9-8ae3-c0b17994d552","resolution":{"observed_at":"2026-08-05T12:07:37.008912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.11556","last_updated":"2019-09-25T15:35:03Z","snapshot_observed_at":"2026-08-08T18:02:18.011077Z","submitted_at":"2019-09-25T15:35:03Z","title":"Reducing Transformer Depth on Demand with Structured Dropout","version":1},"cited_work":{"arxiv_id":"1909.11556","doi":"10.48550/arxiv.1909.11556","metadata_source":"arxiv_reference","pith_arxiv_id":"1909.11556","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:1909.11556 (2019)","venue":"arXiv (Cornell University)","work_id":"2309ff43-c4f2-41b0-8dbe-92332c15716f","year":1909},"citing_paper":{"arxiv_id":"2604.15351","last_updated":"2026-04-04T10:24:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-04T10:24:12Z","title":"Aletheia: Gradient-Guided Layer Selection for Efficient LoRA Fine-Tuning Across Architectures","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-05-13T18:35:23.814733Z"},"links":{"cited_paper":"/paper/1909.11556","citing_paper":"/paper/2604.15351"},"observation_digest":"sha256:dba2f7c93a7d0e22e518584ea724a90b3b2912b1fc3e154f165c50c46143cd38","observation_id":"3f4346a0-e7d6-4651-ba8f-7c985a2c2f7b","resolution":{"observed_at":"2026-05-13T18:38:07.556104Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.11556","last_updated":"2019-09-25T15:35:03Z","snapshot_observed_at":"2026-08-08T18:02:18.011077Z","submitted_at":"2019-09-25T15:35:03Z","title":"Reducing Transformer Depth on Demand with Structured Dropout","version":1},"cited_work":{"arxiv_id":"1909.11556","doi":"10.48550/arxiv.1909.11556","metadata_source":"arxiv_reference","pith_arxiv_id":"1909.11556","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:1909.11556 (2019)","venue":"arXiv (Cornell University)","work_id":"2309ff43-c4f2-41b0-8dbe-92332c15716f","year":1909},"citing_paper":{"arxiv_id":"2604.17286","last_updated":"2026-04-19T06:59:34Z","snapshot_observed_at":"2026-08-03T04:25:48.631257Z","submitted_at":"2026-04-19T06:59:34Z","title":"Depth Adaptive Efficient Visual Autoregressive Modeling","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-10T06:22:55.035749Z"},"links":{"cited_paper":"/paper/1909.11556","citing_paper":"/paper/2604.17286"},"observation_digest":"sha256:27cafc8ce8b38b93158bb271f020337297edc5c1b33e8bf80308d4561d2fe52b","observation_id":"d1ac1b49-3e8e-4b59-a63e-c429923851db","resolution":{"observed_at":"2026-05-10T06:26:27.625427Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.11556","last_updated":"2019-09-25T15:35:03Z","snapshot_observed_at":"2026-08-08T18:02:18.011077Z","submitted_at":"2019-09-25T15:35:03Z","title":"Reducing Transformer Depth on Demand with Structured Dropout","version":1},"cited_work":{"arxiv_id":"1909.11556","doi":"10.48550/arxiv.1909.11556","metadata_source":"arxiv_reference","pith_arxiv_id":"1909.11556","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:1909.11556 (2019)","venue":"arXiv (Cornell University)","work_id":"2309ff43-c4f2-41b0-8dbe-92332c15716f","year":1909},"citing_paper":{"arxiv_id":"2604.17465","last_updated":"2026-04-30T22:17:02Z","snapshot_observed_at":"2026-08-02T19:54:22.380858Z","submitted_at":"2026-04-19T14:30:13Z","title":"Language models recognize dropout and Gaussian noise applied to their activations","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T05:38:12.882914Z"},"links":{"cited_paper":"/paper/1909.11556","citing_paper":"/paper/2604.17465"},"observation_digest":"sha256:b945a083094b222ee76f9cd52b3a6f9c1ba15b948c463af346ad45d749531412","observation_id":"c01b4b4a-0906-42c7-af38-7334de1511bf","resolution":{"observed_at":"2026-05-10T05:41:02.186788Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.11556","last_updated":"2019-09-25T15:35:03Z","snapshot_observed_at":"2026-08-08T18:02:18.011077Z","submitted_at":"2019-09-25T15:35:03Z","title":"Reducing Transformer Depth on Demand with Structured Dropout","version":1},"cited_work":{"arxiv_id":"1909.11556","doi":"10.48550/arxiv.1909.11556","metadata_source":"arxiv_reference","pith_arxiv_id":"1909.11556","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:1909.11556 (2019)","venue":"arXiv (Cornell University)","work_id":"2309ff43-c4f2-41b0-8dbe-92332c15716f","year":1909},"citing_paper":{"arxiv_id":"2604.22782","last_updated":"2026-04-03T14:56:17Z","snapshot_observed_at":"2026-08-02T15:24:09.520492Z","submitted_at":"2026-04-03T14:56:17Z","title":"Stochastic KV Routing: Enabling Adaptive Depth-Wise Cache Sharing","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-13T19:56:48.015363Z"},"links":{"cited_paper":"/paper/1909.11556","citing_paper":"/paper/2604.22782"},"observation_digest":"sha256:6090b3134b068627edb0f5a1116620b773389d95cc038012b0eb8268cbc02f9d","observation_id":"7351aec5-c8c2-4627-b739-ae141d653acf","resolution":{"observed_at":"2026-05-13T19:58:12.041938Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.11556","last_updated":"2019-09-25T15:35:03Z","snapshot_observed_at":"2026-08-08T18:02:18.011077Z","submitted_at":"2019-09-25T15:35:03Z","title":"Reducing Transformer Depth on Demand with Structured Dropout","version":1},"cited_work":{"arxiv_id":"1909.11556","doi":"10.48550/arxiv.1909.11556","metadata_source":"arxiv_reference","pith_arxiv_id":"1909.11556","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:1909.11556 (2019)","venue":"arXiv (Cornell University)","work_id":"2309ff43-c4f2-41b0-8dbe-92332c15716f","year":1909},"citing_paper":{"arxiv_id":"2604.24380","last_updated":"2026-04-27T12:10:44Z","snapshot_observed_at":"2026-07-06T23:10:24.992210Z","submitted_at":"2026-04-27T12:10:44Z","title":"Structural Pruning of Large Vision Language Models: A Comprehensive Study on Pruning Dynamics, Recovery, and Data Efficiency","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-08T03:47:38.100037Z"},"links":{"cited_paper":"/paper/1909.11556","citing_paper":"/paper/2604.24380"},"observation_digest":"sha256:5eebc9561a23b12dcfef52872f6159a35c228c2a18c0d55baf8d58db79d4e7ff","observation_id":"67ff6be4-e9a7-4148-b7d1-cbc5aefda9fb","resolution":{"observed_at":"2026-05-11T21:56:14.586000Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.11556","last_updated":"2019-09-25T15:35:03Z","snapshot_observed_at":"2026-08-08T18:02:18.011077Z","submitted_at":"2019-09-25T15:35:03Z","title":"Reducing Transformer Depth on Demand with Structured Dropout","version":1},"cited_work":{"arxiv_id":"1909.11556","doi":"10.48550/arxiv.1909.11556","metadata_source":"arxiv_reference","pith_arxiv_id":"1909.11556","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:1909.11556 (2019)","venue":"arXiv (Cornell University)","work_id":"2309ff43-c4f2-41b0-8dbe-92332c15716f","year":1909},"citing_paper":{"arxiv_id":"2604.26181","last_updated":"2026-05-01T02:27:23Z","snapshot_observed_at":"2026-07-06T23:11:52.954360Z","submitted_at":"2026-04-28T23:56:39Z","title":"SWAN: World-Aware Adaptive Multimodal Networks for Runtime Variations","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-07T16:08:12.351139Z"},"links":{"cited_paper":"/paper/1909.11556","citing_paper":"/paper/2604.26181"},"observation_digest":"sha256:9b9b440f14393c0328e792328c7fe485d3d6f7a4b7b6ca9923a447973d20be5e","observation_id":"bf2da7a7-a8d6-447c-a3d8-8ceccf243a33","resolution":{"observed_at":"2026-05-11T23:51:29.267468Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.11556","last_updated":"2019-09-25T15:35:03Z","snapshot_observed_at":"2026-08-08T18:02:18.011077Z","submitted_at":"2019-09-25T15:35:03Z","title":"Reducing Transformer Depth on Demand with Structured Dropout","version":1},"cited_work":{"arxiv_id":"1909.11556","doi":"10.48550/arxiv.1909.11556","metadata_source":"arxiv_reference","pith_arxiv_id":"1909.11556","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:1909.11556 (2019)","venue":"arXiv (Cornell University)","work_id":"2309ff43-c4f2-41b0-8dbe-92332c15716f","year":1909},"citing_paper":{"arxiv_id":"2605.06105","last_updated":"2026-05-07T12:21:03Z","snapshot_observed_at":"2026-07-06T23:18:36.537416Z","submitted_at":"2026-05-07T12:21:03Z","title":"Shallow Prefill, Deep Decoding: Efficient Long-Context Inference via Layer-Asymmetric KV Visibility","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-08T10:33:52.457620Z"},"links":{"cited_paper":"/paper/1909.11556","citing_paper":"/paper/2605.06105"},"observation_digest":"sha256:0a38aa5adddac700dc406285302bee20116161ad3d0242ada71794aa313c903d","observation_id":"c13c2308-d5ae-45b4-981d-07a7b3f47ed0","resolution":{"observed_at":"2026-05-11T20:01:09.011862Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.11556","last_updated":"2019-09-25T15:35:03Z","snapshot_observed_at":"2026-08-08T18:02:18.011077Z","submitted_at":"2019-09-25T15:35:03Z","title":"Reducing Transformer Depth on Demand with Structured Dropout","version":1},"cited_work":{"arxiv_id":"1909.11556","doi":"10.48550/arxiv.1909.11556","metadata_source":"arxiv_reference","pith_arxiv_id":"1909.11556","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:1909.11556 (2019)","venue":"arXiv (Cornell University)","work_id":"2309ff43-c4f2-41b0-8dbe-92332c15716f","year":1909},"citing_paper":{"arxiv_id":"2605.12714","last_updated":"2026-05-12T20:22:45Z","snapshot_observed_at":"2026-08-01T21:01:43.481918Z","submitted_at":"2026-05-12T20:22:45Z","title":"Layer-wise Representation Dynamics: An Empirical Investigation Across Embedders and Base LLMs","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-14T21:50:10.564922Z"},"links":{"cited_paper":"/paper/1909.11556","citing_paper":"/paper/2605.12714"},"observation_digest":"sha256:39107f245432012ce98008a7b2eab25e440dbfde6b0bdea5a69bca05a22fca25","observation_id":"e9c90031-af5b-441b-9322-bd19b77d0272","resolution":{"observed_at":"2026-05-14T21:58:04.030648Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.11556","last_updated":"2019-09-25T15:35:03Z","snapshot_observed_at":"2026-08-08T18:02:18.011077Z","submitted_at":"2019-09-25T15:35:03Z","title":"Reducing Transformer Depth on Demand with Structured Dropout","version":1},"cited_work":{"arxiv_id":"1909.11556","doi":"10.48550/arxiv.1909.11556","metadata_source":"arxiv_reference","pith_arxiv_id":"1909.11556","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:1909.11556 (2019)","venue":"arXiv (Cornell University)","work_id":"2309ff43-c4f2-41b0-8dbe-92332c15716f","year":1909},"citing_paper":{"arxiv_id":"2605.14037","last_updated":"2026-05-13T18:58:16Z","snapshot_observed_at":"2026-08-04T00:53:16.855757Z","submitted_at":"2026-05-13T18:58:16Z","title":"Self-Pruned Key-Value Attention: Learning When to Write by Predicting Future Utility","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-05-15T05:35:09.705532Z"},"links":{"cited_paper":"/paper/1909.11556","citing_paper":"/paper/2605.14037"},"observation_digest":"sha256:e5ad283a7471aaa346383734ae03d4406ce5b914dab83eaccff4942df5bf1ad2","observation_id":"972ad1df-c680-4ad2-807f-6c3adf3cb646","resolution":{"observed_at":"2026-05-15T05:39:47.975021Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.11556","last_updated":"2019-09-25T15:35:03Z","snapshot_observed_at":"2026-08-08T18:02:18.011077Z","submitted_at":"2019-09-25T15:35:03Z","title":"Reducing Transformer Depth on Demand with Structured Dropout","version":1},"cited_work":{"arxiv_id":"1909.11556","doi":"10.48550/arxiv.1909.11556","metadata_source":"arxiv_reference","pith_arxiv_id":"1909.11556","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:1909.11556 (2019)","venue":"arXiv (Cornell University)","work_id":"2309ff43-c4f2-41b0-8dbe-92332c15716f","year":1909},"citing_paper":{"arxiv_id":"2606.06574","last_updated":"2026-06-04T17:59:58Z","snapshot_observed_at":"2026-07-06T23:46:24.981618Z","submitted_at":"2026-06-04T17:59:58Z","title":"Skip a Layer or Loop It? Learning Program-of-Layers in LLMs","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-28T01:56:34.435152Z"},"links":{"cited_paper":"/paper/1909.11556","citing_paper":"/paper/2606.06574"},"observation_digest":"sha256:1bd20e087fefb645d801b3c68b94d2db779f134019be341d336c2ae49c4b5105","observation_id":"a9ae38b3-1ea4-455c-add4-905c249bdbf4","resolution":{"observed_at":"2026-07-02T12:36:57.370073Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.11556","last_updated":"2019-09-25T15:35:03Z","snapshot_observed_at":"2026-08-08T18:02:18.011077Z","submitted_at":"2019-09-25T15:35:03Z","title":"Reducing Transformer Depth on Demand with Structured Dropout","version":1},"cited_work":{"arxiv_id":"1909.11556","doi":"10.48550/arxiv.1909.11556","metadata_source":"arxiv_reference","pith_arxiv_id":"1909.11556","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:1909.11556 (2019)","venue":"arXiv (Cornell University)","work_id":"2309ff43-c4f2-41b0-8dbe-92332c15716f","year":1909},"citing_paper":{"arxiv_id":"2606.09131","last_updated":"2026-06-08T07:28:14Z","snapshot_observed_at":"2026-08-07T20:04:49.687813Z","submitted_at":"2026-06-08T07:28:14Z","title":"Late-Layer Fusion is Enough: Dual-Path Vision Token Routing for Multimodal Large Language Models under Visual Saturation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-27T16:32:09.784716Z"},"links":{"cited_paper":"/paper/1909.11556","citing_paper":"/paper/2606.09131"},"observation_digest":"sha256:7e410b60317ddc5c23673546202d86cda0ddf28536af191edf1c92b4dc84c7fd","observation_id":"7cada08f-0e51-4b6a-b246-8e3b26a7c03d","resolution":{"observed_at":"2026-06-27T16:41:03.364124Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.11556","last_updated":"2019-09-25T15:35:03Z","snapshot_observed_at":"2026-08-08T18:02:18.011077Z","submitted_at":"2019-09-25T15:35:03Z","title":"Reducing Transformer Depth on Demand with Structured Dropout","version":1},"cited_work":{"arxiv_id":"1909.11556","doi":"10.48550/arxiv.1909.11556","metadata_source":"arxiv_reference","pith_arxiv_id":"1909.11556","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:1909.11556 (2019)","venue":"arXiv (Cornell University)","work_id":"2309ff43-c4f2-41b0-8dbe-92332c15716f","year":1909},"citing_paper":{"arxiv_id":"2606.23670","last_updated":"2026-06-22T17:56:25Z","snapshot_observed_at":"2026-08-08T15:39:37.831663Z","submitted_at":"2026-06-22T17:56:25Z","title":"Tapered Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-26T09:11:20.341634Z"},"links":{"cited_paper":"/paper/1909.11556","citing_paper":"/paper/2606.23670"},"observation_digest":"sha256:c421d20843a99a0e686be5b47ade34103cd7b2260dc457d8833762f288bfa184","observation_id":"557c46b0-6da5-4ea7-a4ed-dee2dfdb2bb1","resolution":{"observed_at":"2026-07-04T09:59:45.954130Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.11556","last_updated":"2019-09-25T15:35:03Z","snapshot_observed_at":"2026-08-08T18:02:18.011077Z","submitted_at":"2019-09-25T15:35:03Z","title":"Reducing Transformer Depth on Demand with Structured Dropout","version":1},"cited_work":{"arxiv_id":"1909.11556","doi":"10.48550/arxiv.1909.11556","metadata_source":"arxiv_reference","pith_arxiv_id":"1909.11556","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:1909.11556 (2019)","venue":"arXiv (Cornell University)","work_id":"2309ff43-c4f2-41b0-8dbe-92332c15716f","year":1909},"citing_paper":{"arxiv_id":"2606.29983","last_updated":"2026-06-29T08:58:09Z","snapshot_observed_at":"2026-08-03T21:27:41.768539Z","submitted_at":"2026-06-29T08:58:09Z","title":"Stabilizing Extrapolation in Looped Transformers via Learned Stochastic Stopping","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-30T07:29:23.786653Z"},"links":{"cited_paper":"/paper/1909.11556","citing_paper":"/paper/2606.29983"},"observation_digest":"sha256:d7e352aa0c974492bc644da2428bd2b0a9683b314d86dd3d85467984d3e2e720","observation_id":"23ae4396-631b-4c90-a1cd-57c22b8282ba","resolution":{"observed_at":"2026-06-30T07:34:21.633951Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.11556","last_updated":"2019-09-25T15:35:03Z","snapshot_observed_at":"2026-08-08T18:02:18.011077Z","submitted_at":"2019-09-25T15:35:03Z","title":"Reducing Transformer Depth on Demand with Structured Dropout","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.11556","snapshot_observed_at":"2026-08-05T18:20:38.521564Z","title":"Reducing transformer depth on demand with structured dropout.arxiv preprint arxiv: 1909.11556,","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2608.03480","last_updated":"2026-08-04T11:17:54Z","snapshot_observed_at":"2026-08-08T21:06:24.636222Z","submitted_at":"2026-08-04T11:17:54Z","title":"Efficient Multilingual Neural Machine Translation via Corpus-Driven Vocabulary Pruning: An English-Arabic Case Study","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T18:20:38.521564Z"},"links":{"cited_paper":"/paper/1909.11556","citing_paper":"/paper/2608.03480"},"observation_digest":"sha256:1c6b8a14c55b3b8df9343d027cd8eb42fdca3f7aef86e67965074b9311a7f8c3","observation_id":"ee248a96-9780-4b07-b3fe-04d7b3b56d60","resolution":{"observed_at":"2026-08-05T18:20:38.521564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/1909.11556/citation-record","integrity":"/paper/1909.11556/integrity","json":"/paper/1909.11556/citation-record.json","paper":"/paper/1909.11556"},"outbound":[],"paper":{"arxiv_id":"1909.11556","last_updated":"2019-09-25T15:35:03Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-08T18:02:18.011077Z","submitted_at":"2019-09-25T15:35:03Z","title":"Reducing Transformer Depth on Demand with Structured Dropout"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 29 inbound Pith citation observations for arXiv:1909.11556."}