{"as_of":"2026-08-14T12:17:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:bc5793684b23526973bfd6af6a16d8ece193d4721bd9af9957c64fa891e72d00","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":20,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":20,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":20,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":20,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T04:40:19.473027Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T02:46:28.953761Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"1910.10073","last_updated":"2020-02-14T20:49:40Z","snapshot_observed_at":"2026-07-06T08:31:23.192830Z","submitted_at":"2019-10-22T16:15:58Z","title":"Depth-Adaptive Transformer","version":4},"cited_work":{"arxiv_id":"1910.10073","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1910.10073","snapshot_observed_at":"2026-07-02T02:46:28.953761Z","title":"Depth-adaptive transformer","venue":null,"work_id":"6d994f34-ab13-423e-96ec-52b63f47a6d6","year":2019},"citing_paper":{"arxiv_id":"2006.16668","last_updated":"2020-06-30T10:42:02Z","snapshot_observed_at":"2026-08-07T09:27:36.420559Z","submitted_at":"2020-06-30T10:42:02Z","title":"GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-11T02:26:44.624137Z"},"links":{"cited_paper":"/paper/1910.10073","citing_paper":"/paper/2006.16668"},"observation_digest":"sha256:26f99be7bf92cab16f6a03df72c630b2995ba93efe8920d1c970e9923c71d6ef","observation_id":"244204ad-672e-4801-ac44-df0e2c5eb2da","resolution":{"observed_at":"2026-05-11T02:26:44.715474Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.10073","last_updated":"2020-02-14T20:49:40Z","snapshot_observed_at":"2026-07-06T08:31:23.192830Z","submitted_at":"2019-10-22T16:15:58Z","title":"Depth-Adaptive Transformer","version":4},"cited_work":{"arxiv_id":"1910.10073","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1910.10073","snapshot_observed_at":"2026-07-02T02:46:28.953761Z","title":"Depth-adaptive transformer","venue":null,"work_id":"6d994f34-ab13-423e-96ec-52b63f47a6d6","year":2019},"citing_paper":{"arxiv_id":"2211.17192","last_updated":"2023-05-18T20:28:20Z","snapshot_observed_at":"2026-08-08T11:03:33.403601Z","submitted_at":"2022-11-30T17:33:28Z","title":"Fast Inference from Transformers via Speculative Decoding","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-05-17T22:52:00.101612Z"},"links":{"cited_paper":"/paper/1910.10073","citing_paper":"/paper/2211.17192"},"observation_digest":"sha256:289f4a1b9f84d9cdbb99b48de269f33595e222fe87576967b46968b0214cc164","observation_id":"997ddc8e-7d0b-4067-867f-0b57b2c0062e","resolution":{"observed_at":"2026-05-17T22:52:00.183112Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.10073","last_updated":"2020-02-14T20:49:40Z","snapshot_observed_at":"2026-07-06T08:31:23.192830Z","submitted_at":"2019-10-22T16:15:58Z","title":"Depth-Adaptive Transformer","version":4},"cited_work":{"arxiv_id":"1910.10073","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1910.10073","snapshot_observed_at":"2026-07-02T02:46:28.953761Z","title":"Depth-adaptive transformer","venue":null,"work_id":"6d994f34-ab13-423e-96ec-52b63f47a6d6","year":2019},"citing_paper":{"arxiv_id":"2404.02258","last_updated":"2024-04-02T19:28:11Z","snapshot_observed_at":"2026-08-13T18:31:52.318837Z","submitted_at":"2024-04-02T19:28:11Z","title":"Mixture-of-Depths: Dynamically allocating compute in transformer-based language models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-17T02:18:02.254491Z"},"links":{"cited_paper":"/paper/1910.10073","citing_paper":"/paper/2404.02258"},"observation_digest":"sha256:a5b61a5fd51f787a21ec7f0799a8f703a44dc194cc7a242454231d652f672c18","observation_id":"55576f29-b02f-4799-bfe5-77ecbf696086","resolution":{"observed_at":"2026-05-17T02:18:02.277612Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.10073","last_updated":"2020-02-14T20:49:40Z","snapshot_observed_at":"2026-07-06T08:31:23.192830Z","submitted_at":"2019-10-22T16:15:58Z","title":"Depth-Adaptive Transformer","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.10073","snapshot_observed_at":"2026-08-12T04:40:19.473027Z","title":"Depth-adaptive transformer","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2412.01199","last_updated":"2024-12-02T07:05:39Z","snapshot_observed_at":"2026-08-13T13:16:01.719503Z","submitted_at":"2024-12-02T07:05:39Z","title":"TinyFusion: Diffusion Transformers Learned Shallow","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T04:40:19.473027Z"},"links":{"cited_paper":"/paper/1910.10073","citing_paper":"/paper/2412.01199"},"observation_digest":"sha256:8cc9f1c755bb32106e2b5751d4d35e2a61dcfd14674ff05ea5a74e6099008ce5","observation_id":"0d3f02bf-56f2-4c62-bbf7-43f9b854336c","resolution":{"observed_at":"2026-08-12T04:40:19.473027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.10073","last_updated":"2020-02-14T20:49:40Z","snapshot_observed_at":"2026-07-06T08:31:23.192830Z","submitted_at":"2019-10-22T16:15:58Z","title":"Depth-Adaptive Transformer","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.10073","snapshot_observed_at":"2026-08-11T00:46:17.705612Z","title":"Depth-adaptive transformer","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2412.19325","last_updated":"2024-12-26T18:54:32Z","snapshot_observed_at":"2026-08-13T23:51:33.664770Z","submitted_at":"2024-12-26T18:54:32Z","title":"Performance Control in Early Exiting to Deploy Large Models at the Same Cost of Smaller Ones","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-11T00:46:17.705612Z"},"links":{"cited_paper":"/paper/1910.10073","citing_paper":"/paper/2412.19325"},"observation_digest":"sha256:c5cc10b11eaaed7cc8bbb575e0913893bf7457e9272f302bbf251b55abd13c8a","observation_id":"7a1f2f3d-82ee-4962-8c77-b681aacae00f","resolution":{"observed_at":"2026-08-11T00:46:17.705612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.10073","last_updated":"2020-02-14T20:49:40Z","snapshot_observed_at":"2026-07-06T08:31:23.192830Z","submitted_at":"2019-10-22T16:15:58Z","title":"Depth-Adaptive Transformer","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.10073","snapshot_observed_at":"2026-08-10T20:40:46.185430Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.07670","last_updated":"2025-01-13T20:08:52Z","snapshot_observed_at":"2026-08-12T17:05:37.401228Z","submitted_at":"2025-01-13T20:08:52Z","title":"A Survey of Early Exit Deep Neural Networks in NLP","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-10T20:40:46.185430Z"},"links":{"cited_paper":"/paper/1910.10073","citing_paper":"/paper/2501.07670"},"observation_digest":"sha256:f61752af97f463c859e461131614625c070a83129c4beedf64c621dd4ab08a8d","observation_id":"829eb60d-3992-4d66-9195-7bb6e8fc0855","resolution":{"observed_at":"2026-08-10T20:40:46.185430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.10073","last_updated":"2020-02-14T20:49:40Z","snapshot_observed_at":"2026-07-06T08:31:23.192830Z","submitted_at":"2019-10-22T16:15:58Z","title":"Depth-Adaptive Transformer","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.10073","snapshot_observed_at":"2026-08-10T20:35:13.040015Z","title":"Depth- adaptive transformer,","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2501.08057","last_updated":"2025-01-14T12:12:06Z","snapshot_observed_at":"2026-08-14T02:22:33.049335Z","submitted_at":"2025-01-14T12:12:06Z","title":"Optimizing Speech Multi-View Feature Fusion through Conditional Computation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T20:35:13.040015Z"},"links":{"cited_paper":"/paper/1910.10073","citing_paper":"/paper/2501.08057"},"observation_digest":"sha256:d1c953e1001c73a2cf54ed46515767093a79326aef417bfbc6d0151cdb7c3c64","observation_id":"d1f92b65-ee65-4a44-b930-b9bf5021c6f9","resolution":{"observed_at":"2026-08-10T20:35:13.040015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.10073","last_updated":"2020-02-14T20:49:40Z","snapshot_observed_at":"2026-07-06T08:31:23.192830Z","submitted_at":"2019-10-22T16:15:58Z","title":"Depth-Adaptive Transformer","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.10073","snapshot_observed_at":"2026-08-07T14:27:38.108161Z","title":"Depth-adaptive transformer","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2505.18962","last_updated":"2025-05-31T15:08:41Z","snapshot_observed_at":"2026-08-13T11:40:13.393602Z","submitted_at":"2025-05-25T03:35:49Z","title":"System-1.5 Reasoning: Traversal in Language and Latent Spaces with Dynamic Shortcuts","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:38.108161Z"},"links":{"cited_paper":"/paper/1910.10073","citing_paper":"/paper/2505.18962"},"observation_digest":"sha256:3440c1bd9f730b1346c9d6d5330d6c7f4d63ed166f5294fe2abab2c313f7ee90","observation_id":"acd29e4c-0339-438e-a6d0-c30b2e11c871","resolution":{"observed_at":"2026-08-07T14:27:38.108161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.10073","last_updated":"2020-02-14T20:49:40Z","snapshot_observed_at":"2026-07-06T08:31:23.192830Z","submitted_at":"2019-10-22T16:15:58Z","title":"Depth-Adaptive Transformer","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.10073","snapshot_observed_at":"2026-08-06T22:40:53.477626Z","title":"Depth- Adaptive Transformer , February 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.21103","last_updated":"2025-06-26T09:01:19Z","snapshot_observed_at":"2026-08-13T10:12:15.799192Z","submitted_at":"2025-06-26T09:01:19Z","title":"Learning to Skip the Middle Layers of Transformers","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T22:40:53.477626Z"},"links":{"cited_paper":"/paper/1910.10073","citing_paper":"/paper/2506.21103"},"observation_digest":"sha256:f2d3ef18949e0b61e2521c8764e4f068407393bd9853ddcbe9be595f14d9a3f6","observation_id":"69641cf8-442b-4d45-babd-24d3018dc9fb","resolution":{"observed_at":"2026-08-06T22:40:53.477626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.10073","last_updated":"2020-02-14T20:49:40Z","snapshot_observed_at":"2026-07-06T08:31:23.192830Z","submitted_at":"2019-10-22T16:15:58Z","title":"Depth-Adaptive Transformer","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.10073","snapshot_observed_at":"2026-08-06T16:28:21.495470Z","title":"Depth-adaptive transformer.arXiv preprint arXiv:1910.10073, 2019","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2507.13569","last_updated":"2025-07-17T23:12:57Z","snapshot_observed_at":"2026-08-12T03:32:33.733828Z","submitted_at":"2025-07-17T23:12:57Z","title":"Change of Thought: Adaptive Test-Time Computation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:21.495470Z"},"links":{"cited_paper":"/paper/1910.10073","citing_paper":"/paper/2507.13569"},"observation_digest":"sha256:4dcf63d4fd8e0e0123fa2adaeddeb1e20fa173d72186d88dcfc751d156f2eaa1","observation_id":"bba254c7-9c75-4049-9fac-1434aea1ca02","resolution":{"observed_at":"2026-08-06T16:28:21.495470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.10073","last_updated":"2020-02-14T20:49:40Z","snapshot_observed_at":"2026-07-06T08:31:23.192830Z","submitted_at":"2019-10-22T16:15:58Z","title":"Depth-Adaptive Transformer","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.10073","snapshot_observed_at":"2026-08-06T15:32:34.526903Z","title":"Depth-adaptive transformer,","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2507.15652","last_updated":"2025-07-21T14:15:34Z","snapshot_observed_at":"2026-08-11T23:02:25.619692Z","submitted_at":"2025-07-21T14:15:34Z","title":"Extracting Visual Facts from Intermediate Layers for Mitigating Hallucinations in Multimodal Large Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T15:32:34.526903Z"},"links":{"cited_paper":"/paper/1910.10073","citing_paper":"/paper/2507.15652"},"observation_digest":"sha256:e51f6c04aad8958e030954f42f8233b69c4e835f4ea6ed9deef695bb55f17156","observation_id":"1c694b9b-4ce1-4710-9d8f-3a0225167cdd","resolution":{"observed_at":"2026-08-06T15:32:34.526903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.10073","last_updated":"2020-02-14T20:49:40Z","snapshot_observed_at":"2026-07-06T08:31:23.192830Z","submitted_at":"2019-10-22T16:15:58Z","title":"Depth-Adaptive Transformer","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.10073","snapshot_observed_at":"2026-08-04T12:45:24.763365Z","title":"Depth-adaptive transformer, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2510.02480","last_updated":"2026-05-27T22:55:59Z","snapshot_observed_at":"2026-08-11T04:44:02.075367Z","submitted_at":"2025-10-02T18:36:10Z","title":"Controlling the Risk of Corrupted Contexts for Language Models via Early-Exiting","version":3},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-04T12:45:24.763365Z"},"links":{"cited_paper":"/paper/1910.10073","citing_paper":"/paper/2510.02480"},"observation_digest":"sha256:960e944d61bf1921dca44c76a7284674856665840994a0bd6da272999a2aa1d5","observation_id":"dddf6d73-6888-4f22-b420-ae1a7f571457","resolution":{"observed_at":"2026-08-04T12:45:24.763365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.10073","last_updated":"2020-02-14T20:49:40Z","snapshot_observed_at":"2026-07-06T08:31:23.192830Z","submitted_at":"2019-10-22T16:15:58Z","title":"Depth-Adaptive Transformer","version":4},"cited_work":{"arxiv_id":"1910.10073","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1910.10073","snapshot_observed_at":"2026-07-02T02:46:28.953761Z","title":"Depth-adaptive transformer","venue":null,"work_id":"6d994f34-ab13-423e-96ec-52b63f47a6d6","year":2019},"citing_paper":{"arxiv_id":"2604.03263","last_updated":"2026-03-12T21:21:51Z","snapshot_observed_at":"2026-08-07T08:04:07.875512Z","submitted_at":"2026-03-12T21:21:51Z","title":"LPC-SM: Local Predictive Coding and Sparse Memory for Long-Context Language Modeling","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-15T11:22:08.937342Z"},"links":{"cited_paper":"/paper/1910.10073","citing_paper":"/paper/2604.03263"},"observation_digest":"sha256:da7d7019211740152784ef136d5ae15afced9008f877789f5dfaed3908664235","observation_id":"5b006ccd-1c3f-43c9-bc92-971103d98d87","resolution":{"observed_at":"2026-05-15T11:25:30.978799Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.10073","last_updated":"2020-02-14T20:49:40Z","snapshot_observed_at":"2026-07-06T08:31:23.192830Z","submitted_at":"2019-10-22T16:15:58Z","title":"Depth-Adaptive Transformer","version":4},"cited_work":{"arxiv_id":"1910.10073","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1910.10073","snapshot_observed_at":"2026-07-02T02:46:28.953761Z","title":"Depth-adaptive transformer","venue":null,"work_id":"6d994f34-ab13-423e-96ec-52b63f47a6d6","year":2019},"citing_paper":{"arxiv_id":"2604.27981","last_updated":"2026-04-30T15:10:18Z","snapshot_observed_at":"2026-08-13T08:16:34.868173Z","submitted_at":"2026-04-30T15:10:18Z","title":"ITS-Mina: A Harris Hawks Optimization-Based All-MLP Framework with Iterative Refinement and External Attention for Multivariate Time Series Forecasting","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-07T06:38:59.744091Z"},"links":{"cited_paper":"/paper/1910.10073","citing_paper":"/paper/2604.27981"},"observation_digest":"sha256:630869ffe3d7181fe86976f3606c10d1ccbc0981a6cc0a14347e034af227fc85","observation_id":"033ca98c-c0c4-457c-b5d1-93522db9bb50","resolution":{"observed_at":"2026-05-12T10:16:28.746745Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.10073","last_updated":"2020-02-14T20:49:40Z","snapshot_observed_at":"2026-07-06T08:31:23.192830Z","submitted_at":"2019-10-22T16:15:58Z","title":"Depth-Adaptive Transformer","version":4},"cited_work":{"arxiv_id":"1910.10073","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1910.10073","snapshot_observed_at":"2026-07-02T02:46:28.953761Z","title":"Depth-adaptive transformer","venue":null,"work_id":"6d994f34-ab13-423e-96ec-52b63f47a6d6","year":2019},"citing_paper":{"arxiv_id":"2605.10875","last_updated":"2026-05-11T17:27:15Z","snapshot_observed_at":"2026-08-13T18:28:47.986652Z","submitted_at":"2026-05-11T17:27:15Z","title":"Compute Where it Counts: Self Optimizing Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-12T04:57:58.649358Z"},"links":{"cited_paper":"/paper/1910.10073","citing_paper":"/paper/2605.10875"},"observation_digest":"sha256:990eeea4204cebb2656c84986507032c97482921456c03b89b2aa6f1315823ab","observation_id":"e134466c-a290-402b-8e67-bd520d544699","resolution":{"observed_at":"2026-05-12T05:46:29.499825Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.10073","last_updated":"2020-02-14T20:49:40Z","snapshot_observed_at":"2026-07-06T08:31:23.192830Z","submitted_at":"2019-10-22T16:15:58Z","title":"Depth-Adaptive Transformer","version":4},"cited_work":{"arxiv_id":"1910.10073","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1910.10073","snapshot_observed_at":"2026-07-02T02:46:28.953761Z","title":"Depth-adaptive transformer","venue":null,"work_id":"6d994f34-ab13-423e-96ec-52b63f47a6d6","year":2019},"citing_paper":{"arxiv_id":"2605.19376","last_updated":"2026-05-20T08:03:28Z","snapshot_observed_at":"2026-08-13T11:55:02.360619Z","submitted_at":"2026-05-19T05:20:56Z","title":"Generative Recursive Reasoning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-20T05:58:23.543870Z"},"links":{"cited_paper":"/paper/1910.10073","citing_paper":"/paper/2605.19376"},"observation_digest":"sha256:bb856afd94c8cf0141438729e530ea526aae361533a3ae8d95cc0c7866aa8736","observation_id":"3da75a85-efec-4381-95ad-1f88359818f1","resolution":{"observed_at":"2026-05-20T06:03:05.424758Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.10073","last_updated":"2020-02-14T20:49:40Z","snapshot_observed_at":"2026-07-06T08:31:23.192830Z","submitted_at":"2019-10-22T16:15:58Z","title":"Depth-Adaptive Transformer","version":4},"cited_work":{"arxiv_id":"1910.10073","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1910.10073","snapshot_observed_at":"2026-07-02T02:46:28.953761Z","title":"Depth-adaptive transformer","venue":null,"work_id":"6d994f34-ab13-423e-96ec-52b63f47a6d6","year":2019},"citing_paper":{"arxiv_id":"2605.19376","last_updated":"2026-05-20T08:03:28Z","snapshot_observed_at":"2026-08-13T11:55:02.360619Z","submitted_at":"2026-05-19T05:20:56Z","title":"Generative Recursive Reasoning","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-21T07:40:30.199868Z"},"links":{"cited_paper":"/paper/1910.10073","citing_paper":"/paper/2605.19376"},"observation_digest":"sha256:2e0d533fb08aa948673648d5acc1e8cd28b6edae82e9eddf8682cefc09e97f06","observation_id":"ea88b0b7-ff16-42d2-88b3-a13f85f98a38","resolution":{"observed_at":"2026-05-21T07:44:03.132077Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.10073","last_updated":"2020-02-14T20:49:40Z","snapshot_observed_at":"2026-07-06T08:31:23.192830Z","submitted_at":"2019-10-22T16:15:58Z","title":"Depth-Adaptive Transformer","version":4},"cited_work":{"arxiv_id":"1910.10073","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1910.10073","snapshot_observed_at":"2026-07-02T02:46:28.953761Z","title":"Depth-adaptive transformer","venue":null,"work_id":"6d994f34-ab13-423e-96ec-52b63f47a6d6","year":2019},"citing_paper":{"arxiv_id":"2605.26099","last_updated":"2026-06-05T05:36:49Z","snapshot_observed_at":"2026-07-06T23:36:01.564747Z","submitted_at":"2026-05-25T17:55:39Z","title":"Do Language Models Need Sleep? Offline Recurrence for Improved Online Inference","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-29T21:37:51.638904Z"},"links":{"cited_paper":"/paper/1910.10073","citing_paper":"/paper/2605.26099"},"observation_digest":"sha256:72a593b91f2c4392cfabe06e364ddb808e7b2b7ff6f677f0c8eb4c718263242e","observation_id":"293c5763-19fd-4499-a5ef-31bd84c90b28","resolution":{"observed_at":"2026-06-29T21:43:59.487437Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.10073","last_updated":"2020-02-14T20:49:40Z","snapshot_observed_at":"2026-07-06T08:31:23.192830Z","submitted_at":"2019-10-22T16:15:58Z","title":"Depth-Adaptive Transformer","version":4},"cited_work":{"arxiv_id":"1910.10073","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1910.10073","snapshot_observed_at":"2026-07-02T02:46:28.953761Z","title":"Depth-adaptive transformer","venue":null,"work_id":"6d994f34-ab13-423e-96ec-52b63f47a6d6","year":2019},"citing_paper":{"arxiv_id":"2606.03054","last_updated":"2026-06-02T02:44:27Z","snapshot_observed_at":"2026-08-02T04:55:02.222478Z","submitted_at":"2026-06-02T02:44:27Z","title":"ToolGate: Token-Efficient Pre-Call Control for Tool-Augmented Vision-Language Agents","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-06-28T10:38:41.735204Z"},"links":{"cited_paper":"/paper/1910.10073","citing_paper":"/paper/2606.03054"},"observation_digest":"sha256:84c3284024a4b885b1126684c6e11c0d4cc2f7c7a0590a16964aa9a97268ae2f","observation_id":"f3b2df3c-3c96-4596-8b1f-587bbfc13801","resolution":{"observed_at":"2026-07-02T02:46:28.955527Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.10073","last_updated":"2020-02-14T20:49:40Z","snapshot_observed_at":"2026-07-06T08:31:23.192830Z","submitted_at":"2019-10-22T16:15:58Z","title":"Depth-Adaptive Transformer","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.10073","snapshot_observed_at":"2026-08-02T08:13:28.464915Z","title":null,"venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2607.20519","last_updated":"2026-07-08T02:54:03Z","snapshot_observed_at":"2026-08-06T23:41:10.107122Z","submitted_at":"2026-07-08T02:54:03Z","title":"Adaptive Depth in Looped Transformers: Diagnosing Learned Halting Gates and Trajectory Readouts","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-02T08:13:28.464915Z"},"links":{"cited_paper":"/paper/1910.10073","citing_paper":"/paper/2607.20519"},"observation_digest":"sha256:ebac6ef74990e66e66d7859e3e52f825748d3bd29f095babeb37a9877fc2a1bc","observation_id":"b4ee65a6-d0d6-4f95-b2f9-b5d7ab40b1ae","resolution":{"observed_at":"2026-08-02T08:13:28.464915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/1910.10073/citation-record","integrity":"/paper/1910.10073/integrity","json":"/paper/1910.10073/citation-record.json","paper":"/paper/1910.10073"},"outbound":[],"paper":{"arxiv_id":"1910.10073","last_updated":"2020-02-14T20:49:40Z","latest_version":4,"primary_category":"cs.CL","snapshot_observed_at":"2026-07-06T08:31:23.192830Z","submitted_at":"2019-10-22T16:15:58Z","title":"Depth-Adaptive Transformer"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 20 inbound Pith citation observations for arXiv:1910.10073."}