{"as_of":"2026-08-14T14:27:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a6cbb1adaf533af308883de9bb05590b6ac29f527dd011031e6dd8e1d455068a","coverage":[{"denominator":16,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":16,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T07:13:17.608238Z","state":"measured"},{"denominator":17,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":17,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-12T19:21:50.343965Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.05222","last_updated":"2026-04-18T02:04:47Z","snapshot_observed_at":"2026-08-11T12:29:41.016095Z","submitted_at":"2026-04-18T02:04:47Z","title":"Adaptive Computation Depth via Learned Token Routing in Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.05222","snapshot_observed_at":"2026-07-12T19:21:50.343965Z","title":"We presentToken-Selective Attention (TSA), a learned per-token gate on residual updates between consecutive transformer blocks","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2605.05220","last_updated":"2026-06-05T14:18:53Z","snapshot_observed_at":"2026-08-11T20:37:12.080301Z","submitted_at":"2026-04-17T19:23:33Z","title":"MidSteer: Optimal Affine Framework for Steering Generative Models","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-12T19:21:50.343965Z"},"links":{"cited_paper":"/paper/2605.05222","citing_paper":"/paper/2605.05220"},"observation_digest":"sha256:b1dfe70fb5edea4ba85aac705974ae0a66fa6339007cfe2755f9db929201059e","observation_id":"95e00381-8c58-4795-9920-c2f57a1fb138","resolution":{"observed_at":"2026-07-12T19:21:50.343965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2605.05222/citation-record","integrity":"/paper/2605.05222/integrity","json":"/paper/2605.05222/citation-record.json","paper":"/paper/2605.05222"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1603.08983","last_updated":"2017-02-21T16:21:21Z","snapshot_observed_at":"2026-08-13T17:50:13.821769Z","submitted_at":"2016-03-29T22:09:00Z","title":"Adaptive Computation Time for Recurrent Neural Networks","version":6},"cited_work":{"arxiv_id":"1603.08983","doi":"10.48550/arxiv.1603.08983","metadata_source":"pith","pith_arxiv_id":"1603.08983","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Adaptive Computation Time for Recurrent Neural Networks","venue":"cs.NE","work_id":"75565443-173e-479c-b0e7-d2464e7630be","year":2016},"citing_paper":{"arxiv_id":"2605.05222","last_updated":"2026-04-18T02:04:47Z","snapshot_observed_at":"2026-08-11T12:29:41.016095Z","submitted_at":"2026-04-18T02:04:47Z","title":"Adaptive Computation Depth via Learned Token Routing in Transformers","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-05-10T07:13:17.608238Z"},"links":{"cited_paper":"/paper/1603.08983","citing_paper":"/paper/2605.05222"},"observation_digest":"sha256:c509185167923ff763c63ae4b224bbb3e45bcda5f2ff9668f26b5d856590c8e5","observation_id":"8636c25a-55e4-457a-9286-b56e73010045","resolution":{"observed_at":"2026-05-12T11:53:22.734695Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"International Conference on Learning Representations (ICLR) , year =","venue":null,"work_id":"165fc2e2-4f7f-4e38-8918-80bbef073759","year":null},"citing_paper":{"arxiv_id":"2605.05222","last_updated":"2026-04-18T02:04:47Z","snapshot_observed_at":"2026-08-11T12:29:41.016095Z","submitted_at":"2026-04-18T02:04:47Z","title":"Adaptive Computation Depth via Learned Token Routing in Transformers","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-05-10T07:13:17.608238Z"},"links":{"citing_paper":"/paper/2605.05222"},"observation_digest":"sha256:26c9a9ba72fc340ba2f9e65180b9cb06f409a4d3ae007a7a852b8d2920ad285e","observation_id":"5a217ed3-aefe-49a2-9d89-ddac9a0f861d","resolution":{"observed_at":"2026-05-21T14:15:13.625728Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02258","last_updated":"2024-04-02T19:28:11Z","snapshot_observed_at":"2026-08-13T18:31:52.318837Z","submitted_at":"2024-04-02T19:28:11Z","title":"Mixture-of-Depths: Dynamically allocating compute in transformer-based language models","version":1},"cited_work":{"arxiv_id":"2404.02258","doi":"10.48550/arxiv.2404.02258","metadata_source":"pith","pith_arxiv_id":"2404.02258","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mixture-of-Depths: Dynamically allocating compute in transformer-based language models","venue":"cs.LG","work_id":"6dcdd707-a37b-49a9-9531-4fc6f5b9ed84","year":2024},"citing_paper":{"arxiv_id":"2605.05222","last_updated":"2026-04-18T02:04:47Z","snapshot_observed_at":"2026-08-11T12:29:41.016095Z","submitted_at":"2026-04-18T02:04:47Z","title":"Adaptive Computation Depth via Learned Token Routing in Transformers","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-05-10T07:13:17.608238Z"},"links":{"cited_paper":"/paper/2404.02258","citing_paper":"/paper/2605.05222"},"observation_digest":"sha256:3282b1d74893f3b075069b340809812bc05a8f8ddb35a449b91981e771aa9920","observation_id":"a5e3c4fa-b260-46ca-9996-98d916604f49","resolution":{"observed_at":"2026-05-17T02:18:02.305925Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"International Conference on Machine Learning (ICML) , year =","venue":null,"work_id":"a5b750ea-7caa-4782-a75e-f8cb33a2c7e1","year":null},"citing_paper":{"arxiv_id":"2605.05222","last_updated":"2026-04-18T02:04:47Z","snapshot_observed_at":"2026-08-11T12:29:41.016095Z","submitted_at":"2026-04-18T02:04:47Z","title":"Adaptive Computation Depth via Learned Token Routing in Transformers","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-05-10T07:13:17.608238Z"},"links":{"citing_paper":"/paper/2605.05222"},"observation_digest":"sha256:f4789860c1abef8c313f2294c7ca494049753f4e8420b0f74a529013f49c451f","observation_id":"65222807-9855-41b3-8368-135e51b6ba69","resolution":{"observed_at":"2026-05-21T14:15:13.638414Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of the Annual Meeting of the Association for Computational Linguistics (ACL) , year =","venue":null,"work_id":"c7df80fe-3cdc-4c19-81d1-def3cf424db0","year":null},"citing_paper":{"arxiv_id":"2605.05222","last_updated":"2026-04-18T02:04:47Z","snapshot_observed_at":"2026-08-11T12:29:41.016095Z","submitted_at":"2026-04-18T02:04:47Z","title":"Adaptive Computation Depth via Learned Token Routing in Transformers","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-05-10T07:13:17.608238Z"},"links":{"citing_paper":"/paper/2605.05222"},"observation_digest":"sha256:4c20f474fe7d35162a1949b8c64ebaee59e3c1873b38c71118091e7b1e0ac080","observation_id":"55479f7f-358a-4618-9c95-a3136a9fa2ec","resolution":{"observed_at":"2026-05-21T14:15:13.628418Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Advances in Neural Information Processing Systems (NeurIPS) , volume =","venue":null,"work_id":"11e4a766-afb2-4029-95c4-cb208eaa13c3","year":2017},"citing_paper":{"arxiv_id":"2605.05222","last_updated":"2026-04-18T02:04:47Z","snapshot_observed_at":"2026-08-11T12:29:41.016095Z","submitted_at":"2026-04-18T02:04:47Z","title":"Adaptive Computation Depth via Learned Token Routing in Transformers","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-05-10T07:13:17.608238Z"},"links":{"citing_paper":"/paper/2605.05222"},"observation_digest":"sha256:2dcc87964e95b52f6f3c0839edba4106a6471d184afd730a98203480f5bf4435","observation_id":"a536ac75-0ed5-4103-bb4b-d42b0c34d4ca","resolution":{"observed_at":"2026-05-21T14:15:13.633072Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Journal of Machine Learning Research , volume =","venue":null,"work_id":"2d778ac6-430c-446a-956f-3a5567f0c3f6","year":2022},"citing_paper":{"arxiv_id":"2605.05222","last_updated":"2026-04-18T02:04:47Z","snapshot_observed_at":"2026-08-11T12:29:41.016095Z","submitted_at":"2026-04-18T02:04:47Z","title":"Adaptive Computation Depth via Learned Token Routing in Transformers","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-05-10T07:13:17.608238Z"},"links":{"citing_paper":"/paper/2605.05222"},"observation_digest":"sha256:667ccb656333aad0bbeb1ba3ca6d7a6caababd79606a40897a366c51d8901e3b","observation_id":"e2bce2e3-4692-4cf0-bbe3-4534d2b793f8","resolution":{"observed_at":"2026-05-21T14:15:13.635411Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of the Conference of the European Chapter of the Association for Computational Linguistics (EACL) , year =","venue":null,"work_id":"34fb8c94-64ad-4db9-aeff-6f98745302cf","year":null},"citing_paper":{"arxiv_id":"2605.05222","last_updated":"2026-04-18T02:04:47Z","snapshot_observed_at":"2026-08-11T12:29:41.016095Z","submitted_at":"2026-04-18T02:04:47Z","title":"Adaptive Computation Depth via Learned Token Routing in Transformers","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-05-10T07:13:17.608238Z"},"links":{"citing_paper":"/paper/2605.05222"},"observation_digest":"sha256:8292ce82cf29672024b530182c97f04f653fa3bf01c59effcadd56b4421f63f8","observation_id":"8fc77d1b-a110-46ce-b845-46caf3c3562f","resolution":{"observed_at":"2026-05-21T14:15:13.640807Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Advances in Neural Information Processing Systems (NeurIPS) , volume =","venue":null,"work_id":"d85082c3-55d7-4355-8194-0b2826efaec3","year":2020},"citing_paper":{"arxiv_id":"2605.05222","last_updated":"2026-04-18T02:04:47Z","snapshot_observed_at":"2026-08-11T12:29:41.016095Z","submitted_at":"2026-04-18T02:04:47Z","title":"Adaptive Computation Depth via Learned Token Routing in Transformers","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-05-10T07:13:17.608238Z"},"links":{"citing_paper":"/paper/2605.05222"},"observation_digest":"sha256:540fca2a662309b793bc949fa63b160831099013d45bcaf34c86078193db342c","observation_id":"dcbfad5e-8736-46db-ac98-275e79686ede","resolution":{"observed_at":"2026-05-21T14:15:13.645899Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2015 , howpublished =","venue":null,"work_id":"1f935946-16bf-4e33-ad3b-fffaada3334e","year":2015},"citing_paper":{"arxiv_id":"2605.05222","last_updated":"2026-04-18T02:04:47Z","snapshot_observed_at":"2026-08-11T12:29:41.016095Z","submitted_at":"2026-04-18T02:04:47Z","title":"Adaptive Computation Depth via Learned Token Routing in Transformers","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-05-10T07:13:17.608238Z"},"links":{"citing_paper":"/paper/2605.05222"},"observation_digest":"sha256:bceb43570b675b18d84097c47645ab597608f242fd11755fc4f35e237917cd67","observation_id":"70e0b303-6c46-4031-8f47-487c2c01dcf2","resolution":{"observed_at":"2026-05-21T14:15:13.630769Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T20:42:54.098602Z","title":"International Conference on Learning Representations (ICLR) , year =","venue":null,"work_id":"cd40f426-1d8a-4526-ab54-a82a9272389e","year":null},"citing_paper":{"arxiv_id":"2605.05222","last_updated":"2026-04-18T02:04:47Z","snapshot_observed_at":"2026-08-11T12:29:41.016095Z","submitted_at":"2026-04-18T02:04:47Z","title":"Adaptive Computation Depth via Learned Token Routing in Transformers","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-05-10T07:13:17.608238Z"},"links":{"citing_paper":"/paper/2605.05222"},"observation_digest":"sha256:856d05fab952aee669e640c84d7adfac196d64ce44a5fe370bccd50ad018951b","observation_id":"8fb6b361-9e1c-4c5b-9025-bc91dd414363","resolution":{"observed_at":"2026-05-21T14:15:13.643407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1607.06450","last_updated":"2016-07-21T19:57:52Z","snapshot_observed_at":"2026-08-14T05:15:12.190552Z","submitted_at":"2016-07-21T19:57:52Z","title":"Layer Normalization","version":1},"cited_work":{"arxiv_id":"1607.06450","doi":"10.1007/978-3-319-32025-0","metadata_source":"pith","pith_arxiv_id":"1607.06450","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Layer Normalization","venue":"stat.ML","work_id":"20a2d720-0046-4c7c-bcd6-327ec8143f69","year":2016},"citing_paper":{"arxiv_id":"2605.05222","last_updated":"2026-04-18T02:04:47Z","snapshot_observed_at":"2026-08-11T12:29:41.016095Z","submitted_at":"2026-04-18T02:04:47Z","title":"Adaptive Computation Depth via Learned Token Routing in Transformers","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-05-10T07:13:17.608238Z"},"links":{"cited_paper":"/paper/1607.06450","citing_paper":"/paper/2605.05222"},"observation_digest":"sha256:7b36a29ecfd36be39fbb95c18e3b38118dd852d08f333fae63a1e382d4ee8901","observation_id":"b74860e7-044a-4308-9f19-afd9b29687ef","resolution":{"observed_at":"2026-05-10T07:16:55.084213Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Neurocomputing , volume =","venue":null,"work_id":"f1e3efe4-88ec-4fbe-a2d7-946d478fda19","year":2024},"citing_paper":{"arxiv_id":"2605.05222","last_updated":"2026-04-18T02:04:47Z","snapshot_observed_at":"2026-08-11T12:29:41.016095Z","submitted_at":"2026-04-18T02:04:47Z","title":"Adaptive Computation Depth via Learned Token Routing in Transformers","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-05-10T07:13:17.608238Z"},"links":{"citing_paper":"/paper/2605.05222"},"observation_digest":"sha256:f2a80c8ae329152458eb90d6397a63eaa38eac1c64d7d6fc10990e089dc9b3a2","observation_id":"66794ab9-de72-442c-9610-2375d9b18379","resolution":{"observed_at":"2026-05-21T14:15:13.648188Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2006 , howpublished =","venue":null,"work_id":"f85b6b77-4ead-413f-98d1-4c357d8d3dc0","year":2006},"citing_paper":{"arxiv_id":"2605.05222","last_updated":"2026-04-18T02:04:47Z","snapshot_observed_at":"2026-08-11T12:29:41.016095Z","submitted_at":"2026-04-18T02:04:47Z","title":"Adaptive Computation Depth via Learned Token Routing in Transformers","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-05-10T07:13:17.608238Z"},"links":{"citing_paper":"/paper/2605.05222"},"observation_digest":"sha256:601bf814b25c7e0d0fcc0cdc1e080d90dcf7ea79a8825d99aa255a0f5d768e05","observation_id":"80492faa-76fa-41a2-9971-9784d2acf07c","resolution":{"observed_at":"2026-05-21T14:15:13.650477Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"International Conference on Learning Representations (ICLR) , year =","venue":null,"work_id":"28292548-2222-408a-a5ab-4b93d7442a0c","year":null},"citing_paper":{"arxiv_id":"2605.05222","last_updated":"2026-04-18T02:04:47Z","snapshot_observed_at":"2026-08-11T12:29:41.016095Z","submitted_at":"2026-04-18T02:04:47Z","title":"Adaptive Computation Depth via Learned Token Routing in Transformers","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-05-10T07:13:17.608238Z"},"links":{"citing_paper":"/paper/2605.05222"},"observation_digest":"sha256:aec23ba0c22a69a04a525790a9ec71e775de36cdf5d67231185d8823745aa34e","observation_id":"f236b0d4-4acb-4996-9ea3-b706bc9b75f3","resolution":{"observed_at":"2026-05-21T14:15:13.652942Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T06:04:35.484539Z","title":null,"venue":null,"work_id":"73bdb944-b346-4552-9179-c38e485650f8","year":2023},"citing_paper":{"arxiv_id":"2605.05222","last_updated":"2026-04-18T02:04:47Z","snapshot_observed_at":"2026-08-11T12:29:41.016095Z","submitted_at":"2026-04-18T02:04:47Z","title":"Adaptive Computation Depth via Learned Token Routing in Transformers","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-05-10T07:13:17.608238Z"},"links":{"citing_paper":"/paper/2605.05222"},"observation_digest":"sha256:4c84e3eebad4b27faf71ba937107ea6c0041a3743c3cb90e84349f7609e70b04","observation_id":"511575a2-7a17-4d7c-a1c1-fc80a6c29902","resolution":{"observed_at":"2026-05-21T14:15:13.655247Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.05222","last_updated":"2026-04-18T02:04:47Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-11T12:29:41.016095Z","submitted_at":"2026-04-18T02:04:47Z","title":"Adaptive Computation Depth via Learned Token Routing in Transformers"},"reference_resolution":{"displayed":16,"state_counts":{"malformed_identifier":0,"metadata_mismatch":3,"parse_uncertain":1,"unresolved":0,"verified_exact":0,"verified_fuzzy":12},"total_outbound_references":16},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 16 of 16 outbound references and 1 inbound Pith citation observation for arXiv:2605.05222."}