{"as_of":"2026-08-17T03:29:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1101c28930f6e02158db82a0b39d306ca037dfaee665cbfed436084561be134f","coverage":[{"denominator":67,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":67,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T10:51:51.687705Z","state":"measured"},{"denominator":74,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":74,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":7,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":7,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T04:30:14.506806Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-16T09:58:54.154341Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"cited_work":{"arxiv_id":"2506.04179","doi":"10.48550/arxiv.2506.04179","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.04179","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Skipgpt: Dynamic layer pruning reinvented with token awareness and module decou- pling.CoRR, abs/2506.04179","venue":"ArXiv.org","work_id":"975baf9c-51a0-4c98-93d2-40245457951e","year":2025},"citing_paper":{"arxiv_id":"2602.01167","last_updated":"2026-02-01T11:37:05Z","snapshot_observed_at":"2026-08-13T08:03:59.018663Z","submitted_at":"2026-02-01T11:37:05Z","title":"Do All Individual Layers Help? An Empirical Study of Task-Interfering Layers in Vision-Language Models","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-21T14:48:21.212088Z"},"links":{"cited_paper":"/paper/2506.04179","citing_paper":"/paper/2602.01167"},"observation_digest":"sha256:05ad1c4a260cde5d147c6d1bf22377386e648a5ac268540632479260fbc31cb6","observation_id":"385cbaf2-4b61-46d3-baba-663a457b67f8","resolution":{"observed_at":"2026-05-21T14:50:15.327483Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-16T09:58:54.154341Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.04179","snapshot_observed_at":"2026-08-03T03:36:43.880446Z","title":"Cross-modal information flow in multimodal large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.07574","last_updated":"2026-05-27T10:39:17Z","snapshot_observed_at":"2026-08-15T04:58:54.978240Z","submitted_at":"2026-02-07T14:46:05Z","title":"ViCA: Efficient Multimodal LLMs with Vision-Only Cross-Attention","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-03T03:36:43.880446Z"},"links":{"cited_paper":"/paper/2506.04179","citing_paper":"/paper/2602.07574"},"observation_digest":"sha256:dd55030e6d0afecbade78f405483170f6d2e67460ae1c808d2a175ddad2497e3","observation_id":"9f8eb748-1179-4bab-a8f9-329a9567700c","resolution":{"observed_at":"2026-08-03T03:36:43.880446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-16T09:58:54.154341Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.04179","snapshot_observed_at":"2026-08-02T18:16:48.745554Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.14785","last_updated":"2026-07-26T17:22:03Z","snapshot_observed_at":"2026-08-13T03:00:52.374247Z","submitted_at":"2026-03-16T03:35:04Z","title":"SkipOPU: An FPGA-based Overlay Processor for Large Language Models with Dynamically Allocated Computation","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-02T18:16:48.745554Z"},"links":{"cited_paper":"/paper/2506.04179","citing_paper":"/paper/2603.14785"},"observation_digest":"sha256:42506b795361c101653eca47582ab7a5d8bccc1398f6b80b87b35b476fc97636","observation_id":"0b638f52-bda5-4990-90fc-d9e0c9e851c7","resolution":{"observed_at":"2026-08-02T18:16:48.745554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-16T09:58:54.154341Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"cited_work":{"arxiv_id":"2506.04179","doi":"10.48550/arxiv.2506.04179","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.04179","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Skipgpt: Dynamic layer pruning reinvented with token awareness and module decou- pling.CoRR, abs/2506.04179","venue":"ArXiv.org","work_id":"975baf9c-51a0-4c98-93d2-40245457951e","year":2025},"citing_paper":{"arxiv_id":"2606.00523","last_updated":"2026-05-30T04:31:29Z","snapshot_observed_at":"2026-08-15T04:06:40.971012Z","submitted_at":"2026-05-30T04:31:29Z","title":"ProactiveLLM: Learning Active Interaction for Streaming Large Language Models","version":1},"reference_index":115,"source":"arxiv_source","source_observed_at":"2026-06-28T19:07:48.425181Z"},"links":{"cited_paper":"/paper/2506.04179","citing_paper":"/paper/2606.00523"},"observation_digest":"sha256:a481b3c6fb52c1c01cd51fc8dae37dd2c763688c277c12234f9e2d2c61f4342d","observation_id":"8c46fa90-6f3a-4f91-9a0f-55d937d31d15","resolution":{"observed_at":"2026-06-28T19:12:34.801340Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-16T09:58:54.154341Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"cited_work":{"arxiv_id":"2506.04179","doi":"10.48550/arxiv.2506.04179","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.04179","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Skipgpt: Dynamic layer pruning reinvented with token awareness and module decou- pling.CoRR, abs/2506.04179","venue":"ArXiv.org","work_id":"975baf9c-51a0-4c98-93d2-40245457951e","year":2025},"citing_paper":{"arxiv_id":"2606.26538","last_updated":"2026-06-25T02:25:00Z","snapshot_observed_at":"2026-08-14T12:59:05.572947Z","submitted_at":"2026-06-25T02:25:00Z","title":"CascadeFormer: Depth-Tapered Transformers Motivated by Gradient Fan-in Asymmetry","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-06-26T05:22:26.818078Z"},"links":{"cited_paper":"/paper/2506.04179","citing_paper":"/paper/2606.26538"},"observation_digest":"sha256:85bee4b08bf21a35890da445447da1f743c8a06a54521f7ae4986a077036edcd","observation_id":"df16597e-72c9-4aaf-9dd3-92d8d01c3822","resolution":{"observed_at":"2026-06-26T05:29:00.096032Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-16T09:58:54.154341Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"cited_work":{"arxiv_id":"2506.04179","doi":"10.48550/arxiv.2506.04179","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.04179","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Skipgpt: Dynamic layer pruning reinvented with token awareness and module decou- pling.CoRR, abs/2506.04179","venue":"ArXiv.org","work_id":"975baf9c-51a0-4c98-93d2-40245457951e","year":2025},"citing_paper":{"arxiv_id":"2606.27743","last_updated":"2026-06-26T05:48:21Z","snapshot_observed_at":"2026-08-05T16:07:01.090621Z","submitted_at":"2026-06-26T05:48:21Z","title":"End-to-End Dynamic Sparsity for Resource-Adaptive LLM Inference","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-29T03:27:08.181406Z"},"links":{"cited_paper":"/paper/2506.04179","citing_paper":"/paper/2606.27743"},"observation_digest":"sha256:29944e22056dfc6f9f2b38eb8b1a3519ad12490a079194d6b6f7188bd85e6019","observation_id":"58de471e-c8c0-4003-841f-75c0c4d1bee2","resolution":{"observed_at":"2026-07-01T17:35:52.025582Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-16T09:58:54.154341Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.04179","snapshot_observed_at":"2026-08-10T04:30:14.506806Z","title":"arXiv preprint arXiv:2506.04179 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-17T01:20:08.163345Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.506806Z"},"links":{"cited_paper":"/paper/2506.04179","citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:ab6609fdf6eb79403de1b04d66aff029a01bace790ed7c8cc535cd7627483af5","observation_id":"8ec82576-f1d4-4563-a1ce-99ee577f7eab","resolution":{"observed_at":"2026-08-10T04:30:14.506806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.04179/citation-record","integrity":"/paper/2506.04179/integrity","json":"/paper/2506.04179/citation-record.json","paper":"/paper/2506.04179"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:51:51.383918Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-16T09:58:54.154341Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T10:51:51.383918Z"},"links":{"citing_paper":"/paper/2506.04179"},"observation_digest":"sha256:4898f6364b56edb0877f6749eaf1d41d34e1013e82cecd5a3173af942f77805a","observation_id":"b9a91ac5-7b24-4128-b4a9-98d78d859e90","resolution":{"observed_at":"2026-08-07T10:51:51.383918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:51:51.390078Z","title":"Fluctuation-based adaptive structured pruning for large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-16T09:58:54.154341Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T10:51:51.390078Z"},"links":{"citing_paper":"/paper/2506.04179"},"observation_digest":"sha256:258fe22fd42cfef856d9793c2e5da712952c94377a762858123b9ad68ed312f4","observation_id":"85c7b218-6568-4272-a198-914902691727","resolution":{"observed_at":"2026-08-07T10:51:51.390078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.15024","last_updated":"2024-02-09T17:59:40Z","snapshot_observed_at":"2026-08-16T14:24:10.346445Z","submitted_at":"2024-01-26T17:35:45Z","title":"SliceGPT: Compress Large Language Models by Deleting Rows and Columns","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.15024","snapshot_observed_at":"2026-08-07T10:51:51.394725Z","title":"L., Nascimento, M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-16T09:58:54.154341Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T10:51:51.394725Z"},"links":{"cited_paper":"/paper/2401.15024","citing_paper":"/paper/2506.04179"},"observation_digest":"sha256:05e2e9d4f4f9906493027cd552f51d5901761d2f551f781c89c565a46dceb637","observation_id":"1c87c87a-4c8f-4d5a-b0f4-610e08c82850","resolution":{"observed_at":"2026-08-07T10:51:51.394725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:51:51.399546Z","title":"A., Bourne, J","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-16T09:58:54.154341Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T10:51:51.399546Z"},"links":{"citing_paper":"/paper/2506.04179"},"observation_digest":"sha256:fc2e71b77dab94364673ed5712e1e2014c08565ba4708593ef2f0dff9d37f43b","observation_id":"67f46d71-d247-4032-9029-1972de44a27a","resolution":{"observed_at":"2026-08-07T10:51:51.399546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1308.3432","last_updated":"2013-08-15T15:19:34Z","snapshot_observed_at":"2026-08-14T04:51:04.817737Z","submitted_at":"2013-08-15T15:19:34Z","title":"Estimating or Propagating Gradients Through Stochastic Neurons for Conditional Computation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1308.3432","snapshot_observed_at":"2026-08-07T10:51:51.403709Z","title":"Estimating or propagating gradients through stochastic neurons for conditional computation","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-16T09:58:54.154341Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T10:51:51.403709Z"},"links":{"cited_paper":"/paper/1308.3432","citing_paper":"/paper/2506.04179"},"observation_digest":"sha256:2e21112dc0f616fc47d3cce3436e3a83fa51b9bd84e2973e9cef328ba9b52014","observation_id":"1a3c16d1-8058-447a-affa-bbab4f6ab1f2","resolution":{"observed_at":"2026-08-07T10:51:51.403709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:51:51.408641Z","title":"Piqa: Reasoning about physical commonsense in natural language","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-16T09:58:54.154341Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T10:51:51.408641Z"},"links":{"citing_paper":"/paper/2506.04179"},"observation_digest":"sha256:ec5ba825450353ee4828455cf23f2856d166c5a8e7ab322b68ec25858da56375","observation_id":"3c8cbd3c-6ae2-4191-8156-ef6656c93417","resolution":{"observed_at":"2026-08-07T10:51:51.408641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07258","last_updated":"2022-07-12T23:45:14Z","snapshot_observed_at":"2026-08-02T09:20:40.804790Z","submitted_at":"2021-08-16T17:50:08Z","title":"On the Opportunities and Risks of Foundation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07258","snapshot_observed_at":"2026-08-07T10:51:51.414182Z","title":"A., Adeli, E., Altman, R., Arora, S., von Arx, S., Bernstein, M","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-16T09:58:54.154341Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T10:51:51.414182Z"},"links":{"cited_paper":"/paper/2108.07258","citing_paper":"/paper/2506.04179"},"observation_digest":"sha256:5c1db496a1c3aae4d136a2bd41ce571c7c9003d38931a9b11a07a4c9c6275a47","observation_id":"65c68948-ae3f-4416-98e0-6a28d3eeb0bb","resolution":{"observed_at":"2026-08-07T10:51:51.414182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-07T10:51:51.419334Z","title":null,"venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-16T09:58:54.154341Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T10:51:51.419334Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2506.04179"},"observation_digest":"sha256:f054eea9139a52e44450c8abe7eab7d07fbfff8c7caa8ba466bb03ceb81ff649","observation_id":"3e4ff121-ee0c-41e2-ab1d-93250b6dc3f8","resolution":{"observed_at":"2026-08-07T10:51:51.419334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06204","last_updated":"2025-04-09T13:54:59Z","snapshot_observed_at":"2026-08-16T13:39:21.916392Z","submitted_at":"2024-06-26T16:34:33Z","title":"A Survey on Mixture of Experts in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.06204","snapshot_observed_at":"2026-08-07T10:51:51.424020Z","title":"A survey on mixture of experts, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-16T09:58:54.154341Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T10:51:51.424020Z"},"links":{"cited_paper":"/paper/2407.06204","citing_paper":"/paper/2506.04179"},"observation_digest":"sha256:f6269e11b72c01d283922f41392a5712e11cab09459f744fd12a8ded440afb10","observation_id":"44a512e3-664f-47e8-b6c4-1e23a1b71017","resolution":{"observed_at":"2026-08-07T10:51:51.424020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.19135","last_updated":"2025-01-25T00:11:26Z","snapshot_observed_at":"2026-08-16T14:05:40.419398Z","submitted_at":"2024-03-28T04:12:13Z","title":"Streamlining Redundant Layers to Compress Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.19135","snapshot_observed_at":"2026-08-07T10:51:51.433698Z","title":"Compressing large language models by streamlining the unimportant layer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-16T09:58:54.154341Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T10:51:51.433698Z"},"links":{"cited_paper":"/paper/2403.19135","citing_paper":"/paper/2506.04179"},"observation_digest":"sha256:8bb880ed759344ee79e512e1703bf536c524db1d302fc3e83f11e8bbb8733ec5","observation_id":"567103ee-da14-48b1-994e-2e33bbada56b","resolution":{"observed_at":"2026-08-07T10:51:51.433698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18001","last_updated":"2025-05-27T02:59:22Z","snapshot_observed_at":"2026-08-16T12:55:26.536512Z","submitted_at":"2025-02-25T09:08:45Z","title":"Unveiling the Key Factors for Distilling Chain-of-Thought Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.18001","snapshot_observed_at":"2026-08-07T10:51:51.438165Z","title":"Unveiling the key factors for distilling chain-of-thought reasoning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-16T09:58:54.154341Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T10:51:51.438165Z"},"links":{"cited_paper":"/paper/2502.18001","citing_paper":"/paper/2506.04179"},"observation_digest":"sha256:fa36a11e0dd8b90a5d352ec7da8fc418c3d789197772659c3f92f4db491dcd38","observation_id":"86b98c04-287d-430e-810a-5d9c39a29eba","resolution":{"observed_at":"2026-08-07T10:51:51.438165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.04916","last_updated":"2024-06-16T08:37:25Z","snapshot_observed_at":"2026-08-16T14:36:35.064004Z","submitted_at":"2023-12-08T09:31:50Z","title":"EE-LLM: Large-Scale Training and Inference of Early-Exit Large Language Models with 3D Parallelism","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.04916","snapshot_observed_at":"2026-08-07T10:51:51.442664Z","title":"Ee-llm: Large-scale training and inference of early-exit large language models with 3d parallelism, 2024 c","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-16T09:58:54.154341Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T10:51:51.442664Z"},"links":{"cited_paper":"/paper/2312.04916","citing_paper":"/paper/2506.04179"},"observation_digest":"sha256:b7a10995063df0ea36b78357d344564987d1767e7a5bd356dac80b0a330134b1","observation_id":"59cd8c77-c4e2-48e5-9edf-3f6eddce050b","resolution":{"observed_at":"2026-08-07T10:51:51.442664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.02311","last_updated":"2022-10-05T06:02:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-05T16:11:45Z","title":"PaLM: Scaling Language Modeling with Pathways","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.02311","snapshot_observed_at":"2026-08-07T10:51:51.447085Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-16T09:58:54.154341Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T10:51:51.447085Z"},"links":{"cited_paper":"/paper/2204.02311","citing_paper":"/paper/2506.04179"},"observation_digest":"sha256:9ac13c69bdbc9a4afede4ceb336b99a558948f9b2dd85721ebc364cf0e0a62d2","observation_id":"71cf1183-3754-46b1-9227-b71397be3bfe","resolution":{"observed_at":"2026-08-07T10:51:51.447085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.10044","last_updated":"2019-05-24T05:48:49Z","snapshot_observed_at":"2026-08-14T15:52:43.138964Z","submitted_at":"2019-05-24T05:48:49Z","title":"BoolQ: Exploring the Surprising Difficulty of Natural Yes/No Questions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.10044","snapshot_observed_at":"2026-08-07T10:51:51.451645Z","title":"Boolq: Exploring the surprising difficulty of natural yes/no questions","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-16T09:58:54.154341Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T10:51:51.451645Z"},"links":{"cited_paper":"/paper/1905.10044","citing_paper":"/paper/2506.04179"},"observation_digest":"sha256:3053b98e6bbaaad957bf0a5754290f51a5c30c12d4c250b4a69618cbf7a683ea","observation_id":"a1a3d765-047d-485a-bb8d-0ac14c4a1096","resolution":{"observed_at":"2026-08-07T10:51:51.451645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-08-14T19:36:07.505691Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-07T10:51:51.456217Z","title":"Think you have solved question answering? try arc, the ai2 reasoning challenge","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-16T09:58:54.154341Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T10:51:51.456217Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2506.04179"},"observation_digest":"sha256:b3725c5904f0ba33f5172a4af20c36225aeb8bfadd00d3d7845583ea6570ad00","observation_id":"ad860cb4-2897-4d47-93bc-454d33095eb6","resolution":{"observed_at":"2026-08-07T10:51:51.456217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:51:52.690263Z","title":"Redpajama: an open dataset for training large language models","venue":null,"work_id":"4dd58b9b-332f-4870-91f7-3f3a7151e7bd","year":2023},"citing_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-16T09:58:54.154341Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T10:51:51.460884Z"},"links":{"citing_paper":"/paper/2506.04179"},"observation_digest":"sha256:b765ad713c845692ef53e88a1b9c5bcc27aac362c5d5e133d20e06cb8eaeeed6","observation_id":"e1a419c3-1e09-48a1-9735-38f8230e1542","resolution":{"observed_at":"2026-08-07T10:51:52.695418Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02628","last_updated":"2023-07-05T19:59:09Z","snapshot_observed_at":"2026-08-16T15:18:25.260810Z","submitted_at":"2023-07-05T19:59:09Z","title":"SkipDecode: Autoregressive Skip Decoding with Batching and Caching for Efficient LLM Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.02628","snapshot_observed_at":"2026-08-07T10:51:51.465417Z","title":"Skipdecode: Autoregressive skip decoding with batching and caching for efficient llm inference","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-16T09:58:54.154341Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T10:51:51.465417Z"},"links":{"cited_paper":"/paper/2307.02628","citing_paper":"/paper/2506.04179"},"observation_digest":"sha256:91a91b9f0ac8922d0bb458cd20f853034f5d2a96834f817876e7f06355debf14","observation_id":"1e81d5a2-1bf9-4671-b9ad-37fb719fdde5","resolution":{"observed_at":"2026-08-07T10:51:51.465417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T10:51:51.469908Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-16T09:58:54.154341Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T10:51:51.469908Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.04179"},"observation_digest":"sha256:0d17e2b4e58bd0990299a6bbbc25801fb4d047f8246259151aa250c3b1953152","observation_id":"27c2cd37-b471-4ef8-a939-742ea0980d9b","resolution":{"observed_at":"2026-08-07T10:51:51.469908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.02181","last_updated":"2024-07-09T11:59:01Z","snapshot_observed_at":"2026-08-16T14:13:00.495018Z","submitted_at":"2024-03-04T16:23:58Z","title":"Not All Layers of LLMs Are Necessary During Inference","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.02181","snapshot_observed_at":"2026-08-07T10:51:51.474200Z","title":"Not all layers of llms are necessary during inference, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-16T09:58:54.154341Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T10:51:51.474200Z"},"links":{"cited_paper":"/paper/2403.02181","citing_paper":"/paper/2506.04179"},"observation_digest":"sha256:e06ff6782169e28802ea46b859ec1a4e377796c669c07f7965d7f25a87bb361a","observation_id":"758b547f-5e71-42ed-8775-8fc551ed1a5e","resolution":{"observed_at":"2026-08-07T10:51:51.474200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:51:51.478452Z","title":"and Alistarh, D","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-16T09:58:54.154341Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T10:51:51.478452Z"},"links":{"citing_paper":"/paper/2506.04179"},"observation_digest":"sha256:382798a890c2d79435f6a217a5111394e4b51fa77022f42a7c911eaf33e7ca16","observation_id":"7bd51590-187b-4617-8788-ee3bce1ab7d4","resolution":{"observed_at":"2026-08-07T10:51:51.478452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:51:51.482651Z","title":"A framework for few-shot language model evaluation, 07 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-16T09:58:54.154341Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T10:51:51.482651Z"},"links":{"citing_paper":"/paper/2506.04179"},"observation_digest":"sha256:731213cae22ca222404e8995fc08d31c2d8297b96f313c2cacaaf31c10b1d7c9","observation_id":"364f6f5f-86e6-498c-b655-e739447052b5","resolution":{"observed_at":"2026-08-07T10:51:51.482651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2012.14913","last_updated":"2021-09-05T17:32:27Z","snapshot_observed_at":"2026-08-13T01:11:33.500647Z","submitted_at":"2020-12-29T19:12:05Z","title":"Transformer Feed-Forward Layers Are Key-Value Memories","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.14913","snapshot_observed_at":"2026-08-07T10:51:51.486953Z","title":"Transformer feed-forward layers are key-value memories, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-16T09:58:54.154341Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T10:51:51.486953Z"},"links":{"cited_paper":"/paper/2012.14913","citing_paper":"/paper/2506.04179"},"observation_digest":"sha256:28e0b2568c694006042c57e313dd901d97edb0f74096d195cead5047115f4867","observation_id":"1ccf489c-0e36-49ee-835d-589bae8a606b","resolution":{"observed_at":"2026-08-07T10:51:51.486953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17887","last_updated":"2025-03-03T17:02:05Z","snapshot_observed_at":"2026-08-16T14:06:10.494270Z","submitted_at":"2024-03-26T17:20:04Z","title":"The Unreasonable Ineffectiveness of the Deeper Layers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17887","snapshot_observed_at":"2026-08-07T10:51:51.491364Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-16T09:58:54.154341Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T10:51:51.491364Z"},"links":{"cited_paper":"/paper/2403.17887","citing_paper":"/paper/2506.04179"},"observation_digest":"sha256:72c46032702b0efc91c31181422d8ee9b8aeb7ae1b9a70fbdfbd93fe9cc26831","observation_id":"c4e4d684-fa8f-416f-b29c-851b1e4d532f","resolution":{"observed_at":"2026-08-07T10:51:51.491364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:51:51.495830Z","title":null,"venue":null,"work_id":null,"year":1954},"citing_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-16T09:58:54.154341Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T10:51:51.495830Z"},"links":{"citing_paper":"/paper/2506.04179"},"observation_digest":"sha256:62ac90814774a7e4c979ae49c6013001046b623c318e3bbac1bbe99cee7ec6df","observation_id":"abfc2050-4a0d-45b0-a51a-9de5804fed69","resolution":{"observed_at":"2026-08-07T10:51:51.495830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15786","last_updated":"2024-10-17T02:43:35Z","snapshot_observed_at":"2026-08-16T13:40:33.037759Z","submitted_at":"2024-06-22T08:41:48Z","title":"What Matters in Transformers? Not All Attention is Needed","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15786","snapshot_observed_at":"2026-08-07T10:51:51.500204Z","title":"What matters in transformers? not all attention is needed, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-16T09:58:54.154341Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T10:51:51.500204Z"},"links":{"cited_paper":"/paper/2406.15786","citing_paper":"/paper/2506.04179"},"observation_digest":"sha256:4079a94187bee7d902e7f8832e45fa0e4a25ea986990ac1271e4ca73efbf755e","observation_id":"57458ad2-8bdf-4ae1-ab0c-0abbfd4fa9e6","resolution":{"observed_at":"2026-08-07T10:51:51.500204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.02336","last_updated":"2025-01-04T17:01:30Z","snapshot_observed_at":"2026-08-14T12:52:08.037319Z","submitted_at":"2025-01-04T17:01:30Z","title":"AdaSkip: Adaptive Sublayer Skipping for Accelerating Long-Context LLM Inference","version":1},"cited_work":{"arxiv_id":"2501.02336","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.02336","snapshot_observed_at":"2026-08-07T10:51:52.148427Z","title":"AdaSkip: Adaptive Sublayer Skipping for Accelerating Long-Context LLM Inference","venue":"cs.CL","work_id":"31f033ac-2877-47b4-a5ae-0120e51a0e81","year":2025},"citing_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-16T09:58:54.154341Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T10:51:51.504854Z"},"links":{"cited_paper":"/paper/2501.02336","citing_paper":"/paper/2506.04179"},"observation_digest":"sha256:bceb8c7c21df2baeb08acecffcb3a5f3c50726043ea34fe9385e83d7d0d3eb0c","observation_id":"5d9032ef-73f0-4afd-9cf3-2e37da695058","resolution":{"observed_at":"2026-08-07T10:51:52.153846Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-11T08:20:29.798517Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-07T10:51:51.509419Z","title":"J., Shen, Y., Wallis, P., Allen-Zhu, Z., Li, Y., Wang, S., Wang, L., and Chen, W","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-16T09:58:54.154341Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T10:51:51.509419Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2506.04179"},"observation_digest":"sha256:a2f8c805bd4f3aca91aa787379c4d925800b3978abb5cca67d2017400d078808","observation_id":"d8479f21-51b8-4af9-953f-660eb6f9da2c","resolution":{"observed_at":"2026-08-07T10:51:51.509419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:51:52.657152Z","title":"Categorical reparameterization with gumbel-softmax","venue":null,"work_id":"666c9bc9-8072-4c76-8699-29e134e50c4e","year":2022},"citing_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-16T09:58:54.154341Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T10:51:51.514272Z"},"links":{"citing_paper":"/paper/2506.04179"},"observation_digest":"sha256:dc78dba22e6c87b469f051367890a4862c8187681f22a867191ff528e8146d00","observation_id":"6d1caabb-9c82-4424-991a-1e4a52d10dad","resolution":{"observed_at":"2026-08-07T10:51:52.661867Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:51:52.642310Z","title":null,"venue":null,"work_id":"0bc1fbd8-ff1a-4595-b910-359c572e249b","year":2024},"citing_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-16T09:58:54.154341Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T10:51:51.518483Z"},"links":{"citing_paper":"/paper/2506.04179"},"observation_digest":"sha256:61795cbeec5e8577e1759de15b2074f4f522c70caaef4cca1a9865ed31dcb1cd","observation_id":"0649cc5a-80e9-4a84-b612-c8d638cf1667","resolution":{"observed_at":"2026-08-07T10:51:52.647194Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02834","last_updated":"2024-06-23T08:45:33Z","snapshot_observed_at":"2026-08-16T14:21:31.545370Z","submitted_at":"2024-02-05T09:44:49Z","title":"Shortened LLaMA: Depth Pruning for Large Language Models with Comparison of Retraining Methods","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.02834","snapshot_observed_at":"2026-08-07T10:51:51.522792Z","title":"Shortened llama: A simple depth pruning for large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-16T09:58:54.154341Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T10:51:51.522792Z"},"links":{"cited_paper":"/paper/2402.02834","citing_paper":"/paper/2506.04179"},"observation_digest":"sha256:de03e6a38cfe95a6abd42fb5b8197eaba161493f01226435a4e52f40409ad59f","observation_id":"08e55413-5296-4b2e-8ddf-2bbbfb434140","resolution":{"observed_at":"2026-08-07T10:51:51.522792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:51:52.627357Z","title":"Attention is not only a weight: Analyzing transformers with vector norms","venue":null,"work_id":"fcea0d44-7358-4a9e-aac8-f3a656b25ea3","year":2020},"citing_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-16T09:58:54.154341Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T10:51:51.527078Z"},"links":{"citing_paper":"/paper/2506.04179"},"observation_digest":"sha256:4f3eb8c4b835776dc0a82d2d5e00d37bac121bb98d023f438d45bbf87fd5bc5c","observation_id":"5abc13d0-f4da-471c-b819-681ded7b39fb","resolution":{"observed_at":"2026-08-07T10:51:52.632129Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:51:51.531435Z","title":"Crafting papers on machine learning","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-16T09:58:54.154341Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T10:51:51.531435Z"},"links":{"citing_paper":"/paper/2506.04179"},"observation_digest":"sha256:dd2430b9ef1914afe7f64dbbaca8039eda6fccbc5a31014f296dc8ddecfebdb9","observation_id":"54809726-6084-4e2a-af6d-f9ced485ff93","resolution":{"observed_at":"2026-08-07T10:51:51.531435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.16668","last_updated":"2020-06-30T10:42:02Z","snapshot_observed_at":"2026-08-07T09:27:36.420559Z","submitted_at":"2020-06-30T10:42:02Z","title":"GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.16668","snapshot_observed_at":"2026-08-07T10:51:51.535857Z","title":"Gshard: Scaling giant models with conditional computation and automatic sharding, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-16T09:58:54.154341Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T10:51:51.535857Z"},"links":{"cited_paper":"/paper/2006.16668","citing_paper":"/paper/2506.04179"},"observation_digest":"sha256:e82ced9807d80969bba766ef1687b5f08c43f722c991b8cf578b39750d0dc752","observation_id":"79118f7e-cfa5-433e-a06b-f998ef0168b7","resolution":{"observed_at":"2026-08-07T10:51:51.535857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-14T20:13:52.872565Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-07T10:51:51.540562Z","title":"and Hutter, F","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-16T09:58:54.154341Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T10:51:51.540562Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2506.04179"},"observation_digest":"sha256:d7c47a11e7722020322dcfd6b942cb3b43623192bf2c35fb7c4c79dcd17e7c09","observation_id":"9b63162f-4edb-44c7-9cba-bd987b043aaa","resolution":{"observed_at":"2026-08-07T10:51:51.540562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:51:51.545547Z","title":"Llm-pruner: On the structural pruning of large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-16T09:58:54.154341Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T10:51:51.545547Z"},"links":{"citing_paper":"/paper/2506.04179"},"observation_digest":"sha256:bf6945a148a0ba588885ca592c54699e238f0b6df34b8c6da45f279905f2242e","observation_id":"4c8584f6-4e45-430f-bd07-74eacc7830e9","resolution":{"observed_at":"2026-08-07T10:51:51.545547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1411.0030","last_updated":"2015-01-26T13:46:52Z","snapshot_observed_at":"2026-08-14T23:13:23.134250Z","submitted_at":"2014-10-31T21:40:50Z","title":"A* Sampling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1411.0030","snapshot_observed_at":"2026-08-07T10:51:51.550043Z","title":"J., Tarlow, D., and Minka, T","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-16T09:58:54.154341Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T10:51:51.550043Z"},"links":{"cited_paper":"/paper/1411.0030","citing_paper":"/paper/2506.04179"},"observation_digest":"sha256:3b3f672d1e77811eaa52869198207ab051c5bf3cc6a82a2b1ddac2a5cc77128e","observation_id":"9b8412b4-dcb0-4f6a-bb2c-29d23a98e13c","resolution":{"observed_at":"2026-08-07T10:51:51.550043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:51:51.554441Z","title":null,"venue":null,"work_id":null,"year":1993},"citing_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-16T09:58:54.154341Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T10:51:51.554441Z"},"links":{"citing_paper":"/paper/2506.04179"},"observation_digest":"sha256:87ea5128e33fed83a808ccea8296cbeae47b57224871867012a1d933d44b2782","observation_id":"d1254ca6-3c05-41bd-be2e-d6222051a084","resolution":{"observed_at":"2026-08-07T10:51:51.554441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03853","last_updated":"2024-10-11T09:43:32Z","snapshot_observed_at":"2026-08-16T14:12:14.696997Z","submitted_at":"2024-03-06T17:04:18Z","title":"ShortGPT: Layers in Large Language Models are More Redundant Than You Expect","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03853","snapshot_observed_at":"2026-08-07T10:51:51.558594Z","title":"Shortgpt: Layers in large language models are more redundant than you expect","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-16T09:58:54.154341Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T10:51:51.558594Z"},"links":{"cited_paper":"/paper/2403.03853","citing_paper":"/paper/2506.04179"},"observation_digest":"sha256:3338a4505c9d2ddc482a0f146ddc68ed9e8ac958b57d26f94d23c5fdc16efdae","observation_id":"39bd4f1d-4987-43e3-a356-07cd9f7a1921","resolution":{"observed_at":"2026-08-07T10:51:51.558594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.05262","last_updated":"2023-01-13T15:16:16Z","snapshot_observed_at":"2026-08-15T12:28:05.800155Z","submitted_at":"2022-02-10T18:59:54Z","title":"Locating and Editing Factual Associations in GPT","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.05262","snapshot_observed_at":"2026-08-07T10:51:51.563082Z","title":"Locating and editing factual associations in gpt, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-16T09:58:54.154341Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T10:51:51.563082Z"},"links":{"cited_paper":"/paper/2202.05262","citing_paper":"/paper/2506.04179"},"observation_digest":"sha256:9fb8afd9436a38e82c3a3510c0ceed896b991f13ffa66c6f03244b78c6b1001e","observation_id":"a0a6580b-815d-491f-9d5b-e47447f2665e","resolution":{"observed_at":"2026-08-07T10:51:51.563082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.07843","last_updated":"2016-09-26T04:06:13Z","snapshot_observed_at":"2026-08-17T01:46:43.513643Z","submitted_at":"2016-09-26T04:06:13Z","title":"Pointer Sentinel Mixture Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.07843","snapshot_observed_at":"2026-08-07T10:51:51.567460Z","title":"Pointer sentinel mixture models","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-16T09:58:54.154341Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T10:51:51.567460Z"},"links":{"cited_paper":"/paper/1609.07843","citing_paper":"/paper/2506.04179"},"observation_digest":"sha256:f5bd7ba1502f22f991b079eadb58c0dcc231abbc999b1d2ea383360f87a8a08a","observation_id":"eebd4424-dded-424e-9b4e-c9ffc82c33f7","resolution":{"observed_at":"2026-08-07T10:51:51.567460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16130","last_updated":"2024-04-03T16:27:31Z","snapshot_observed_at":"2026-08-16T15:29:40.993745Z","submitted_at":"2023-05-25T15:04:01Z","title":"Language Models Implement Simple Word2Vec-style Vector Arithmetic","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.16130","snapshot_observed_at":"2026-08-07T10:51:51.572272Z","title":"Language models implement simple word2vec-style vector arithmetic, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-16T09:58:54.154341Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T10:51:51.572272Z"},"links":{"cited_paper":"/paper/2305.16130","citing_paper":"/paper/2506.04179"},"observation_digest":"sha256:aca8e3259fbfc02ded0586c7716002caa0c8bac1f016b76a84bb167b0dd021ad","observation_id":"c67925a3-5da0-4d95-8f55-64ccc4570217","resolution":{"observed_at":"2026-08-07T10:51:51.572272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1809.02789","last_updated":"2018-09-08T11:47:16Z","snapshot_observed_at":"2026-08-14T07:00:02.529732Z","submitted_at":"2018-09-08T11:47:16Z","title":"Can a Suit of Armor Conduct Electricity? A New Dataset for Open Book Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1809.02789","snapshot_observed_at":"2026-08-07T10:51:51.576835Z","title":"Can a suit of armor conduct electricity? a new dataset for open book question answering","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-16T09:58:54.154341Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T10:51:51.576835Z"},"links":{"cited_paper":"/paper/1809.02789","citing_paper":"/paper/2506.04179"},"observation_digest":"sha256:ac4b60a6b002ad676b4425054ed2b7c16824b1cabf21f42eb85c5db3361b38d7","observation_id":"4ce2b429-d578-4770-9ce2-6ad2150ebed0","resolution":{"observed_at":"2026-08-07T10:51:51.576835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:51:51.581218Z","title":"In-context learning and induction heads","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-16T09:58:54.154341Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T10:51:51.581218Z"},"links":{"citing_paper":"/paper/2506.04179"},"observation_digest":"sha256:6226929d84d6c73a94798cc921574afa95a9aa53213aa097898b639107ff1477","observation_id":"389ff1c7-a688-42fe-b99c-a2f603a2374f","resolution":{"observed_at":"2026-08-07T10:51:51.581218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-16T19:40:28.523700Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T10:51:51.585303Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-16T09:58:54.154341Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T10:51:51.585303Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.04179"},"observation_digest":"sha256:132659c0247ac6f92e28cc1e77c1320097cbc55c73d95e02d45f8aa83352d7bd","observation_id":"b16e24a0-c1c1-42db-8ee7-a3f9bad809ce","resolution":{"observed_at":"2026-08-07T10:51:51.585303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02258","last_updated":"2024-04-02T19:28:11Z","snapshot_observed_at":"2026-08-13T18:31:52.318837Z","submitted_at":"2024-04-02T19:28:11Z","title":"Mixture-of-Depths: Dynamically allocating compute in transformer-based language models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02258","snapshot_observed_at":"2026-08-07T10:51:51.589682Z","title":"C., and Santoro, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-16T09:58:54.154341Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T10:51:51.589682Z"},"links":{"cited_paper":"/paper/2404.02258","citing_paper":"/paper/2506.04179"},"observation_digest":"sha256:56a5a0da0851a1e66518a5072bf4898cd2112c3c61bb804477c7884daabc843f","observation_id":"0982c9c1-6ca9-4d84-ba1c-c739a1938630","resolution":{"observed_at":"2026-08-07T10:51:51.589682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:51:51.594024Z","title":"L., Bhagavatula, C., and Choi, Y","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-16T09:58:54.154341Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T10:51:51.594024Z"},"links":{"citing_paper":"/paper/2506.04179"},"observation_digest":"sha256:7947f4070bb74163292269ff7b34eac46186179b750e729908cd182253a2240e","observation_id":"25bfb0f7-bcdd-4886-8414-e6d0f5840e55","resolution":{"observed_at":"2026-08-07T10:51:51.594024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03003","last_updated":"2023-10-04T17:41:59Z","snapshot_observed_at":"2026-08-16T20:14:26.704247Z","submitted_at":"2023-10-04T17:41:59Z","title":"From Words to Watts: Benchmarking the Energy Costs of Large Language Model Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03003","snapshot_observed_at":"2026-08-07T10:51:51.598371Z","title":"From words to watts: Benchmarking the energy costs of large language model inference, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-16T09:58:54.154341Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T10:51:51.598371Z"},"links":{"cited_paper":"/paper/2310.03003","citing_paper":"/paper/2506.04179"},"observation_digest":"sha256:64d9ebd955521dc452f10b7d69a34c102dee0be7f7096ecfab0f6f31c1bb603b","observation_id":"ac2d0f5c-1f4b-43ce-b5ec-f955e944b69f","resolution":{"observed_at":"2026-08-07T10:51:51.598371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:51:52.568573Z","title":"Confident adaptive language modeling","venue":null,"work_id":"e4a4b12a-da15-4523-b300-ecf184da0164","year":2022},"citing_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-16T09:58:54.154341Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T10:51:51.602905Z"},"links":{"citing_paper":"/paper/2506.04179"},"observation_digest":"sha256:b57706221f62b715c6a00a93ea687c205f50e7889d0c7154c650d661f00b943c","observation_id":"6465e8e1-1279-4512-9075-4d31891bf671","resolution":{"observed_at":"2026-08-07T10:51:52.573169Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.16286","last_updated":"2024-07-23T08:40:27Z","snapshot_observed_at":"2026-08-16T13:31:51.656534Z","submitted_at":"2024-07-23T08:40:27Z","title":"A deeper look at depth pruning of LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.16286","snapshot_observed_at":"2026-08-07T10:51:51.607178Z","title":"A., Dong, X., Heinrich, G., Breuel, T., Kautz, J., Krueger, D., and Molchanov, P","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-16T09:58:54.154341Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T10:51:51.607178Z"},"links":{"cited_paper":"/paper/2407.16286","citing_paper":"/paper/2506.04179"},"observation_digest":"sha256:ce546c4578aaf76393184c5bb6c9ad23a88bd0a5ce7def56468820f2914045c8","observation_id":"81592bf1-f8b0-46af-b943-035313db2e30","resolution":{"observed_at":"2026-08-07T10:51:51.607178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09025","last_updated":"2024-12-13T02:44:34Z","snapshot_observed_at":"2026-08-16T14:18:43.726149Z","submitted_at":"2024-02-14T09:01:13Z","title":"SLEB: Streamlining LLMs through Redundancy Verification and Elimination of Transformer Blocks","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09025","snapshot_observed_at":"2026-08-07T10:51:51.611505Z","title":"Sleb: Streamlining llms through redundancy verification and elimination of transformer blocks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-16T09:58:54.154341Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T10:51:51.611505Z"},"links":{"cited_paper":"/paper/2402.09025","citing_paper":"/paper/2506.04179"},"observation_digest":"sha256:8f9deece024f99f49d6a3a0b0fc3aec83fec3a760d99f19a32c5cc069ccffbbe","observation_id":"5b973fc4-827a-4292-85b3-0f0987a2249b","resolution":{"observed_at":"2026-08-07T10:51:51.611505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-07T10:51:51.616024Z","title":"Llama: Open and efficient foundation language models, 2023 a","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-16T09:58:54.154341Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T10:51:51.616024Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2506.04179"},"observation_digest":"sha256:5329e729cec64c75d20fa825b864cfa430894cf9021813b74a5825ff3b0be34f","observation_id":"0c71b8e6-4aef-4efa-a5ab-84932d71a32e","resolution":{"observed_at":"2026-08-07T10:51:51.616024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-07T10:51:51.620475Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-16T09:58:54.154341Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T10:51:51.620475Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2506.04179"},"observation_digest":"sha256:ebdd2b4e20ed94feb84dc7c4b3c6da647ea88fb74fe3bd39dd1d562688601df0","observation_id":"6df09788-7a3c-44f3-8680-fe9326680144","resolution":{"observed_at":"2026-08-07T10:51:51.620475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.18581","last_updated":"2023-11-07T05:44:17Z","snapshot_observed_at":"2026-08-16T14:48:05.926458Z","submitted_at":"2023-10-28T04:07:58Z","title":"Accelerating LLaMA Inference by Enabling Intermediate Layer Decoding via Instruction Tuning with LITE","version":2},"cited_work":{"arxiv_id":"2310.18581","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.18581","snapshot_observed_at":"2026-08-07T10:51:51.885648Z","title":"Accelerating LLaMA Inference by Enabling Intermediate Layer Decoding via Instruction Tuning with LITE","venue":"cs.CL","work_id":"12f2f27c-b18f-4947-b8f3-7217ef251e30","year":2023},"citing_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-16T09:58:54.154341Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T10:51:51.624737Z"},"links":{"cited_paper":"/paper/2310.18581","citing_paper":"/paper/2506.04179"},"observation_digest":"sha256:108c2b42136e6560d0259628ca373105351acdf2a30453c0026e9dfe2863b395","observation_id":"9db35863-6b2f-4f01-b7da-f586531836fe","resolution":{"observed_at":"2026-08-07T10:51:51.890716Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:51:51.629304Z","title":"N., Kaiser, L","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-16T09:58:54.154341Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-07T10:51:51.629304Z"},"links":{"citing_paper":"/paper/2506.04179"},"observation_digest":"sha256:90d5e2e50c7505effb6c4b70ec734cf5ffce4d2e9d9bd7dea0e07cb3ac47cc79","observation_id":"1bd9520c-03a4-45dd-ba5f-09427cb3ef43","resolution":{"observed_at":"2026-08-07T10:51:51.629304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.03863","last_updated":"2024-05-23T06:08:37Z","snapshot_observed_at":"2026-08-16T14:37:02.145931Z","submitted_at":"2023-12-06T19:18:42Z","title":"Efficient Large Language Models: A Survey","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.03863","snapshot_observed_at":"2026-08-07T10:51:51.633694Z","title":"Efficient large language models: A survey, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-16T09:58:54.154341Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-07T10:51:51.633694Z"},"links":{"cited_paper":"/paper/2312.03863","citing_paper":"/paper/2506.04179"},"observation_digest":"sha256:28d13a2a6fc6355b8aad890edc3d6b870630c70c5a0e74df0c6e6eb411815932","observation_id":"d6b78270-85ac-48e4-8724-6d02e4619f28","resolution":{"observed_at":"2026-08-07T10:51:51.633694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.09485","last_updated":"2018-07-25T06:13:24Z","snapshot_observed_at":"2026-08-14T20:10:02.805384Z","submitted_at":"2017-11-26T23:03:37Z","title":"SkipNet: Learning Dynamic Routing in Convolutional Networks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.09485","snapshot_observed_at":"2026-08-07T10:51:51.638326Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-16T09:58:54.154341Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-07T10:51:51.638326Z"},"links":{"cited_paper":"/paper/1711.09485","citing_paper":"/paper/2506.04179"},"observation_digest":"sha256:90504ffa24e9c23e6a6cba64fbf3a3e536129246a542b1a399013195dd9de929","observation_id":"3db335a5-80ab-45da-8228-8af86a885a96","resolution":{"observed_at":"2026-08-07T10:51:51.638326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11903","last_updated":"2023-01-10T23:07:57Z","snapshot_observed_at":"2026-08-13T07:04:41.220509Z","submitted_at":"2022-01-28T02:33:07Z","title":"Chain-of-Thought Prompting Elicits Reasoning in Large Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.11903","snapshot_observed_at":"2026-08-07T10:51:51.643273Z","title":"Chain-of-thought prompting elicits reasoning in large language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-16T09:58:54.154341Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-07T10:51:51.643273Z"},"links":{"cited_paper":"/paper/2201.11903","citing_paper":"/paper/2506.04179"},"observation_digest":"sha256:71af22574403e820fae2b787fd62d09d04c11e79f4261b09d071d02d52c097c8","observation_id":"620cf30b-06b6-4e6a-be4d-5ecac84743da","resolution":{"observed_at":"2026-08-07T10:51:51.643273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06694","last_updated":"2024-04-11T01:18:06Z","snapshot_observed_at":"2026-08-16T14:53:24.619970Z","submitted_at":"2023-10-10T15:13:30Z","title":"Sheared LLaMA: Accelerating Language Model Pre-training via Structured Pruning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06694","snapshot_observed_at":"2026-08-07T10:51:51.647844Z","title":"Sheared llama: Accelerating language model pre-training via structured pruning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-16T09:58:54.154341Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-07T10:51:51.647844Z"},"links":{"cited_paper":"/paper/2310.06694","citing_paper":"/paper/2506.04179"},"observation_digest":"sha256:5222e0204abb784aca07d33e11d1afac33ea885035bff7318165593b639a935b","observation_id":"f77f889f-2dd9-45c8-b9f2-72365a5c2adb","resolution":{"observed_at":"2026-08-07T10:51:51.647844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:51:52.545464Z","title":"Llmcdsr: Enhancing cross-domain sequential recommendation with large language models","venue":null,"work_id":"6d1d13e9-0ace-43fb-ab4c-7b0e8f75cab7","year":2025},"citing_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-16T09:58:54.154341Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-07T10:51:51.652195Z"},"links":{"citing_paper":"/paper/2506.04179"},"observation_digest":"sha256:bedb96447f93d0b9046521a7a6d81211b346be7de5996056918081085480e1b1","observation_id":"adb616ff-7897-4ee0-9337-b5581c307a1f","resolution":{"observed_at":"2026-08-07T10:51:52.550467Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11187","last_updated":"2024-10-15T01:58:58Z","snapshot_observed_at":"2026-08-16T14:17:47.965208Z","submitted_at":"2024-02-17T04:16:30Z","title":"LaCo: Large Language Model Pruning via Layer Collapse","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11187","snapshot_observed_at":"2026-08-07T10:51:51.656370Z","title":"Laco: Large language model pruning via layer collapse","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-16T09:58:54.154341Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-07T10:51:51.656370Z"},"links":{"cited_paper":"/paper/2402.11187","citing_paper":"/paper/2506.04179"},"observation_digest":"sha256:cac97597c138c34a40483684f666da726159a484cb068ee5cbfc3584104bd993","observation_id":"cfdedba0-f9df-4cc3-a173-0be35f3f733e","resolution":{"observed_at":"2026-08-07T10:51:51.656370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:51:52.530732Z","title":"Jump to conclusions: Short-cutting transformers with linear transformations","venue":null,"work_id":"f3f15485-09ca-41f1-8f85-edf34240ac29","year":2024},"citing_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-16T09:58:54.154341Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-07T10:51:51.660698Z"},"links":{"citing_paper":"/paper/2506.04179"},"observation_digest":"sha256:176fcfb3cbf30c9af01618b0127a6d23e280cb28aacf0755d0b393410246d819","observation_id":"e874a923-5978-4797-a718-667fd4a9fdce","resolution":{"observed_at":"2026-08-07T10:51:52.535639Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.07830","last_updated":"2019-05-19T23:57:23Z","snapshot_observed_at":"2026-08-15T09:37:44.321271Z","submitted_at":"2019-05-19T23:57:23Z","title":"HellaSwag: Can a Machine Really Finish Your Sentence?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.07830","snapshot_observed_at":"2026-08-07T10:51:51.665131Z","title":"Hellaswag: Can a machine really finish your sentence? arXiv preprint arXiv:1905.07830, 2019","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-16T09:58:54.154341Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-07T10:51:51.665131Z"},"links":{"cited_paper":"/paper/1905.07830","citing_paper":"/paper/2506.04179"},"observation_digest":"sha256:b831bea4d00a4bb14f34b771d4c9cd58782a8ca7c898aa61bc1064178d03b943","observation_id":"c94b92bf-9967-4071-a714-347db78a2237","resolution":{"observed_at":"2026-08-07T10:51:51.665131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15436","last_updated":"2023-11-26T21:45:53Z","snapshot_observed_at":"2026-08-16T14:40:15.590754Z","submitted_at":"2023-11-26T21:45:53Z","title":"Learning to Skip for Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15436","snapshot_observed_at":"2026-08-07T10:51:51.669918Z","title":"Learning to skip for language modeling, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-16T09:58:54.154341Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-07T10:51:51.669918Z"},"links":{"cited_paper":"/paper/2311.15436","citing_paper":"/paper/2506.04179"},"observation_digest":"sha256:8d8eb3fca2c90face8c896a238dda7907ad8c46d0801fd681d11fad0df776aca","observation_id":"75111c31-4174-43dc-b107-f845284d354a","resolution":{"observed_at":"2026-08-07T10:51:51.669918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.18218","last_updated":"2024-10-20T09:10:25Z","snapshot_observed_at":"2026-08-16T13:48:36.238612Z","submitted_at":"2024-05-28T14:21:15Z","title":"FinerCut: Finer-grained Interpretable Layer Pruning for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.18218","snapshot_observed_at":"2026-08-07T10:51:51.674338Z","title":"Finercut: Finer-grained interpretable layer pruning for large language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-16T09:58:54.154341Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-07T10:51:51.674338Z"},"links":{"cited_paper":"/paper/2405.18218","citing_paper":"/paper/2506.04179"},"observation_digest":"sha256:a10b04de1d83e5a809cc9084f546eb30e14faacfd3fff0439e03eea39aa3f447","observation_id":"ed1fbe4e-1023-4944-866e-4d7844fb6999","resolution":{"observed_at":"2026-08-07T10:51:51.674338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17011","last_updated":"2024-10-09T08:58:40Z","snapshot_observed_at":"2026-08-16T13:31:32.802414Z","submitted_at":"2024-07-24T05:26:52Z","title":"Unveiling In-Context Learning: A Coordinate System to Understand Its Working Mechanism","version":2},"cited_work":{"arxiv_id":"2407.17011","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.17011","snapshot_observed_at":"2026-08-07T10:51:51.748054Z","title":"Unveiling In-Context Learning: A Coordinate System to Understand Its Working Mechanism","venue":"cs.CL","work_id":"989d90b9-b679-40da-8f08-826e37f98a6c","year":2024},"citing_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-16T09:58:54.154341Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-07T10:51:51.678910Z"},"links":{"cited_paper":"/paper/2407.17011","citing_paper":"/paper/2506.04179"},"observation_digest":"sha256:0108d2ccd5316ceb8caed4ad520a8323f51e3e0c21aed32a19f1c0abca77884c","observation_id":"7d14d098-babc-451a-b4ff-7eaa3f9312cd","resolution":{"observed_at":"2026-08-07T10:51:51.755863Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16554","last_updated":"2024-06-24T11:43:07Z","snapshot_observed_at":"2026-08-16T13:40:10.664769Z","submitted_at":"2024-06-24T11:43:07Z","title":"LLaMA-MoE: Building Mixture-of-Experts from LLaMA with Continual Pre-training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16554","snapshot_observed_at":"2026-08-07T10:51:51.683200Z","title":"Llama-moe: Building mixture-of-experts from llama with continual pre-training, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-16T09:58:54.154341Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-07T10:51:51.683200Z"},"links":{"cited_paper":"/paper/2406.16554","citing_paper":"/paper/2506.04179"},"observation_digest":"sha256:ee2d5a5f696b88df8003800942c2ab8d241813dee629a7f860611c8ac8bf449f","observation_id":"98eb3340-97d0-4814-a797-4655cb23ce42","resolution":{"observed_at":"2026-08-07T10:51:51.683200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:51:52.514878Z","title":"Aligning books and movies: Towards story-like visual explanations by watching movies and reading books","venue":null,"work_id":"c9e24da4-08b4-4737-ab4b-3533e379f8e1","year":2015},"citing_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-16T09:58:54.154341Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-07T10:51:51.687705Z"},"links":{"citing_paper":"/paper/2506.04179"},"observation_digest":"sha256:f66fb9290430009239e4a2bd4223c78bbb80d9dff4760aa22e55b14b24cd80a8","observation_id":"32cf3760-6124-4f49-b387-c1a692a0a5c2","resolution":{"observed_at":"2026-08-07T10:51:52.521096Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-16T09:58:54.154341Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling"},"reference_resolution":{"displayed":67,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":57,"verified_exact":3,"verified_fuzzy":7},"total_outbound_references":67},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 67 of 67 outbound references and 7 inbound Pith citation observations for arXiv:2506.04179."}