{"as_of":"2026-08-11T08:57:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f816190f414723ec33051dd0d6445279abe956f1600ba2ca912f015ef6c9b438","coverage":[{"denominator":62,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":62,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T22:53:11.677172Z","state":"measured"},{"denominator":63,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":63,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T08:11:52.402271Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.20480","last_updated":"2025-06-25T14:24:59Z","snapshot_observed_at":"2026-08-10T08:29:31.375648Z","submitted_at":"2025-06-25T14:24:59Z","title":"GPTailor: Large Language Model Pruning Through Layer Cutting and Stitching","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.20480","snapshot_observed_at":"2026-08-04T08:11:52.402271Z","title":"Gptailor: Large language model pruning through layer cutting and stitching","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.22228","last_updated":"2026-07-20T17:30:01Z","snapshot_observed_at":"2026-08-04T08:11:48.838546Z","submitted_at":"2025-10-25T09:22:22Z","title":"When Fewer Layers Break More Chains: Layer Pruning Harms Test-Time Scaling in LLMs","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-04T08:11:52.402271Z"},"links":{"cited_paper":"/paper/2506.20480","citing_paper":"/paper/2510.22228"},"observation_digest":"sha256:55d9fd8bcd19bc60da7aac1f81b7c5ef00dad283cd91a0cdbd0265bf0df92f60","observation_id":"47ceea1d-3a54-4204-95d5-71d1de949ea4","resolution":{"observed_at":"2026-08-04T08:11:52.402271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.20480/citation-record","integrity":"/paper/2506.20480/integrity","json":"/paper/2506.20480/citation-record.json","paper":"/paper/2506.20480"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-06T22:53:05.965400Z","title":"Llama: Open and efficient foundation language models.arXiv preprint arXiv:2302.13971, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20480","last_updated":"2025-06-25T14:24:59Z","snapshot_observed_at":"2026-08-10T08:29:31.375648Z","submitted_at":"2025-06-25T14:24:59Z","title":"GPTailor: Large Language Model Pruning Through Layer Cutting and Stitching","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:05.965400Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2506.20480"},"observation_digest":"sha256:1895a71f3dd8c2bc2969e6205ba0f285fe92cb78ce8848fb34f79672387a2189","observation_id":"4279e4b9-21ca-46fa-94f3-cada9e133624","resolution":{"observed_at":"2026-08-06T22:53:05.965400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T22:53:06.019934Z","title":"Gpt-4 technical report.arXiv preprint arXiv:2303.08774, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20480","last_updated":"2025-06-25T14:24:59Z","snapshot_observed_at":"2026-08-10T08:29:31.375648Z","submitted_at":"2025-06-25T14:24:59Z","title":"GPTailor: Large Language Model Pruning Through Layer Cutting and Stitching","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:06.019934Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.20480"},"observation_digest":"sha256:65079c81c981ccff0bb027d2a3d5762100bd6911fd8147a8d5c248640286d417","observation_id":"f7f13a99-1c85-4bdd-b689-b62e5ec583bc","resolution":{"observed_at":"2026-08-06T22:53:06.019934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:53:06.091501Z","title":"Vicuna: An open-source chatbot impressing gpt-4 with 90%* chatgpt quality.See https://vicuna","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20480","last_updated":"2025-06-25T14:24:59Z","snapshot_observed_at":"2026-08-10T08:29:31.375648Z","submitted_at":"2025-06-25T14:24:59Z","title":"GPTailor: Large Language Model Pruning Through Layer Cutting and Stitching","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:06.091501Z"},"links":{"citing_paper":"/paper/2506.20480"},"observation_digest":"sha256:4b81e73bb6930ee70cd9a729f74e604b8e0986e32dc552f5ee9f5573c6b8c0d0","observation_id":"a01ffc72-89e7-4d0b-a202-20d7693dd302","resolution":{"observed_at":"2026-08-06T22:53:06.091501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-06T22:53:06.144314Z","title":"Scaling laws for neural language models.arXiv preprint arXiv:2001.08361, 2020","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2506.20480","last_updated":"2025-06-25T14:24:59Z","snapshot_observed_at":"2026-08-10T08:29:31.375648Z","submitted_at":"2025-06-25T14:24:59Z","title":"GPTailor: Large Language Model Pruning Through Layer Cutting and Stitching","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:06.144314Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2506.20480"},"observation_digest":"sha256:5caab88f233f090a0cfa92c580e6037969b2ec5475fe684ca2b6cd81d04dc83f","observation_id":"2db738bf-7a44-401d-9cb0-b1ef775bb4da","resolution":{"observed_at":"2026-08-06T22:53:06.144314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15556","last_updated":"2022-03-29T13:38:03Z","snapshot_observed_at":"2026-08-09T19:52:33.533277Z","submitted_at":"2022-03-29T13:38:03Z","title":"Training Compute-Optimal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.15556","snapshot_observed_at":"2026-08-06T22:53:06.218136Z","title":"Training compute-optimal large language models.arXiv preprint arXiv:2203.15556, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.20480","last_updated":"2025-06-25T14:24:59Z","snapshot_observed_at":"2026-08-10T08:29:31.375648Z","submitted_at":"2025-06-25T14:24:59Z","title":"GPTailor: Large Language Model Pruning Through Layer Cutting and Stitching","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:06.218136Z"},"links":{"cited_paper":"/paper/2203.15556","citing_paper":"/paper/2506.20480"},"observation_digest":"sha256:cc33b82a0fd049f8477c8d4e234eea222769c5642469de2f86eebd73e5eb6cee","observation_id":"9f77f77d-fd1c-43c7-bd11-457715cff51e","resolution":{"observed_at":"2026-08-06T22:53:06.218136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.07682","last_updated":"2022-10-26T05:06:24Z","snapshot_observed_at":"2026-08-02T15:56:35.249569Z","submitted_at":"2022-06-15T17:32:01Z","title":"Emergent Abilities of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.07682","snapshot_observed_at":"2026-08-06T22:53:06.266468Z","title":"Emergent abilities of large language models.arXiv preprint arXiv:2206.07682, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.20480","last_updated":"2025-06-25T14:24:59Z","snapshot_observed_at":"2026-08-10T08:29:31.375648Z","submitted_at":"2025-06-25T14:24:59Z","title":"GPTailor: Large Language Model Pruning Through Layer Cutting and Stitching","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:06.266468Z"},"links":{"cited_paper":"/paper/2206.07682","citing_paper":"/paper/2506.20480"},"observation_digest":"sha256:af47b6f287edaebb750192b85e11dea7dc998a97a029102205ba83a4f5c07bf7","observation_id":"37b81a4a-c2bf-4eb4-956f-4b92f8448e5c","resolution":{"observed_at":"2026-08-06T22:53:06.266468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:53:13.728129Z","title":"Learning and generalization in overparame- terized neural networks, going beyond two layers.Advances in neural information processing systems, 32, 2019","venue":null,"work_id":"b26a9715-744a-48ca-bca7-3fcc9d19c7d4","year":2019},"citing_paper":{"arxiv_id":"2506.20480","last_updated":"2025-06-25T14:24:59Z","snapshot_observed_at":"2026-08-10T08:29:31.375648Z","submitted_at":"2025-06-25T14:24:59Z","title":"GPTailor: Large Language Model Pruning Through Layer Cutting and Stitching","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:06.328184Z"},"links":{"citing_paper":"/paper/2506.20480"},"observation_digest":"sha256:d5f28aab10328efa4a247089ef87dc6065ac745c144d3c915541068eaf8f69be","observation_id":"465f1f82-0d91-4e23-b3d8-6971b039cd6b","resolution":{"observed_at":"2026-08-06T22:53:13.733065Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:53:06.371132Z","title":"A convergence theory for deep learning via over-parameterization","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.20480","last_updated":"2025-06-25T14:24:59Z","snapshot_observed_at":"2026-08-10T08:29:31.375648Z","submitted_at":"2025-06-25T14:24:59Z","title":"GPTailor: Large Language Model Pruning Through Layer Cutting and Stitching","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:06.371132Z"},"links":{"citing_paper":"/paper/2506.20480"},"observation_digest":"sha256:4b57156e29159a7a434c064691febeb71f65568fb7e74172e92639be4de90f46","observation_id":"e9e9cbf0-7da7-45a2-b44b-f4fd84b9c1dd","resolution":{"observed_at":"2026-08-06T22:53:06.371132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:53:13.702536Z","title":"Train big, then compress: Rethinking model size for efficient training and inference of transformers","venue":null,"work_id":"fbc6c141-0b02-4f73-8a19-85e9a513c31b","year":2020},"citing_paper":{"arxiv_id":"2506.20480","last_updated":"2025-06-25T14:24:59Z","snapshot_observed_at":"2026-08-10T08:29:31.375648Z","submitted_at":"2025-06-25T14:24:59Z","title":"GPTailor: Large Language Model Pruning Through Layer Cutting and Stitching","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:06.436506Z"},"links":{"citing_paper":"/paper/2506.20480"},"observation_digest":"sha256:8e886a62bb7f7fd8ef880d48508499f1b2dfc5ef964b947d25876844db8b2ccd","observation_id":"2b4ca624-61d4-46d4-987e-d5a9b27a407c","resolution":{"observed_at":"2026-08-06T22:53:13.707367Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:53:06.489958Z","title":"Sparsegpt: Massive language models can be accurately pruned in one-shot","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20480","last_updated":"2025-06-25T14:24:59Z","snapshot_observed_at":"2026-08-10T08:29:31.375648Z","submitted_at":"2025-06-25T14:24:59Z","title":"GPTailor: Large Language Model Pruning Through Layer Cutting and Stitching","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:06.489958Z"},"links":{"citing_paper":"/paper/2506.20480"},"observation_digest":"sha256:6ef829ca6063d424c5aa1ab784dcfdbe4d05d1d04d8b328fbf3479aa69a6799d","observation_id":"64dfe37d-c439-45f1-a3f0-61f282a349f2","resolution":{"observed_at":"2026-08-06T22:53:06.489958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03078","last_updated":"2023-06-05T17:53:28Z","snapshot_observed_at":"2026-08-08T23:08:43.190961Z","submitted_at":"2023-06-05T17:53:28Z","title":"SpQR: A Sparse-Quantized Representation for Near-Lossless LLM Weight Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.03078","snapshot_observed_at":"2026-08-06T22:53:06.540313Z","title":"Spqr: A sparse-quantized representation for near-lossless llm weight compression.arXiv preprint arXiv:2306.03078, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20480","last_updated":"2025-06-25T14:24:59Z","snapshot_observed_at":"2026-08-10T08:29:31.375648Z","submitted_at":"2025-06-25T14:24:59Z","title":"GPTailor: Large Language Model Pruning Through Layer Cutting and Stitching","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:06.540313Z"},"links":{"cited_paper":"/paper/2306.03078","citing_paper":"/paper/2506.20480"},"observation_digest":"sha256:243ff92e215559f813c3231a856c48432ddee8ee8041d14c5afe8defdcb2ffd2","observation_id":"58fde576-b40e-4b83-816d-743a63056b15","resolution":{"observed_at":"2026-08-06T22:53:06.540313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06694","last_updated":"2024-04-11T01:18:06Z","snapshot_observed_at":"2026-08-08T20:21:38.269492Z","submitted_at":"2023-10-10T15:13:30Z","title":"Sheared LLaMA: Accelerating Language Model Pre-training via Structured Pruning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06694","snapshot_observed_at":"2026-08-06T22:53:06.589395Z","title":"Sheared llama: Accelerating language model pre-training via structured pruning.arXiv preprint arXiv:2310.06694, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20480","last_updated":"2025-06-25T14:24:59Z","snapshot_observed_at":"2026-08-10T08:29:31.375648Z","submitted_at":"2025-06-25T14:24:59Z","title":"GPTailor: Large Language Model Pruning Through Layer Cutting and Stitching","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:06.589395Z"},"links":{"cited_paper":"/paper/2310.06694","citing_paper":"/paper/2506.20480"},"observation_digest":"sha256:6702f7a85a661fab1b2d87f2fd5af860861ca3421c8cb7acd65a9c142a01efa8","observation_id":"b7d8c180-efd4-4507-a972-bcfb5d9685dc","resolution":{"observed_at":"2026-08-06T22:53:06.589395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02834","last_updated":"2024-06-23T08:45:33Z","snapshot_observed_at":"2026-08-11T02:47:07.358642Z","submitted_at":"2024-02-05T09:44:49Z","title":"Shortened LLaMA: Depth Pruning for Large Language Models with Comparison of Retraining Methods","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.02834","snapshot_observed_at":"2026-08-06T22:53:06.659060Z","title":"Shortened llama: A simple depth pruning for large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20480","last_updated":"2025-06-25T14:24:59Z","snapshot_observed_at":"2026-08-10T08:29:31.375648Z","submitted_at":"2025-06-25T14:24:59Z","title":"GPTailor: Large Language Model Pruning Through Layer Cutting and Stitching","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:06.659060Z"},"links":{"cited_paper":"/paper/2402.02834","citing_paper":"/paper/2506.20480"},"observation_digest":"sha256:d1c0192a9c42f43f0d5fd1ec0de51a231530e27d6648969731e5c7b9d50c405d","observation_id":"4b9b6483-a566-4a9e-a75d-3caf64efde62","resolution":{"observed_at":"2026-08-06T22:53:06.659060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:53:06.720235Z","title":"Llm-pruner: On the structural pruning of large language models.Advances in neural information processing systems, 36:21702–21720, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20480","last_updated":"2025-06-25T14:24:59Z","snapshot_observed_at":"2026-08-10T08:29:31.375648Z","submitted_at":"2025-06-25T14:24:59Z","title":"GPTailor: Large Language Model Pruning Through Layer Cutting and Stitching","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:06.720235Z"},"links":{"citing_paper":"/paper/2506.20480"},"observation_digest":"sha256:59d308c22c470aef8c027fbeed10846785f59cc884f19b840cf07d2519dfa149","observation_id":"5603007a-58f6-48f9-bd4b-e4075362620d","resolution":{"observed_at":"2026-08-06T22:53:06.720235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10534","last_updated":"2023-06-05T19:16:25Z","snapshot_observed_at":"2026-08-11T02:47:03.143686Z","submitted_at":"2022-12-20T18:46:08Z","title":"DISCO: Distilling Counterfactuals with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10534","snapshot_observed_at":"2026-08-06T22:53:06.787151Z","title":"Disco: Distilling counterfactuals with large language models.arXiv preprint arXiv:2212.10534, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.20480","last_updated":"2025-06-25T14:24:59Z","snapshot_observed_at":"2026-08-10T08:29:31.375648Z","submitted_at":"2025-06-25T14:24:59Z","title":"GPTailor: Large Language Model Pruning Through Layer Cutting and Stitching","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:06.787151Z"},"links":{"cited_paper":"/paper/2212.10534","citing_paper":"/paper/2506.20480"},"observation_digest":"sha256:c732e5ee8050f0a305fad8f2269a7b055e247b324024860793030110db2d20d8","observation_id":"e7eb27d7-51db-41fc-90f6-7031e5ebb259","resolution":{"observed_at":"2026-08-06T22:53:06.787151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.02301","last_updated":"2023-07-05T16:59:31Z","snapshot_observed_at":"2026-07-06T15:22:55.122322Z","submitted_at":"2023-05-03T17:50:56Z","title":"Distilling Step-by-Step! Outperforming Larger Language Models with Less Training Data and Smaller Model Sizes","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.02301","snapshot_observed_at":"2026-08-06T22:53:06.841926Z","title":"Distilling step-by-step! outperform- ing larger language models with less training data and smaller model sizes.arXiv preprint arXiv:2305.02301, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20480","last_updated":"2025-06-25T14:24:59Z","snapshot_observed_at":"2026-08-10T08:29:31.375648Z","submitted_at":"2025-06-25T14:24:59Z","title":"GPTailor: Large Language Model Pruning Through Layer Cutting and Stitching","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:06.841926Z"},"links":{"cited_paper":"/paper/2305.02301","citing_paper":"/paper/2506.20480"},"observation_digest":"sha256:12cb956bfdd86a9e63ee2af41e06ea3d7bf53d3d441566b656d682cb0498cd02","observation_id":"c91728f5-ac8c-4a43-a2e8-abafee15971e","resolution":{"observed_at":"2026-08-06T22:53:06.841926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:53:06.917340Z","title":"Distilling reasoning capabilities into smaller language models.Findings of the Association for Computational Linguistics: ACL 2023, pages 7059–7073, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20480","last_updated":"2025-06-25T14:24:59Z","snapshot_observed_at":"2026-08-10T08:29:31.375648Z","submitted_at":"2025-06-25T14:24:59Z","title":"GPTailor: Large Language Model Pruning Through Layer Cutting and Stitching","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:06.917340Z"},"links":{"citing_paper":"/paper/2506.20480"},"observation_digest":"sha256:e65aea52b49104a4ada63caa6fa5af66d2198503017b0c004e049348d9be3e99","observation_id":"bbfa6518-13c0-4810-82e1-5926c680b7f2","resolution":{"observed_at":"2026-08-06T22:53:06.917340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.16944","last_updated":"2023-10-25T19:25:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-25T19:25:16Z","title":"Zephyr: Direct Distillation of LM Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.16944","snapshot_observed_at":"2026-08-06T22:53:06.984578Z","title":"Zephyr: Direct distillation of lm alignment.arXiv preprint arXiv:2310.16944, 2023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.20480","last_updated":"2025-06-25T14:24:59Z","snapshot_observed_at":"2026-08-10T08:29:31.375648Z","submitted_at":"2025-06-25T14:24:59Z","title":"GPTailor: Large Language Model Pruning Through Layer Cutting and Stitching","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:06.984578Z"},"links":{"cited_paper":"/paper/2310.16944","citing_paper":"/paper/2506.20480"},"observation_digest":"sha256:0dd9649ce6581f4e971967e56a858cb10f35a14f28cc622d35a7a84339bc7df4","observation_id":"f3186e47-474f-458f-9fb6-1a8c9124c0c3","resolution":{"observed_at":"2026-08-06T22:53:06.984578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:53:07.047017Z","title":"Zeroquant: Efficient and affordable post-training quantization for large-scale transformers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.20480","last_updated":"2025-06-25T14:24:59Z","snapshot_observed_at":"2026-08-10T08:29:31.375648Z","submitted_at":"2025-06-25T14:24:59Z","title":"GPTailor: Large Language Model Pruning Through Layer Cutting and Stitching","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:07.047017Z"},"links":{"citing_paper":"/paper/2506.20480"},"observation_digest":"sha256:31dd4e0c9c8468aaecb55c436e6cfb60d7205851441dc245b963fa20fd430573","observation_id":"1636d911-4011-4e27-a4ab-2ebb3ade3241","resolution":{"observed_at":"2026-08-06T22:53:07.047017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:53:07.111671Z","title":"A survey of quantization methods for efficient neural network inference","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.20480","last_updated":"2025-06-25T14:24:59Z","snapshot_observed_at":"2026-08-10T08:29:31.375648Z","submitted_at":"2025-06-25T14:24:59Z","title":"GPTailor: Large Language Model Pruning Through Layer Cutting and Stitching","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:07.111671Z"},"links":{"citing_paper":"/paper/2506.20480"},"observation_digest":"sha256:a8ec49a56529f7a9c8eeebd323c64df84af04517fa924b0524d19ef93eabb453","observation_id":"4a5cb47b-850f-43e1-852f-ed5a46bdbbaa","resolution":{"observed_at":"2026-08-06T22:53:07.111671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:53:07.174932Z","title":"Qlora: Efficient finetuning of quantized llms.Advances in neural information processing systems, 36:10088– 10115, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20480","last_updated":"2025-06-25T14:24:59Z","snapshot_observed_at":"2026-08-10T08:29:31.375648Z","submitted_at":"2025-06-25T14:24:59Z","title":"GPTailor: Large Language Model Pruning Through Layer Cutting and Stitching","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:07.174932Z"},"links":{"citing_paper":"/paper/2506.20480"},"observation_digest":"sha256:566aeb402c2f5801b094bdb22f811556fba8232e8c59595e08b5da5ee7f1c9aa","observation_id":"851377dd-f798-4706-8075-5456b74ead74","resolution":{"observed_at":"2026-08-06T22:53:07.174932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03853","last_updated":"2024-10-11T09:43:32Z","snapshot_observed_at":"2026-08-03T01:48:18.654934Z","submitted_at":"2024-03-06T17:04:18Z","title":"ShortGPT: Layers in Large Language Models are More Redundant Than You Expect","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03853","snapshot_observed_at":"2026-08-06T22:53:07.225669Z","title":"Shortgpt: Layers in large language models are more redundant than you expect.arXiv preprint arXiv:2403.03853, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20480","last_updated":"2025-06-25T14:24:59Z","snapshot_observed_at":"2026-08-10T08:29:31.375648Z","submitted_at":"2025-06-25T14:24:59Z","title":"GPTailor: Large Language Model Pruning Through Layer Cutting and Stitching","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:07.225669Z"},"links":{"cited_paper":"/paper/2403.03853","citing_paper":"/paper/2506.20480"},"observation_digest":"sha256:91e88017197a5a9da0dde92acd8a06d355633e11014939c2db8c7a4619c597bf","observation_id":"b29bd29c-62d9-41ac-b5aa-746d02b725a6","resolution":{"observed_at":"2026-08-06T22:53:07.225669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:53:07.279875Z","title":"Model soups: averaging weights of multiple fine-tuned models improves accuracy without increasing inference time","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.20480","last_updated":"2025-06-25T14:24:59Z","snapshot_observed_at":"2026-08-10T08:29:31.375648Z","submitted_at":"2025-06-25T14:24:59Z","title":"GPTailor: Large Language Model Pruning Through Layer Cutting and Stitching","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:07.279875Z"},"links":{"citing_paper":"/paper/2506.20480"},"observation_digest":"sha256:b4a0fb316e4034bf0caf674aa29bbbd738fe48dc4e31f6da3a575f3c4818ed2f","observation_id":"0bbeca5c-5abf-4875-9b0d-3b53db308ce8","resolution":{"observed_at":"2026-08-06T22:53:07.279875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:53:07.362157Z","title":"Smac3: A versatile bayesian optimization package for hyperparameter optimization.Journal of Machine Learning Research, 23(54):1–9, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.20480","last_updated":"2025-06-25T14:24:59Z","snapshot_observed_at":"2026-08-10T08:29:31.375648Z","submitted_at":"2025-06-25T14:24:59Z","title":"GPTailor: Large Language Model Pruning Through Layer Cutting and Stitching","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:07.362157Z"},"links":{"citing_paper":"/paper/2506.20480"},"observation_digest":"sha256:8fab1b4f93bf920bc4fecc127c79a8ffc51cc0f8227038985015646ee26caf5c","observation_id":"d3806a0b-ba7e-442d-b07b-44ae477e95be","resolution":{"observed_at":"2026-08-06T22:53:07.362157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.15024","last_updated":"2024-02-09T17:59:40Z","snapshot_observed_at":"2026-07-06T17:21:01.918787Z","submitted_at":"2024-01-26T17:35:45Z","title":"SliceGPT: Compress Large Language Models by Deleting Rows and Columns","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.15024","snapshot_observed_at":"2026-08-06T22:53:07.452648Z","title":"Slicegpt: Compress large language models by deleting rows and columns","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20480","last_updated":"2025-06-25T14:24:59Z","snapshot_observed_at":"2026-08-10T08:29:31.375648Z","submitted_at":"2025-06-25T14:24:59Z","title":"GPTailor: Large Language Model Pruning Through Layer Cutting and Stitching","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:07.452648Z"},"links":{"cited_paper":"/paper/2401.15024","citing_paper":"/paper/2506.20480"},"observation_digest":"sha256:d91099527f2a992b3b5bd9b307f04b07c46fdfe0657eb1edea6be07c62d526dc","observation_id":"e41432c4-f54a-45ce-8390-146fef628779","resolution":{"observed_at":"2026-08-06T22:53:07.452648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11187","last_updated":"2024-10-15T01:58:58Z","snapshot_observed_at":"2026-08-02T23:45:33.761426Z","submitted_at":"2024-02-17T04:16:30Z","title":"LaCo: Large Language Model Pruning via Layer Collapse","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11187","snapshot_observed_at":"2026-08-06T22:53:07.541474Z","title":"Laco: Large language model pruning via layer collapse","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20480","last_updated":"2025-06-25T14:24:59Z","snapshot_observed_at":"2026-08-10T08:29:31.375648Z","submitted_at":"2025-06-25T14:24:59Z","title":"GPTailor: Large Language Model Pruning Through Layer Cutting and Stitching","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:07.541474Z"},"links":{"cited_paper":"/paper/2402.11187","citing_paper":"/paper/2506.20480"},"observation_digest":"sha256:349b462347152b74d487cc9371faf3aa81b6b7ff10ed247cefa1fd164b342b5a","observation_id":"e8c327d2-7bde-4178-9385-5a7a644ab2e4","resolution":{"observed_at":"2026-08-06T22:53:07.541474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.02267","last_updated":"2024-08-25T14:41:32Z","snapshot_observed_at":"2026-08-07T23:10:42.536483Z","submitted_at":"2024-05-03T17:34:57Z","title":"Structural Pruning of Pre-trained Language Models via Neural Architecture Search","version":2},"cited_work":{"arxiv_id":"2405.02267","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.02267","snapshot_observed_at":"2026-08-06T22:53:12.320965Z","title":"Structural Pruning of Pre-trained Language Models via Neural Architecture Search","venue":"cs.LG","work_id":"8db7176c-7d95-4a4a-b966-82b22430d6b3","year":2024},"citing_paper":{"arxiv_id":"2506.20480","last_updated":"2025-06-25T14:24:59Z","snapshot_observed_at":"2026-08-10T08:29:31.375648Z","submitted_at":"2025-06-25T14:24:59Z","title":"GPTailor: Large Language Model Pruning Through Layer Cutting and Stitching","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:07.601358Z"},"links":{"cited_paper":"/paper/2405.02267","citing_paper":"/paper/2506.20480"},"observation_digest":"sha256:ae375d4038ffba574b5005f4e4bd033b38e2d5df1243a4fa59db8e485e27d0c3","observation_id":"fe7ab95b-270e-4bc1-934d-b71894824905","resolution":{"observed_at":"2026-08-06T22:53:12.420176Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:53:13.608731Z","title":"Weight averaging for neural networks and local resampling schemes","venue":null,"work_id":"1dba09f4-2e39-4329-a435-f410ac64bb7a","year":1996},"citing_paper":{"arxiv_id":"2506.20480","last_updated":"2025-06-25T14:24:59Z","snapshot_observed_at":"2026-08-10T08:29:31.375648Z","submitted_at":"2025-06-25T14:24:59Z","title":"GPTailor: Large Language Model Pruning Through Layer Cutting and Stitching","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:07.691794Z"},"links":{"citing_paper":"/paper/2506.20480"},"observation_digest":"sha256:7431614034bded438cb207abf1ee5db2de527924586310a8e52b0d52831e0e48","observation_id":"9b9726de-5a39-47fe-80f2-41e55063db34","resolution":{"observed_at":"2026-08-06T22:53:13.613961Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04089","last_updated":"2023-03-31T15:27:01Z","snapshot_observed_at":"2026-08-03T22:12:27.993418Z","submitted_at":"2022-12-08T05:50:53Z","title":"Editing Models with Task Arithmetic","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04089","snapshot_observed_at":"2026-08-06T22:53:07.747444Z","title":"Editing models with task arithmetic.arXiv preprint arXiv:2212.04089, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.20480","last_updated":"2025-06-25T14:24:59Z","snapshot_observed_at":"2026-08-10T08:29:31.375648Z","submitted_at":"2025-06-25T14:24:59Z","title":"GPTailor: Large Language Model Pruning Through Layer Cutting and Stitching","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:07.747444Z"},"links":{"cited_paper":"/paper/2212.04089","citing_paper":"/paper/2506.20480"},"observation_digest":"sha256:447994365fdceeb04f68eeb134c0488cd35ad9e3daba0a632d4c93456bfce777","observation_id":"de267e04-2bf7-4f35-9047-e98cb7a11f50","resolution":{"observed_at":"2026-08-06T22:53:07.747444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.04468","last_updated":"2016-12-06T14:39:05Z","snapshot_observed_at":"2026-07-06T05:10:50.385049Z","submitted_at":"2016-09-14T22:42:23Z","title":"Sampling Generative Networks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.04468","snapshot_observed_at":"2026-08-06T22:53:07.816065Z","title":"Sampling generative networks.arXiv preprint arXiv:1609.04468, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.20480","last_updated":"2025-06-25T14:24:59Z","snapshot_observed_at":"2026-08-10T08:29:31.375648Z","submitted_at":"2025-06-25T14:24:59Z","title":"GPTailor: Large Language Model Pruning Through Layer Cutting and Stitching","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:07.816065Z"},"links":{"cited_paper":"/paper/1609.04468","citing_paper":"/paper/2506.20480"},"observation_digest":"sha256:d0a99d2760f39a09032064ebeb0db14879943eda2e66fd76931579e9913a6d4a","observation_id":"e75639c1-4837-4121-be38-e00f2a802326","resolution":{"observed_at":"2026-08-06T22:53:07.816065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:53:13.594368Z","title":"Ties-merging: Resolving interference when merging models.Advances in Neural Information Processing Systems, 36, 2024","venue":null,"work_id":"9c1c5e1a-bc59-4a4e-8079-ea021c3d4107","year":2024},"citing_paper":{"arxiv_id":"2506.20480","last_updated":"2025-06-25T14:24:59Z","snapshot_observed_at":"2026-08-10T08:29:31.375648Z","submitted_at":"2025-06-25T14:24:59Z","title":"GPTailor: Large Language Model Pruning Through Layer Cutting and Stitching","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:07.880303Z"},"links":{"citing_paper":"/paper/2506.20480"},"observation_digest":"sha256:f395b945c8037f418b3f69ff3bd7c5a133ae90aa5b4bb95e942ec8d134db8596","observation_id":"7eff3e8c-0771-4c78-99fd-9d51ca32ccd2","resolution":{"observed_at":"2026-08-06T22:53:13.598729Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:53:07.951088Z","title":"Language models are super mario: Absorbing abilities from homologous models as a free lunch","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20480","last_updated":"2025-06-25T14:24:59Z","snapshot_observed_at":"2026-08-10T08:29:31.375648Z","submitted_at":"2025-06-25T14:24:59Z","title":"GPTailor: Large Language Model Pruning Through Layer Cutting and Stitching","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:07.951088Z"},"links":{"citing_paper":"/paper/2506.20480"},"observation_digest":"sha256:a8097a1c36e01792e92788370f8b1890f52108ac01b852aa11c63c4c0402367e","observation_id":"7f274f58-6cbf-4fa8-8ecc-a274846f2511","resolution":{"observed_at":"2026-08-06T22:53:07.951088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13187","last_updated":"2025-01-27T10:19:44Z","snapshot_observed_at":"2026-08-11T02:47:05.210192Z","submitted_at":"2024-03-19T22:56:53Z","title":"Evolutionary Optimization of Model Merging Recipes","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13187","snapshot_observed_at":"2026-08-06T22:53:07.973981Z","title":"Evolutionary optimization of model merging recipes.arXiv preprint arXiv:2403.13187, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20480","last_updated":"2025-06-25T14:24:59Z","snapshot_observed_at":"2026-08-10T08:29:31.375648Z","submitted_at":"2025-06-25T14:24:59Z","title":"GPTailor: Large Language Model Pruning Through Layer Cutting and Stitching","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:07.973981Z"},"links":{"cited_paper":"/paper/2403.13187","citing_paper":"/paper/2506.20480"},"observation_digest":"sha256:3744e9a068fc73d328eefa7b8988f9ac4d84d22fa71a5639f750364c4e4a9c5b","observation_id":"46b3c6ab-3a85-48a5-9153-383a7a9fac6f","resolution":{"observed_at":"2026-08-06T22:53:07.973981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04030","last_updated":"2025-06-25T14:44:30Z","snapshot_observed_at":"2026-08-09T18:05:30.973187Z","submitted_at":"2025-02-06T12:47:25Z","title":"Fine, I'll Merge It Myself: A Multi-Fidelity Framework for Automated Model Merging","version":2},"cited_work":{"arxiv_id":"2502.04030","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.04030","snapshot_observed_at":"2026-08-06T22:53:12.046539Z","title":"Fine, I'll Merge It Myself: A Multi-Fidelity Framework for Automated Model Merging","venue":"cs.AI","work_id":"26b29365-8f71-47ef-8198-43b3330c38b0","year":2025},"citing_paper":{"arxiv_id":"2506.20480","last_updated":"2025-06-25T14:24:59Z","snapshot_observed_at":"2026-08-10T08:29:31.375648Z","submitted_at":"2025-06-25T14:24:59Z","title":"GPTailor: Large Language Model Pruning Through Layer Cutting and Stitching","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:08.045487Z"},"links":{"cited_paper":"/paper/2502.04030","citing_paper":"/paper/2506.20480"},"observation_digest":"sha256:eb3f3b54fdfb27b28cc9ca97e3a402263210b0548eb47399705aec110e368f0f","observation_id":"c759d429-66ca-4db6-b7af-7938b9f8506d","resolution":{"observed_at":"2026-08-06T22:53:12.125172Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:53:13.569681Z","title":null,"venue":null,"work_id":"996c27e5-2897-4a63-a1c5-3fd2a348ea7a","year":2006},"citing_paper":{"arxiv_id":"2506.20480","last_updated":"2025-06-25T14:24:59Z","snapshot_observed_at":"2026-08-10T08:29:31.375648Z","submitted_at":"2025-06-25T14:24:59Z","title":"GPTailor: Large Language Model Pruning Through Layer Cutting and Stitching","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:08.150248Z"},"links":{"citing_paper":"/paper/2506.20480"},"observation_digest":"sha256:90c2609ca1c1faa8da1d6147b99152cad53fbb8c798abc321af537cd22bd5ae9","observation_id":"36422beb-3a26-4377-89e0-fb0a14f494ce","resolution":{"observed_at":"2026-08-06T22:53:13.573887Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:53:08.278018Z","title":"Random forests.Machine learning, 45:5–32, 2001","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2506.20480","last_updated":"2025-06-25T14:24:59Z","snapshot_observed_at":"2026-08-10T08:29:31.375648Z","submitted_at":"2025-06-25T14:24:59Z","title":"GPTailor: Large Language Model Pruning Through Layer Cutting and Stitching","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:08.278018Z"},"links":{"citing_paper":"/paper/2506.20480"},"observation_digest":"sha256:ad8d68dc9548c4694cc44cf236e9ca5e0177c55210234df12b768dc7b6d934c0","observation_id":"367ce059-2646-424e-86c9-4fb00746a905","resolution":{"observed_at":"2026-08-06T22:53:08.278018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:53:08.437254Z","title":"Opencompass: A universal evaluation platform for foundation models.https://github.com/open-compass/opencompass, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20480","last_updated":"2025-06-25T14:24:59Z","snapshot_observed_at":"2026-08-10T08:29:31.375648Z","submitted_at":"2025-06-25T14:24:59Z","title":"GPTailor: Large Language Model Pruning Through Layer Cutting and Stitching","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:08.437254Z"},"links":{"citing_paper":"/paper/2506.20480"},"observation_digest":"sha256:af77d9deff0fe21b2cac6ab4c3f9cdca1bd82ffa87daef7cd5ad3dadb4583e72","observation_id":"fc2d9bc1-dd87-45d5-8bfe-9506f81140bc","resolution":{"observed_at":"2026-08-06T22:53:08.437254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.05986","last_updated":"2020-11-05T14:46:45Z","snapshot_observed_at":"2026-08-11T02:47:03.669461Z","submitted_at":"2020-04-13T15:02:29Z","title":"CLUE: A Chinese Language Understanding Evaluation Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.05986","snapshot_observed_at":"2026-08-06T22:53:08.643876Z","title":"Clue: A chinese language understanding evaluation benchmark.arXiv preprint arXiv:2004.05986, 2020","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2506.20480","last_updated":"2025-06-25T14:24:59Z","snapshot_observed_at":"2026-08-10T08:29:31.375648Z","submitted_at":"2025-06-25T14:24:59Z","title":"GPTailor: Large Language Model Pruning Through Layer Cutting and Stitching","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:08.643876Z"},"links":{"cited_paper":"/paper/2004.05986","citing_paper":"/paper/2506.20480"},"observation_digest":"sha256:713d9a17f3c400b2f82cf601e53fe654044275d5cdf7062f4708e27bf7b61276","observation_id":"41561ae4-bfd9-40af-8997-2a4f8ee0063d","resolution":{"observed_at":"2026-08-06T22:53:08.643876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.07830","last_updated":"2019-05-19T23:57:23Z","snapshot_observed_at":"2026-08-10T16:18:23.994244Z","submitted_at":"2019-05-19T23:57:23Z","title":"HellaSwag: Can a Machine Really Finish Your Sentence?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.07830","snapshot_observed_at":"2026-08-06T22:53:08.839620Z","title":"Hellaswag: Can a machine really finish your sentence?arXiv preprint arXiv:1905.07830, 2019","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2506.20480","last_updated":"2025-06-25T14:24:59Z","snapshot_observed_at":"2026-08-10T08:29:31.375648Z","submitted_at":"2025-06-25T14:24:59Z","title":"GPTailor: Large Language Model Pruning Through Layer Cutting and Stitching","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:08.839620Z"},"links":{"cited_paper":"/paper/1905.07830","citing_paper":"/paper/2506.20480"},"observation_digest":"sha256:664e1f7c866fb52e083df5ac57f9637082a09236ae690278471c3803532f97ad","observation_id":"b8c353eb-a716-44b6-9ae5-3061b89903fa","resolution":{"observed_at":"2026-08-06T22:53:08.839620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:53:08.961805Z","title":"Piqa: Reasoning about phys- ical commonsense in natural language","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.20480","last_updated":"2025-06-25T14:24:59Z","snapshot_observed_at":"2026-08-10T08:29:31.375648Z","submitted_at":"2025-06-25T14:24:59Z","title":"GPTailor: Large Language Model Pruning Through Layer Cutting and Stitching","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:08.961805Z"},"links":{"citing_paper":"/paper/2506.20480"},"observation_digest":"sha256:1a88e79522448b82965af7d042d7d553fee3cb57a5452b9ddb78bc5efd1cd2df","observation_id":"89821421-ff23-4b03-9d9c-8cf56a881d5a","resolution":{"observed_at":"2026-08-06T22:53:08.961805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.01265","last_updated":"2020-01-27T16:43:59Z","snapshot_observed_at":"2026-08-11T05:36:39.988814Z","submitted_at":"2019-06-04T08:29:00Z","title":"ChID: A Large-scale Chinese IDiom Dataset for Cloze Test","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.01265","snapshot_observed_at":"2026-08-06T22:53:09.095979Z","title":"Chid: A large-scale chinese idiom dataset for cloze test.arXiv preprint arXiv:1906.01265, 2019","venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"2506.20480","last_updated":"2025-06-25T14:24:59Z","snapshot_observed_at":"2026-08-10T08:29:31.375648Z","submitted_at":"2025-06-25T14:24:59Z","title":"GPTailor: Large Language Model Pruning Through Layer Cutting and Stitching","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:09.095979Z"},"links":{"cited_paper":"/paper/1906.01265","citing_paper":"/paper/2506.20480"},"observation_digest":"sha256:838d8201fe1cb8a214bcb90d7414988b11f436a5c539c938b760a81cfe86825c","observation_id":"dcd3980f-7df1-4ec2-8e18-ed1924d02744","resolution":{"observed_at":"2026-08-06T22:53:09.095979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:53:13.524077Z","title":"The winograd schema challenge.KR, 2012:13th, 2012","venue":null,"work_id":"2867e391-6adb-4340-a632-21ce443c7caf","year":2012},"citing_paper":{"arxiv_id":"2506.20480","last_updated":"2025-06-25T14:24:59Z","snapshot_observed_at":"2026-08-10T08:29:31.375648Z","submitted_at":"2025-06-25T14:24:59Z","title":"GPTailor: Large Language Model Pruning Through Layer Cutting and Stitching","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:09.259699Z"},"links":{"citing_paper":"/paper/2506.20480"},"observation_digest":"sha256:e9ee65902eb71aa81a23f9f535bf0a1192a339ea3eab4f52d4fa67a5390e93fb","observation_id":"d5791ef2-0e0d-4452-b19c-1499f2a18da3","resolution":{"observed_at":"2026-08-06T22:53:13.528903Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1811.00937","last_updated":"2019-03-15T18:02:58Z","snapshot_observed_at":"2026-08-10T07:37:55.457401Z","submitted_at":"2018-11-02T15:34:29Z","title":"CommonsenseQA: A Question Answering Challenge Targeting Commonsense Knowledge","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.00937","snapshot_observed_at":"2026-08-06T22:53:09.383657Z","title":"Commonsenseqa: A ques- tion answering challenge targeting commonsense knowledge.arXiv preprint arXiv:1811.00937, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.20480","last_updated":"2025-06-25T14:24:59Z","snapshot_observed_at":"2026-08-10T08:29:31.375648Z","submitted_at":"2025-06-25T14:24:59Z","title":"GPTailor: Large Language Model Pruning Through Layer Cutting and Stitching","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:09.383657Z"},"links":{"cited_paper":"/paper/1811.00937","citing_paper":"/paper/2506.20480"},"observation_digest":"sha256:c39e15d80dd3dd9760f11413d94cb6aa0468072b9199c81a738247bead043487","observation_id":"0c5259a8-1617-4684-b53a-553a0452852d","resolution":{"observed_at":"2026-08-06T22:53:09.383657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.10044","last_updated":"2019-05-24T05:48:49Z","snapshot_observed_at":"2026-07-06T07:55:12.121264Z","submitted_at":"2019-05-24T05:48:49Z","title":"BoolQ: Exploring the Surprising Difficulty of Natural Yes/No Questions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.10044","snapshot_observed_at":"2026-08-06T22:53:09.516180Z","title":"Boolq: Exploring the surprising difficulty of natural yes/no questions","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2506.20480","last_updated":"2025-06-25T14:24:59Z","snapshot_observed_at":"2026-08-10T08:29:31.375648Z","submitted_at":"2025-06-25T14:24:59Z","title":"GPTailor: Large Language Model Pruning Through Layer Cutting and Stitching","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:09.516180Z"},"links":{"cited_paper":"/paper/1905.10044","citing_paper":"/paper/2506.20480"},"observation_digest":"sha256:d7cdc6a6fd67ef1a47a83db8b5779c55f37a9b91a79b8212b476aba853aa4ab4","observation_id":"9c2952d2-bc22-4724-8dbb-74f4ffb336c2","resolution":{"observed_at":"2026-08-06T22:53:09.516180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-08-10T12:35:09.020030Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-06T22:53:09.643480Z","title":"Measuring massive multitask language understanding.arXiv preprint arXiv:2009.03300, 2020","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2506.20480","last_updated":"2025-06-25T14:24:59Z","snapshot_observed_at":"2026-08-10T08:29:31.375648Z","submitted_at":"2025-06-25T14:24:59Z","title":"GPTailor: Large Language Model Pruning Through Layer Cutting and Stitching","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:09.643480Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2506.20480"},"observation_digest":"sha256:be2d0ea520e0a0b55cf53d1b6ef9799a2862f998ebb6d5ce5915d4608f8d18d1","observation_id":"a31962f2-2d6f-460b-b022-ffcebfd272be","resolution":{"observed_at":"2026-08-06T22:53:09.643480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09212","last_updated":"2024-01-17T19:09:57Z","snapshot_observed_at":"2026-08-04T18:52:19.083847Z","submitted_at":"2023-06-15T15:49:51Z","title":"CMMLU: Measuring massive multitask language understanding in Chinese","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09212","snapshot_observed_at":"2026-08-06T22:53:09.736408Z","title":"Cmmlu: Measuring massive multitask language understanding in chinese","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20480","last_updated":"2025-06-25T14:24:59Z","snapshot_observed_at":"2026-08-10T08:29:31.375648Z","submitted_at":"2025-06-25T14:24:59Z","title":"GPTailor: Large Language Model Pruning Through Layer Cutting and Stitching","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:09.736408Z"},"links":{"cited_paper":"/paper/2306.09212","citing_paper":"/paper/2506.20480"},"observation_digest":"sha256:8abc89922ac1b4e43c3e4cc33106b7ccf3df68ddc9666a4cc1a5ef4000addc1c","observation_id":"ced82713-2f5a-486b-8a20-f0183ebf6783","resolution":{"observed_at":"2026-08-06T22:53:09.736408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1704.04683","last_updated":"2017-12-05T19:36:03Z","snapshot_observed_at":"2026-08-07T10:40:47.462532Z","submitted_at":"2017-04-15T19:31:41Z","title":"RACE: Large-scale ReAding Comprehension Dataset From Examinations","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1704.04683","snapshot_observed_at":"2026-08-06T22:53:09.868001Z","title":"Race: Large-scale reading comprehension dataset from examinations.arXiv preprint arXiv:1704.04683, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.20480","last_updated":"2025-06-25T14:24:59Z","snapshot_observed_at":"2026-08-10T08:29:31.375648Z","submitted_at":"2025-06-25T14:24:59Z","title":"GPTailor: Large Language Model Pruning Through Layer Cutting and Stitching","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:09.868001Z"},"links":{"cited_paper":"/paper/1704.04683","citing_paper":"/paper/2506.20480"},"observation_digest":"sha256:2e51c8b25913a3c6f314d229ffdf5ed4bf68730284fa3984f3994554fd9ba88f","observation_id":"99c88549-e03c-4d4e-8a29-6773c4eff872","resolution":{"observed_at":"2026-08-06T22:53:09.868001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1808.08745","last_updated":"2018-08-27T09:08:18Z","snapshot_observed_at":"2026-07-06T06:57:36.335954Z","submitted_at":"2018-08-27T09:08:18Z","title":"Don't Give Me the Details, Just the Summary! Topic-Aware Convolutional Neural Networks for Extreme Summarization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1808.08745","snapshot_observed_at":"2026-08-06T22:53:09.981515Z","title":"Don’t give me the details, just the summary! topic-aware convolutional neural networks for extreme summarization.arXiv preprint arXiv:1808.08745, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.20480","last_updated":"2025-06-25T14:24:59Z","snapshot_observed_at":"2026-08-10T08:29:31.375648Z","submitted_at":"2025-06-25T14:24:59Z","title":"GPTailor: Large Language Model Pruning Through Layer Cutting and Stitching","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:09.981515Z"},"links":{"cited_paper":"/paper/1808.08745","citing_paper":"/paper/2506.20480"},"observation_digest":"sha256:3f19794d05eff6ea2d02f84674baa79533470cec47c85959e0b55f280c429c8f","observation_id":"24ab2e58-1480-481f-948b-4651f1687d8b","resolution":{"observed_at":"2026-08-06T22:53:09.981515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:53:13.509048Z","title":"Investigating prior knowledge for challenging chinese machine reading comprehension.Transactions of the Association for Computational Linguistics, 8:141–155, 2020","venue":null,"work_id":"f5224d1c-873c-419a-9ed0-9f8abea9ae28","year":2020},"citing_paper":{"arxiv_id":"2506.20480","last_updated":"2025-06-25T14:24:59Z","snapshot_observed_at":"2026-08-10T08:29:31.375648Z","submitted_at":"2025-06-25T14:24:59Z","title":"GPTailor: Large Language Model Pruning Through Layer Cutting and Stitching","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:10.098644Z"},"links":{"citing_paper":"/paper/2506.20480"},"observation_digest":"sha256:463cbfecdb1433cf1e9650eca1966bcffdb671294dd35ddf238142992516e444","observation_id":"71684b67-6e7c-47a0-9a8d-41cb31aecb01","resolution":{"observed_at":"2026-08-06T22:53:13.513704Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05653","last_updated":"2023-10-03T02:48:42Z","snapshot_observed_at":"2026-08-07T14:43:09.380195Z","submitted_at":"2023-09-11T17:47:22Z","title":"MAmmoTH: Building Math Generalist Models through Hybrid Instruction Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.05653","snapshot_observed_at":"2026-08-06T22:53:10.226886Z","title":"Mammoth: Building math generalist models through hybrid instruction tuning.arXiv preprint arXiv:2309.05653, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20480","last_updated":"2025-06-25T14:24:59Z","snapshot_observed_at":"2026-08-10T08:29:31.375648Z","submitted_at":"2025-06-25T14:24:59Z","title":"GPTailor: Large Language Model Pruning Through Layer Cutting and Stitching","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:10.226886Z"},"links":{"cited_paper":"/paper/2309.05653","citing_paper":"/paper/2506.20480"},"observation_digest":"sha256:06a69edf55ef7a4d7b7fb019ab85b64f84c9cbe7e710b4fe3646729b98940031","observation_id":"5200d681-ec6e-4d96-a754-64b6e76360b8","resolution":{"observed_at":"2026-08-06T22:53:10.226886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:53:13.493216Z","title":"llama-2-coder-7b (revision d30d193), 2023","venue":null,"work_id":"ae694a8f-ae54-4c09-b302-5949c73f8736","year":2023},"citing_paper":{"arxiv_id":"2506.20480","last_updated":"2025-06-25T14:24:59Z","snapshot_observed_at":"2026-08-10T08:29:31.375648Z","submitted_at":"2025-06-25T14:24:59Z","title":"GPTailor: Large Language Model Pruning Through Layer Cutting and Stitching","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:10.334631Z"},"links":{"citing_paper":"/paper/2506.20480"},"observation_digest":"sha256:bee464690e9b11e165739f79273e5a2d7ba1908011a67f5700faf04c654ff78c","observation_id":"60c85cda-9e71-493b-a449-e4337b1ba5e1","resolution":{"observed_at":"2026-08-06T22:53:13.497655Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.12244","last_updated":"2025-05-27T06:49:09Z","snapshot_observed_at":"2026-08-10T07:58:15.209421Z","submitted_at":"2023-04-24T16:31:06Z","title":"WizardLM: Empowering large pre-trained language models to follow complex instructions","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.12244","snapshot_observed_at":"2026-08-06T22:53:10.477326Z","title":"Wizardlm: Empowering large language models to follow complex instructions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20480","last_updated":"2025-06-25T14:24:59Z","snapshot_observed_at":"2026-08-10T08:29:31.375648Z","submitted_at":"2025-06-25T14:24:59Z","title":"GPTailor: Large Language Model Pruning Through Layer Cutting and Stitching","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:10.477326Z"},"links":{"cited_paper":"/paper/2304.12244","citing_paper":"/paper/2506.20480"},"observation_digest":"sha256:31ef9188faa42de6eeabdcb00772cfe637723e67dcd849b3332f3112435022f6","observation_id":"b2753982-ae15-413d-b203-bdf956affde6","resolution":{"observed_at":"2026-08-06T22:53:10.477326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.09583","last_updated":"2025-06-04T08:58:56Z","snapshot_observed_at":"2026-08-02T06:48:43.121988Z","submitted_at":"2023-08-18T14:23:21Z","title":"WizardMath: Empowering Mathematical Reasoning for Large Language Models via Reinforced Evol-Instruct","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.09583","snapshot_observed_at":"2026-08-06T22:53:10.612011Z","title":"Wizardmath: Empowering mathematical rea- soning for large language models via reinforced evol-instruct.arXiv preprint arXiv:2308.09583, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20480","last_updated":"2025-06-25T14:24:59Z","snapshot_observed_at":"2026-08-10T08:29:31.375648Z","submitted_at":"2025-06-25T14:24:59Z","title":"GPTailor: Large Language Model Pruning Through Layer Cutting and Stitching","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:10.612011Z"},"links":{"cited_paper":"/paper/2308.09583","citing_paper":"/paper/2506.20480"},"observation_digest":"sha256:fa006263c0004bf8ce6b880420836b39dc423f92eeaee12adf9695bcf66843f5","observation_id":"79f1ecbd-8bb8-4e42-aa5b-bcc535a5fc56","resolution":{"observed_at":"2026-08-06T22:53:10.612011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:53:10.737231Z","title":"Code alpaca: An instruction-following llama model for code generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20480","last_updated":"2025-06-25T14:24:59Z","snapshot_observed_at":"2026-08-10T08:29:31.375648Z","submitted_at":"2025-06-25T14:24:59Z","title":"GPTailor: Large Language Model Pruning Through Layer Cutting and Stitching","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:10.737231Z"},"links":{"citing_paper":"/paper/2506.20480"},"observation_digest":"sha256:8b71ddb5a6a9e5c220826d7fa00efe7e424121040ac1f086e5e39034b0add09f","observation_id":"ceee6883-52bb-4deb-af80-e4cdd7be8823","resolution":{"observed_at":"2026-08-06T22:53:10.737231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:53:13.464018Z","title":"Shallow-deep networks: Understanding and mitigating network overthinking","venue":null,"work_id":"67151501-2232-4f36-b1ff-02a5b5eec3a9","year":2019},"citing_paper":{"arxiv_id":"2506.20480","last_updated":"2025-06-25T14:24:59Z","snapshot_observed_at":"2026-08-10T08:29:31.375648Z","submitted_at":"2025-06-25T14:24:59Z","title":"GPTailor: Large Language Model Pruning Through Layer Cutting and Stitching","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:10.858211Z"},"links":{"citing_paper":"/paper/2506.20480"},"observation_digest":"sha256:9c3dcf2de45202aa1dec967c74a9387302309f34c71d92378d6d5d772fec4acc","observation_id":"0ef822be-8ef7-41ba-b034-1612ba52e464","resolution":{"observed_at":"2026-08-06T22:53:13.471321Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17887","last_updated":"2025-03-03T17:02:05Z","snapshot_observed_at":"2026-08-11T02:47:04.813368Z","submitted_at":"2024-03-26T17:20:04Z","title":"The Unreasonable Ineffectiveness of the Deeper Layers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17887","snapshot_observed_at":"2026-08-06T22:53:11.013316Z","title":"The unreasonable ineffectiveness of the deeper layers.arXiv preprint arXiv:2403.17887, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20480","last_updated":"2025-06-25T14:24:59Z","snapshot_observed_at":"2026-08-10T08:29:31.375648Z","submitted_at":"2025-06-25T14:24:59Z","title":"GPTailor: Large Language Model Pruning Through Layer Cutting and Stitching","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:11.013316Z"},"links":{"cited_paper":"/paper/2403.17887","citing_paper":"/paper/2506.20480"},"observation_digest":"sha256:8e23cc755b78370afc3e0123b70a0154e78ca99244a9f455a46445b9bafa09ec","observation_id":"b2b52689-eac5-4880-893e-9e4446e96386","resolution":{"observed_at":"2026-08-06T22:53:11.013316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:53:11.119687Z","title":"Pointer sentinel mixture models, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.20480","last_updated":"2025-06-25T14:24:59Z","snapshot_observed_at":"2026-08-10T08:29:31.375648Z","submitted_at":"2025-06-25T14:24:59Z","title":"GPTailor: Large Language Model Pruning Through Layer Cutting and Stitching","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:11.119687Z"},"links":{"citing_paper":"/paper/2506.20480"},"observation_digest":"sha256:11670c6422299595f7e3bee3854e7bf969b65de5a52644f75179a610b4781cf7","observation_id":"e0bfcfb1-4c52-4f1d-a23e-40942224123f","resolution":{"observed_at":"2026-08-06T22:53:11.119687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-10T16:40:37.411115Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-06T22:53:11.283686Z","title":"The llama 3 herd of models.arXiv preprint arXiv:2407.21783, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20480","last_updated":"2025-06-25T14:24:59Z","snapshot_observed_at":"2026-08-10T08:29:31.375648Z","submitted_at":"2025-06-25T14:24:59Z","title":"GPTailor: Large Language Model Pruning Through Layer Cutting and Stitching","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:11.283686Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.20480"},"observation_digest":"sha256:2c767eba387bb1fdcfc35405377d1d8aae2da9b29f8542b2b3d9b063c8fdb837","observation_id":"6659eb75-c978-4863-bcaf-dd15fbd4173d","resolution":{"observed_at":"2026-08-06T22:53:11.283686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:53:13.193440Z","title":"Code-llama-3-8b, 2023","venue":null,"work_id":"7f8bd255-010d-406e-9164-2ecbbc8704cc","year":2023},"citing_paper":{"arxiv_id":"2506.20480","last_updated":"2025-06-25T14:24:59Z","snapshot_observed_at":"2026-08-10T08:29:31.375648Z","submitted_at":"2025-06-25T14:24:59Z","title":"GPTailor: Large Language Model Pruning Through Layer Cutting and Stitching","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:11.435354Z"},"links":{"citing_paper":"/paper/2506.20480"},"observation_digest":"sha256:6c20f91c10a3f9d464081ed9516ccd42b7a007b572b3f3c1741b61ab4c690f19","observation_id":"ea187a13-c493-40e8-9ca5-d437aaa93a22","resolution":{"observed_at":"2026-08-06T22:53:13.327788Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:53:13.006477Z","title":"Mathcoder: Seamless code integration in LLMs for enhanced mathematical reasoning","venue":null,"work_id":"1d7b283b-49d5-4202-b25d-e89f2afaf3f6","year":2024},"citing_paper":{"arxiv_id":"2506.20480","last_updated":"2025-06-25T14:24:59Z","snapshot_observed_at":"2026-08-10T08:29:31.375648Z","submitted_at":"2025-06-25T14:24:59Z","title":"GPTailor: Large Language Model Pruning Through Layer Cutting and Stitching","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:11.514763Z"},"links":{"citing_paper":"/paper/2506.20480"},"observation_digest":"sha256:db2134c7b2b9a26960b063ce7020abccc810ee83d0125bb346c3ac5d9a4c6436","observation_id":"e6cf6ad8-219d-4136-bf6f-e3ee11477147","resolution":{"observed_at":"2026-08-06T22:53:13.125836Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:53:12.733503Z","title":"Mathcoder2: Better math reasoning from continued pretraining on model- translated mathematical code, 2024","venue":null,"work_id":"a7957c8d-11e9-4b10-a4dc-95520ea2657e","year":2024},"citing_paper":{"arxiv_id":"2506.20480","last_updated":"2025-06-25T14:24:59Z","snapshot_observed_at":"2026-08-10T08:29:31.375648Z","submitted_at":"2025-06-25T14:24:59Z","title":"GPTailor: Large Language Model Pruning Through Layer Cutting and Stitching","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:11.602323Z"},"links":{"citing_paper":"/paper/2506.20480"},"observation_digest":"sha256:f5976f86fde9b8ae0651af05ccdc1f8ff77ab81cd6cedd6e1f01d31aa87d2cc7","observation_id":"c01d04ee-2e52-4705-a017-140f7501f9e5","resolution":{"observed_at":"2026-08-06T22:53:12.875414Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-08-10T02:15:37.272323Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.05507","snapshot_observed_at":"2026-08-06T22:53:11.677172Z","title":"Goldilocks","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.20480","last_updated":"2025-06-25T14:24:59Z","snapshot_observed_at":"2026-08-10T08:29:31.375648Z","submitted_at":"2025-06-25T14:24:59Z","title":"GPTailor: Large Language Model Pruning Through Layer Cutting and Stitching","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:11.677172Z"},"links":{"cited_paper":"/paper/1911.05507","citing_paper":"/paper/2506.20480"},"observation_digest":"sha256:51457da6f2a7d27780823508117cf9420d14506d3f85cff6dd564baeda9de843","observation_id":"a6c4cd08-7636-42a4-a958-c515d864637b","resolution":{"observed_at":"2026-08-06T22:53:11.677172Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.20480","last_updated":"2025-06-25T14:24:59Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-10T08:29:31.375648Z","submitted_at":"2025-06-25T14:24:59Z","title":"GPTailor: Large Language Model Pruning Through Layer Cutting and Stitching"},"reference_resolution":{"displayed":62,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":48,"verified_exact":2,"verified_fuzzy":11},"total_outbound_references":62},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 62 of 62 outbound references and 1 inbound Pith citation observation for arXiv:2506.20480."}