{"as_of":"2026-08-20T23:34:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c231665cc4128958b2b9e835acf60b37e10ae3b0452ca14437b0f7a3da0fab32","coverage":[{"denominator":44,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":44,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T10:20:23.528274Z","state":"measured"},{"denominator":44,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":44,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.05641/citation-record","integrity":"/paper/2506.05641/integrity","json":"/paper/2506.05641/citation-record.json","paper":"/paper/2506.05641"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:20:23.314757Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.05641","last_updated":"2025-06-06T00:05:38Z","snapshot_observed_at":"2026-08-18T08:29:31.140649Z","submitted_at":"2025-06-06T00:05:38Z","title":"Projectable Models: One-Shot Generation of Small Specialized Transformers from Large Ones","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T10:20:23.314757Z"},"links":{"citing_paper":"/paper/2506.05641"},"observation_digest":"sha256:f7b887e683d180e2ffb873f223a5b716fab95254af79559bdd6410152d777ba5","observation_id":"6bee9b31-2d7a-411d-aea9-c1326c1eb397","resolution":{"observed_at":"2026-08-07T10:20:23.314757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:20:24.207552Z","title":"Hyperstyle: Stylegan inversion with hypernetworks for real image editing","venue":null,"work_id":"220baf7b-11a7-4770-bcaf-00e7ddd2495a","year":2022},"citing_paper":{"arxiv_id":"2506.05641","last_updated":"2025-06-06T00:05:38Z","snapshot_observed_at":"2026-08-18T08:29:31.140649Z","submitted_at":"2025-06-06T00:05:38Z","title":"Projectable Models: One-Shot Generation of Small Specialized Transformers from Large Ones","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T10:20:23.320469Z"},"links":{"citing_paper":"/paper/2506.05641"},"observation_digest":"sha256:c840bb345a8241e788968340eb36420d107c8bbab3fc682ad944f0361bc593b3","observation_id":"0d953fd4-9338-4c1a-abfe-bfa82963d17e","resolution":{"observed_at":"2026-08-07T10:20:24.212617Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:20:24.191947Z","title":"Generative pretraining from pixels","venue":null,"work_id":"17b6cee1-4f40-496a-bfac-af13027bf947","year":2020},"citing_paper":{"arxiv_id":"2506.05641","last_updated":"2025-06-06T00:05:38Z","snapshot_observed_at":"2026-08-18T08:29:31.140649Z","submitted_at":"2025-06-06T00:05:38Z","title":"Projectable Models: One-Shot Generation of Small Specialized Transformers from Large Ones","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T10:20:23.325266Z"},"links":{"citing_paper":"/paper/2506.05641"},"observation_digest":"sha256:c0695596c05d44c2e93144a5e8eeafadc8a25ddcf0249a7b41d962d3d8a6d4ac","observation_id":"916cede7-1b1b-463c-b869-797984d7d730","resolution":{"observed_at":"2026-08-07T10:20:24.196950Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:20:24.176926Z","title":null,"venue":null,"work_id":"a97080cd-b33d-41cf-ba90-ab342e7506e3","year":2020},"citing_paper":{"arxiv_id":"2506.05641","last_updated":"2025-06-06T00:05:38Z","snapshot_observed_at":"2026-08-18T08:29:31.140649Z","submitted_at":"2025-06-06T00:05:38Z","title":"Projectable Models: One-Shot Generation of Small Specialized Transformers from Large Ones","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T10:20:23.330119Z"},"links":{"citing_paper":"/paper/2506.05641"},"observation_digest":"sha256:c7fe2f8cffa0f2d1c13a0ecd36d478e2e42347bfd26380c19928003dbc6ecac3","observation_id":"715d2f6c-a967-4153-ac26-594df71f9257","resolution":{"observed_at":"2026-08-07T10:20:24.181790Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.19135","last_updated":"2025-01-25T00:11:26Z","snapshot_observed_at":"2026-08-20T23:26:40.436834Z","submitted_at":"2024-03-28T04:12:13Z","title":"Streamlining Redundant Layers to Compress Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.19135","snapshot_observed_at":"2026-08-07T10:20:23.334815Z","title":"Streamlining redundant layers to compress large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05641","last_updated":"2025-06-06T00:05:38Z","snapshot_observed_at":"2026-08-18T08:29:31.140649Z","submitted_at":"2025-06-06T00:05:38Z","title":"Projectable Models: One-Shot Generation of Small Specialized Transformers from Large Ones","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T10:20:23.334815Z"},"links":{"cited_paper":"/paper/2403.19135","citing_paper":"/paper/2506.05641"},"observation_digest":"sha256:61f58249a6bcb3aacbfbfb734365ceee7bcc95ad7ba53fb69e0f0d170c01907b","observation_id":"4cc4256c-a7b8-4d46-9afe-4135f99a4ca6","resolution":{"observed_at":"2026-08-07T10:20:23.334815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.11617","last_updated":"2022-10-20T22:23:23Z","snapshot_observed_at":"2026-08-19T03:42:10.022693Z","submitted_at":"2022-10-20T22:23:23Z","title":"Boosting Natural Language Generation from Instructions with Meta-Learning","version":1},"cited_work":{"arxiv_id":"2210.11617","doi":null,"metadata_source":"pith","pith_arxiv_id":"2210.11617","snapshot_observed_at":"2026-08-07T10:20:23.929048Z","title":"Boosting Natural Language Generation from Instructions with Meta-Learning","venue":"cs.CL","work_id":"6bb1e03c-91ce-4787-8dcf-bb163b3d0e9f","year":2022},"citing_paper":{"arxiv_id":"2506.05641","last_updated":"2025-06-06T00:05:38Z","snapshot_observed_at":"2026-08-18T08:29:31.140649Z","submitted_at":"2025-06-06T00:05:38Z","title":"Projectable Models: One-Shot Generation of Small Specialized Transformers from Large Ones","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T10:20:23.340824Z"},"links":{"cited_paper":"/paper/2210.11617","citing_paper":"/paper/2506.05641"},"observation_digest":"sha256:ca7e290c8173370820a7b0e05ff5294fddc14107110ebd62bd3b8c81ee875ff2","observation_id":"275a067c-b886-4fd5-ae53-c8023bd7de5b","resolution":{"observed_at":"2026-08-07T10:20:23.934119Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:20:23.346680Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2506.05641","last_updated":"2025-06-06T00:05:38Z","snapshot_observed_at":"2026-08-18T08:29:31.140649Z","submitted_at":"2025-06-06T00:05:38Z","title":"Projectable Models: One-Shot Generation of Small Specialized Transformers from Large Ones","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T10:20:23.346680Z"},"links":{"citing_paper":"/paper/2506.05641"},"observation_digest":"sha256:8c114481e4aef18b7f3cd50384bbb1f60e43d35d857c9caf1759148acb217c10","observation_id":"d699fe1f-2075-47aa-898e-b4be65cea802","resolution":{"observed_at":"2026-08-07T10:20:23.346680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:20:24.161716Z","title":"M., Tran, A","venue":null,"work_id":"eb49ec26-9d40-4fe9-b471-a33026cb9074","year":2022},"citing_paper":{"arxiv_id":"2506.05641","last_updated":"2025-06-06T00:05:38Z","snapshot_observed_at":"2026-08-18T08:29:31.140649Z","submitted_at":"2025-06-06T00:05:38Z","title":"Projectable Models: One-Shot Generation of Small Specialized Transformers from Large Ones","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T10:20:23.352660Z"},"links":{"citing_paper":"/paper/2506.05641"},"observation_digest":"sha256:74b91dfe502185127a60e6cc13bbd8ca66926943d781f8c4d9905da2e3dfe25a","observation_id":"b893d2be-ada6-4e84-9d62-fa5cbdf9b7b3","resolution":{"observed_at":"2026-08-07T10:20:24.166641Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.09106","last_updated":"2016-12-01T10:08:15Z","snapshot_observed_at":"2026-08-14T14:43:47.411225Z","submitted_at":"2016-09-27T05:57:00Z","title":"HyperNetworks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.09106","snapshot_observed_at":"2026-08-07T10:20:23.357151Z","title":"M., and Le, Q","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.05641","last_updated":"2025-06-06T00:05:38Z","snapshot_observed_at":"2026-08-18T08:29:31.140649Z","submitted_at":"2025-06-06T00:05:38Z","title":"Projectable Models: One-Shot Generation of Small Specialized Transformers from Large Ones","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T10:20:23.357151Z"},"links":{"cited_paper":"/paper/1609.09106","citing_paper":"/paper/2506.05641"},"observation_digest":"sha256:adc2ffeb7de606fb371f78895f390090774f189969a143f9f70827280962fc1f","observation_id":"7a8ead0f-a2de-40b5-9a6a-d8562cdae8d8","resolution":{"observed_at":"2026-08-07T10:20:23.357151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:20:23.362579Z","title":"Hyperprompt: Prompt-based task-conditioning of transformers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.05641","last_updated":"2025-06-06T00:05:38Z","snapshot_observed_at":"2026-08-18T08:29:31.140649Z","submitted_at":"2025-06-06T00:05:38Z","title":"Projectable Models: One-Shot Generation of Small Specialized Transformers from Large Ones","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T10:20:23.362579Z"},"links":{"citing_paper":"/paper/2506.05641"},"observation_digest":"sha256:f42321a47a481c94830942fa470a0132183d0865509a302f586448b131abd821","observation_id":"5d7068fc-e95b-4a07-a3c5-91f7637e81c9","resolution":{"observed_at":"2026-08-07T10:20:23.362579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.08304","last_updated":"2022-10-18T17:37:56Z","snapshot_observed_at":"2026-08-16T17:14:15.339962Z","submitted_at":"2022-03-15T22:39:53Z","title":"Hyperdecoders: Instance-specific decoders for multi-task NLP","version":3},"cited_work":{"arxiv_id":"2203.08304","doi":null,"metadata_source":"pith","pith_arxiv_id":"2203.08304","snapshot_observed_at":"2026-08-07T10:20:23.818141Z","title":"Hyperdecoders: Instance-specific decoders for multi-task NLP","venue":"cs.CL","work_id":"06fb934e-34d9-436a-973e-ccca9f0f99a4","year":2022},"citing_paper":{"arxiv_id":"2506.05641","last_updated":"2025-06-06T00:05:38Z","snapshot_observed_at":"2026-08-18T08:29:31.140649Z","submitted_at":"2025-06-06T00:05:38Z","title":"Projectable Models: One-Shot Generation of Small Specialized Transformers from Large Ones","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T10:20:23.367230Z"},"links":{"cited_paper":"/paper/2203.08304","citing_paper":"/paper/2506.05641"},"observation_digest":"sha256:5c6a25396eef133989d5662a2f9d9d619f709f5dcb8570278a22021081545104","observation_id":"cf7bb954-6bd5-489c-9a54-29b05de8df58","resolution":{"observed_at":"2026-08-07T10:20:23.823298Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10315","last_updated":"2023-05-24T22:30:30Z","snapshot_observed_at":"2026-08-17T15:08:32.178806Z","submitted_at":"2022-12-20T15:07:37Z","title":"HINT: Hypernetwork Instruction Tuning for Efficient Zero- & Few-Shot Generalisation","version":2},"cited_work":{"arxiv_id":"2212.10315","doi":null,"metadata_source":"pith","pith_arxiv_id":"2212.10315","snapshot_observed_at":"2026-08-07T10:20:23.797803Z","title":"HINT: Hypernetwork Instruction Tuning for Efficient Zero- & Few-Shot Generalisation","venue":"cs.CL","work_id":"aae964cb-8567-49ab-8842-f0385bbad7ed","year":2022},"citing_paper":{"arxiv_id":"2506.05641","last_updated":"2025-06-06T00:05:38Z","snapshot_observed_at":"2026-08-18T08:29:31.140649Z","submitted_at":"2025-06-06T00:05:38Z","title":"Projectable Models: One-Shot Generation of Small Specialized Transformers from Large Ones","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T10:20:23.372648Z"},"links":{"cited_paper":"/paper/2212.10315","citing_paper":"/paper/2506.05641"},"observation_digest":"sha256:8c3cd8157d909a6ac5c843e7114c18ea0b6dbb034a026142c31610878ff5d8a2","observation_id":"43eac6e2-e438-441b-a128-46d665c518d1","resolution":{"observed_at":"2026-08-07T10:20:23.802443Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:20:23.377682Z","title":"Scaling up gans for text-to-image synthesis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05641","last_updated":"2025-06-06T00:05:38Z","snapshot_observed_at":"2026-08-18T08:29:31.140649Z","submitted_at":"2025-06-06T00:05:38Z","title":"Projectable Models: One-Shot Generation of Small Specialized Transformers from Large Ones","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T10:20:23.377682Z"},"links":{"citing_paper":"/paper/2506.05641"},"observation_digest":"sha256:3bf5bee5285b96dff9c7d8949d4266cb3da1466a0b1fb17ca64d07e3a25863d7","observation_id":"86b4b6db-6770-48ab-86ef-a2137cca3ae3","resolution":{"observed_at":"2026-08-07T10:20:23.377682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:20:24.128687Z","title":"W., and Romero Soriano, A","venue":null,"work_id":"b245ddb7-c768-498b-8b4e-b8ca4d888b57","year":2021},"citing_paper":{"arxiv_id":"2506.05641","last_updated":"2025-06-06T00:05:38Z","snapshot_observed_at":"2026-08-18T08:29:31.140649Z","submitted_at":"2025-06-06T00:05:38Z","title":"Projectable Models: One-Shot Generation of Small Specialized Transformers from Large Ones","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T10:20:23.382346Z"},"links":{"citing_paper":"/paper/2506.05641"},"observation_digest":"sha256:6db4a234c7497982f19e9e41fa4a5c76c3f7833926a4c8e81e3599faa7bc94a4","observation_id":"de91b97f-d021-438a-984d-7936166ea8a4","resolution":{"observed_at":"2026-08-07T10:20:24.133499Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.06914","last_updated":"2024-03-12T15:52:14Z","snapshot_observed_at":"2026-08-16T14:10:53.221756Z","submitted_at":"2024-03-11T17:03:04Z","title":"MEND: Meta dEmonstratioN Distillation for Efficient and Effective In-Context Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.06914","snapshot_observed_at":"2026-08-07T10:20:23.386981Z","title":"Mend: Meta demonstration distillation for efficient and effective in-context learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05641","last_updated":"2025-06-06T00:05:38Z","snapshot_observed_at":"2026-08-18T08:29:31.140649Z","submitted_at":"2025-06-06T00:05:38Z","title":"Projectable Models: One-Shot Generation of Small Specialized Transformers from Large Ones","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T10:20:23.386981Z"},"links":{"cited_paper":"/paper/2403.06914","citing_paper":"/paper/2506.05641"},"observation_digest":"sha256:42339c54e0fc0bbb31fe25aa26ad4a0d0b98abf7a3410da72fe6669c8ca155c2","observation_id":"21e1d121-5618-406f-ad35-ba98fc176130","resolution":{"observed_at":"2026-08-07T10:20:23.386981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:20:24.113644Z","title":"Hart: Efficient adaptation via regularized autoregressive parameter generation","venue":null,"work_id":"9695af1c-3e16-423c-8fe3-7f5910787567","year":2023},"citing_paper":{"arxiv_id":"2506.05641","last_updated":"2025-06-06T00:05:38Z","snapshot_observed_at":"2026-08-18T08:29:31.140649Z","submitted_at":"2025-06-06T00:05:38Z","title":"Projectable Models: One-Shot Generation of Small Specialized Transformers from Large Ones","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T10:20:23.392191Z"},"links":{"citing_paper":"/paper/2506.05641"},"observation_digest":"sha256:6c2094e7a6a40ccab1e7952a37941b5e98bfedcfe1936b35db882eb9712126fc","observation_id":"2a602a46-a976-471e-9d45-cffde6b3741a","resolution":{"observed_at":"2026-08-07T10:20:24.118920Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.09152","last_updated":"2021-07-19T04:37:21Z","snapshot_observed_at":"2026-08-19T13:51:05.351076Z","submitted_at":"2020-09-19T03:23:26Z","title":"Weight Distillation: Transferring the Knowledge in Neural Network Parameters","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.09152","snapshot_observed_at":"2026-08-07T10:20:23.397051Z","title":"Weight distillation: Transferring the knowledge in neural network parameters","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2506.05641","last_updated":"2025-06-06T00:05:38Z","snapshot_observed_at":"2026-08-18T08:29:31.140649Z","submitted_at":"2025-06-06T00:05:38Z","title":"Projectable Models: One-Shot Generation of Small Specialized Transformers from Large Ones","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T10:20:23.397051Z"},"links":{"cited_paper":"/paper/2009.09152","citing_paper":"/paper/2506.05641"},"observation_digest":"sha256:14a6b7d853b249017fbb8cd211efe4d6b2a41258dda91ad92a76a7d51085784a","observation_id":"7543a2fd-2b45-4c67-a734-077fe83da26d","resolution":{"observed_at":"2026-08-07T10:20:23.397051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:20:24.098710Z","title":"and Wolf, L","venue":null,"work_id":"45a64f27-16cf-4fc1-b029-efc6f6c42e0c","year":2019},"citing_paper":{"arxiv_id":"2506.05641","last_updated":"2025-06-06T00:05:38Z","snapshot_observed_at":"2026-08-18T08:29:31.140649Z","submitted_at":"2025-06-06T00:05:38Z","title":"Projectable Models: One-Shot Generation of Small Specialized Transformers from Large Ones","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T10:20:23.401458Z"},"links":{"citing_paper":"/paper/2506.05641"},"observation_digest":"sha256:b463fc4a2be2f7ee56ba1e42faa3e5fd84f47ec81b19b1e2b789c99bcc100f8c","observation_id":"1995b6ab-1e12-460f-bfa4-9baa28950a70","resolution":{"observed_at":"2026-08-07T10:20:24.104202Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11627","last_updated":"2023-09-28T03:59:27Z","snapshot_observed_at":"2026-08-16T15:31:43.348408Z","submitted_at":"2023-05-19T12:10:53Z","title":"LLM-Pruner: On the Structural Pruning of Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.11627","snapshot_observed_at":"2026-08-07T10:20:23.406830Z","title":"Llm-pruner: On the structural pruning of large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05641","last_updated":"2025-06-06T00:05:38Z","snapshot_observed_at":"2026-08-18T08:29:31.140649Z","submitted_at":"2025-06-06T00:05:38Z","title":"Projectable Models: One-Shot Generation of Small Specialized Transformers from Large Ones","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T10:20:23.406830Z"},"links":{"cited_paper":"/paper/2305.11627","citing_paper":"/paper/2506.05641"},"observation_digest":"sha256:9390fb806e10b4c823257c54003eef1de355d104a13aa9a9613d32071469c77a","observation_id":"7be6e0e3-43ae-4cf7-91b1-9025df43c6bd","resolution":{"observed_at":"2026-08-07T10:20:23.406830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.04489","last_updated":"2021-06-08T16:16:40Z","snapshot_observed_at":"2026-08-16T18:18:41.474104Z","submitted_at":"2021-06-08T16:16:40Z","title":"Parameter-efficient Multi-task Fine-tuning for Transformers via Shared Hypernetworks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.04489","snapshot_observed_at":"2026-08-07T10:20:23.411520Z","title":"K., Ruder, S., Dehghani, M., and Henderson, J","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.05641","last_updated":"2025-06-06T00:05:38Z","snapshot_observed_at":"2026-08-18T08:29:31.140649Z","submitted_at":"2025-06-06T00:05:38Z","title":"Projectable Models: One-Shot Generation of Small Specialized Transformers from Large Ones","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T10:20:23.411520Z"},"links":{"cited_paper":"/paper/2106.04489","citing_paper":"/paper/2506.05641"},"observation_digest":"sha256:73bf71410fbca406ea61d4154da30785b7e637cf9eac80d85f6fe78eac3f2cbf","observation_id":"4e24ea5f-34e9-46ab-b714-0d79f5411bd6","resolution":{"observed_at":"2026-08-07T10:20:23.411520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:20:23.416110Z","title":"Learning to compress prompts with gist tokens","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05641","last_updated":"2025-06-06T00:05:38Z","snapshot_observed_at":"2026-08-18T08:29:31.140649Z","submitted_at":"2025-06-06T00:05:38Z","title":"Projectable Models: One-Shot Generation of Small Specialized Transformers from Large Ones","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T10:20:23.416110Z"},"links":{"citing_paper":"/paper/2506.05641"},"observation_digest":"sha256:39fae2ce73f77defa5cad5252fa448f43a1879caebf6de0a11fc87bae9f9786c","observation_id":"5a6f7cea-f05d-48be-bcb6-273463a35af1","resolution":{"observed_at":"2026-08-07T10:20:23.416110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:20:24.075443Z","title":"Hyperseg: Patch-wise hypernetwork for real-time semantic segmentation","venue":null,"work_id":"29d8846a-f82f-4c85-9952-278858e366f4","year":2021},"citing_paper":{"arxiv_id":"2506.05641","last_updated":"2025-06-06T00:05:38Z","snapshot_observed_at":"2026-08-18T08:29:31.140649Z","submitted_at":"2025-06-06T00:05:38Z","title":"Projectable Models: One-Shot Generation of Small Specialized Transformers from Large Ones","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T10:20:23.420255Z"},"links":{"citing_paper":"/paper/2506.05641"},"observation_digest":"sha256:cf2f1236d147660086d1de77c0766dba289c3138e1df85e235b6151ecf1c580a","observation_id":"6e90fde6-bde9-4a93-af25-d3cb7c3e90e9","resolution":{"observed_at":"2026-08-07T10:20:24.079707Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16817","last_updated":"2024-02-26T18:42:26Z","snapshot_observed_at":"2026-08-16T14:15:11.762411Z","submitted_at":"2024-02-26T18:42:26Z","title":"Investigating the Effectiveness of HyperTuning via Gisting","version":1},"cited_work":{"arxiv_id":"2402.16817","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.16817","snapshot_observed_at":"2026-08-07T10:20:23.734202Z","title":"Investigating the Effectiveness of HyperTuning via Gisting","venue":"cs.CL","work_id":"cfe9460b-0937-4502-aac8-d99412f1fc70","year":2024},"citing_paper":{"arxiv_id":"2506.05641","last_updated":"2025-06-06T00:05:38Z","snapshot_observed_at":"2026-08-18T08:29:31.140649Z","submitted_at":"2025-06-06T00:05:38Z","title":"Projectable Models: One-Shot Generation of Small Specialized Transformers from Large Ones","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T10:20:23.425212Z"},"links":{"cited_paper":"/paper/2402.16817","citing_paper":"/paper/2506.05641"},"observation_digest":"sha256:c38b3b735ac1c64520b921f0b096e5f03e51402f65f504b4cfb056a60b9de391","observation_id":"18a11af9-940f-4006-aff5-4dc8e24ac5b9","resolution":{"observed_at":"2026-08-07T10:20:23.740739Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:20:24.061081Z","title":"Hypertuning: Toward adapting large language models without back-propagation","venue":null,"work_id":"b70632c0-3e1c-4d1f-8b13-cb2610bebc78","year":2023},"citing_paper":{"arxiv_id":"2506.05641","last_updated":"2025-06-06T00:05:38Z","snapshot_observed_at":"2026-08-18T08:29:31.140649Z","submitted_at":"2025-06-06T00:05:38Z","title":"Projectable Models: One-Shot Generation of Small Specialized Transformers from Large Ones","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T10:20:23.429853Z"},"links":{"citing_paper":"/paper/2506.05641"},"observation_digest":"sha256:d13a951ecdcec342058472022b923e34648f936d87e31cec99bb235e093e181d","observation_id":"fda714b2-9a56-44bc-8f33-d90ac59faf0c","resolution":{"observed_at":"2026-08-07T10:20:24.066240Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:20:23.434658Z","title":"Language models are unsupervised multitask learners","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.05641","last_updated":"2025-06-06T00:05:38Z","snapshot_observed_at":"2026-08-18T08:29:31.140649Z","submitted_at":"2025-06-06T00:05:38Z","title":"Projectable Models: One-Shot Generation of Small Specialized Transformers from Large Ones","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T10:20:23.434658Z"},"links":{"citing_paper":"/paper/2506.05641"},"observation_digest":"sha256:8f61115729f6d2302a9fc8fed1a0b033eb713ea25cf471bf77c6a76a8009dfad","observation_id":"5d23275c-0f2c-41db-aa97-77714cb430f8","resolution":{"observed_at":"2026-08-07T10:20:23.434658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:20:23.438991Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.05641","last_updated":"2025-06-06T00:05:38Z","snapshot_observed_at":"2026-08-18T08:29:31.140649Z","submitted_at":"2025-06-06T00:05:38Z","title":"Projectable Models: One-Shot Generation of Small Specialized Transformers from Large Ones","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T10:20:23.438991Z"},"links":{"citing_paper":"/paper/2506.05641"},"observation_digest":"sha256:549a44858bf921181f9e14fc129bdd7093a56fcf0e0078d4e73ddd0096c192f0","observation_id":"e0fbae4a-22a1-4de7-aef7-a07c02a75157","resolution":{"observed_at":"2026-08-07T10:20:23.438991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:20:23.443960Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.05641","last_updated":"2025-06-06T00:05:38Z","snapshot_observed_at":"2026-08-18T08:29:31.140649Z","submitted_at":"2025-06-06T00:05:38Z","title":"Projectable Models: One-Shot Generation of Small Specialized Transformers from Large Ones","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T10:20:23.443960Z"},"links":{"citing_paper":"/paper/2506.05641"},"observation_digest":"sha256:4c72efe132eefa945c8c7e2f96494ff9e6ca410fc434dcbbcbd118f44c6be96b","observation_id":"11cb2282-9177-43e1-985b-80f56214a114","resolution":{"observed_at":"2026-08-07T10:20:23.443960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.09299","last_updated":"2023-12-14T19:08:56Z","snapshot_observed_at":"2026-08-16T14:34:37.658133Z","submitted_at":"2023-12-14T19:08:56Z","title":"Weight subcloning: direct initialization of transformers using larger pretrained ones","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.09299","snapshot_observed_at":"2026-08-07T10:20:23.449360Z","title":"Weight subcloning: direct initialization of transformers using larger pretrained ones","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05641","last_updated":"2025-06-06T00:05:38Z","snapshot_observed_at":"2026-08-18T08:29:31.140649Z","submitted_at":"2025-06-06T00:05:38Z","title":"Projectable Models: One-Shot Generation of Small Specialized Transformers from Large Ones","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T10:20:23.449360Z"},"links":{"cited_paper":"/paper/2312.09299","citing_paper":"/paper/2506.05641"},"observation_digest":"sha256:8a52304cc30437c5020bab9c4dfea8b94e08f968204dcf27269468caa56b25cd","observation_id":"e7114082-f259-48a8-87f8-7a48ba4fbcec","resolution":{"observed_at":"2026-08-07T10:20:23.449360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:20:24.019862Z","title":"Implicit neural representations with periodic activation functions","venue":null,"work_id":"a55c3121-a867-45b1-9eb6-47d7ff623ab5","year":2020},"citing_paper":{"arxiv_id":"2506.05641","last_updated":"2025-06-06T00:05:38Z","snapshot_observed_at":"2026-08-18T08:29:31.140649Z","submitted_at":"2025-06-06T00:05:38Z","title":"Projectable Models: One-Shot Generation of Small Specialized Transformers from Large Ones","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T10:20:23.454384Z"},"links":{"citing_paper":"/paper/2506.05641"},"observation_digest":"sha256:209d523edf070b8d5f21a78be096df087b52979dec70f94acbe4acf1579b4b35","observation_id":"8fedaeba-9c02-41dc-bbb2-d6558d894bd0","resolution":{"observed_at":"2026-08-07T10:20:24.024695Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:20:24.006383Z","title":"K., Tabor, J., Trzci \\'n ski, T., et al","venue":null,"work_id":"96031728-ff05-43d1-ae08-e30b0e983b53","year":2022},"citing_paper":{"arxiv_id":"2506.05641","last_updated":"2025-06-06T00:05:38Z","snapshot_observed_at":"2026-08-18T08:29:31.140649Z","submitted_at":"2025-06-06T00:05:38Z","title":"Projectable Models: One-Shot Generation of Small Specialized Transformers from Large Ones","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T10:20:23.459631Z"},"links":{"citing_paper":"/paper/2506.05641"},"observation_digest":"sha256:d391b1cf9154b7a25fa80add53b1fdaff392dfd5503a0c0de0566790fc6215b4","observation_id":"ee564d52-2cc6-430b-982e-d0a93c16ee8e","resolution":{"observed_at":"2026-08-07T10:20:24.010760Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04317","last_updated":"2024-11-04T13:02:33Z","snapshot_observed_at":"2026-08-18T15:06:01.996483Z","submitted_at":"2024-03-07T08:34:57Z","title":"Online Adaptation of Language Models with a Memory of Amortized Contexts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04317","snapshot_observed_at":"2026-08-07T10:20:23.464106Z","title":"W., and Schwarz, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05641","last_updated":"2025-06-06T00:05:38Z","snapshot_observed_at":"2026-08-18T08:29:31.140649Z","submitted_at":"2025-06-06T00:05:38Z","title":"Projectable Models: One-Shot Generation of Small Specialized Transformers from Large Ones","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T10:20:23.464106Z"},"links":{"cited_paper":"/paper/2403.04317","citing_paper":"/paper/2506.05641"},"observation_digest":"sha256:087a0ac18ae2dd5d8bc9e9bda33acbf1129cd23f970ab9cd5e5139674e3ea239","observation_id":"9a85040c-d887-405b-933e-432fe6ffff29","resolution":{"observed_at":"2026-08-07T10:20:23.464106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05964","last_updated":"2024-04-07T13:03:58Z","snapshot_observed_at":"2026-08-18T13:11:45.136886Z","submitted_at":"2024-02-05T12:16:28Z","title":"A Survey on Transformer Compression","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.05964","snapshot_observed_at":"2026-08-07T10:20:23.468653Z","title":"A survey on transformer compression","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05641","last_updated":"2025-06-06T00:05:38Z","snapshot_observed_at":"2026-08-18T08:29:31.140649Z","submitted_at":"2025-06-06T00:05:38Z","title":"Projectable Models: One-Shot Generation of Small Specialized Transformers from Large Ones","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T10:20:23.468653Z"},"links":{"cited_paper":"/paper/2402.05964","citing_paper":"/paper/2506.05641"},"observation_digest":"sha256:33fc1957979b80345ffc35072543b890d9495ce40f9b633fb05a4b93504bc153","observation_id":"dcd730a1-9d8a-4eb8-909d-20fbf5061899","resolution":{"observed_at":"2026-08-07T10:20:23.468653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:20:23.991677Z","title":"Hypergrid transformers: Towards a single model for multiple tasks","venue":null,"work_id":"257adb63-cbfb-4785-a332-cc1c4239b9e5","year":2020},"citing_paper":{"arxiv_id":"2506.05641","last_updated":"2025-06-06T00:05:38Z","snapshot_observed_at":"2026-08-18T08:29:31.140649Z","submitted_at":"2025-06-06T00:05:38Z","title":"Projectable Models: One-Shot Generation of Small Specialized Transformers from Large Ones","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T10:20:23.474236Z"},"links":{"citing_paper":"/paper/2506.05641"},"observation_digest":"sha256:6f2820ad31f082c440ae6efc036f31be40fbae3155598b643c9e0967b0b48ab4","observation_id":"c39bb78e-fb8c-454e-835d-73e4588b7c42","resolution":{"observed_at":"2026-08-07T10:20:23.996889Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:20:23.478703Z","title":"Neural discrete representation learning","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.05641","last_updated":"2025-06-06T00:05:38Z","snapshot_observed_at":"2026-08-18T08:29:31.140649Z","submitted_at":"2025-06-06T00:05:38Z","title":"Projectable Models: One-Shot Generation of Small Specialized Transformers from Large Ones","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T10:20:23.478703Z"},"links":{"citing_paper":"/paper/2506.05641"},"observation_digest":"sha256:c8b67267308b528cea134c95844c79b46d4f7f0cd822032e3255cfefe37d65c4","observation_id":"32d1dfa4-b204-442a-bc48-ab1ce2b3b453","resolution":{"observed_at":"2026-08-07T10:20:23.478703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:20:23.968105Z","title":"Example-based hypernetworks for multi-source adaptation to unseen domains","venue":null,"work_id":"43e907c6-7144-4128-87e7-dd658d28b822","year":2023},"citing_paper":{"arxiv_id":"2506.05641","last_updated":"2025-06-06T00:05:38Z","snapshot_observed_at":"2026-08-18T08:29:31.140649Z","submitted_at":"2025-06-06T00:05:38Z","title":"Projectable Models: One-Shot Generation of Small Specialized Transformers from Large Ones","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T10:20:23.483346Z"},"links":{"citing_paper":"/paper/2506.05641"},"observation_digest":"sha256:d80852af25efb00f8d9e5e318c5455ecca12f8d597ac48586aa636066e8eb30c","observation_id":"cbfe6837-2078-4eca-9805-9b989624ca24","resolution":{"observed_at":"2026-08-07T10:20:23.972941Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1906.00695","last_updated":"2022-04-11T14:58:15Z","snapshot_observed_at":"2026-08-18T18:36:42.694812Z","submitted_at":"2019-06-03T10:45:08Z","title":"Continual learning with hypernetworks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.00695","snapshot_observed_at":"2026-08-07T10:20:23.488791Z","title":"F., and Sacramento, J","venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"2506.05641","last_updated":"2025-06-06T00:05:38Z","snapshot_observed_at":"2026-08-18T08:29:31.140649Z","submitted_at":"2025-06-06T00:05:38Z","title":"Projectable Models: One-Shot Generation of Small Specialized Transformers from Large Ones","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T10:20:23.488791Z"},"links":{"cited_paper":"/paper/1906.00695","citing_paper":"/paper/2506.05641"},"observation_digest":"sha256:468ab437f7905e467057ea093198df6f00bfd7004669622c63f92c511d674417","observation_id":"683114a4-2df1-4d58-8ce5-d93720fcb929","resolution":{"observed_at":"2026-08-07T10:20:23.488791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.02279","last_updated":"2023-06-29T14:04:26Z","snapshot_observed_at":"2026-08-16T15:35:54.723234Z","submitted_at":"2023-05-03T17:15:58Z","title":"Learngene: Inheriting Condensed Knowledge from the Ancestry Model to Descendant Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.02279","snapshot_observed_at":"2026-08-07T10:20:23.493636Z","title":"Learngene: Inheriting condensed knowledge from the ancestry model to descendant models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05641","last_updated":"2025-06-06T00:05:38Z","snapshot_observed_at":"2026-08-18T08:29:31.140649Z","submitted_at":"2025-06-06T00:05:38Z","title":"Projectable Models: One-Shot Generation of Small Specialized Transformers from Large Ones","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T10:20:23.493636Z"},"links":{"cited_paper":"/paper/2305.02279","citing_paper":"/paper/2506.05641"},"observation_digest":"sha256:31dfc68f6cb66832b083985a6dbf5a7242481f8636ab5300ceaa51563767568d","observation_id":"9da367a4-6e4d-4f94-906e-d6db61245e1d","resolution":{"observed_at":"2026-08-07T10:20:23.493636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09748","last_updated":"2024-02-15T06:58:30Z","snapshot_observed_at":"2026-08-16T14:18:24.674010Z","submitted_at":"2024-02-15T06:58:30Z","title":"Model Compression and Efficient Inference for Large Language Models: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09748","snapshot_observed_at":"2026-08-07T10:20:23.498590Z","title":"Model compression and efficient inference for large language models: A survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05641","last_updated":"2025-06-06T00:05:38Z","snapshot_observed_at":"2026-08-18T08:29:31.140649Z","submitted_at":"2025-06-06T00:05:38Z","title":"Projectable Models: One-Shot Generation of Small Specialized Transformers from Large Ones","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T10:20:23.498590Z"},"links":{"cited_paper":"/paper/2402.09748","citing_paper":"/paper/2506.05641"},"observation_digest":"sha256:5a9aaf77aaa6416edfa3e77db02b85e5250df42891af886bade4cc9c074b7468","observation_id":"672c3344-f7a9-49ba-95cb-9c901ddbcfe5","resolution":{"observed_at":"2026-08-07T10:20:23.498590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06694","last_updated":"2024-04-11T01:18:06Z","snapshot_observed_at":"2026-08-16T14:53:24.619970Z","submitted_at":"2023-10-10T15:13:30Z","title":"Sheared LLaMA: Accelerating Language Model Pre-training via Structured Pruning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06694","snapshot_observed_at":"2026-08-07T10:20:23.503135Z","title":"Sheared llama: Accelerating language model pre-training via structured pruning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05641","last_updated":"2025-06-06T00:05:38Z","snapshot_observed_at":"2026-08-18T08:29:31.140649Z","submitted_at":"2025-06-06T00:05:38Z","title":"Projectable Models: One-Shot Generation of Small Specialized Transformers from Large Ones","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T10:20:23.503135Z"},"links":{"cited_paper":"/paper/2310.06694","citing_paper":"/paper/2506.05641"},"observation_digest":"sha256:743d1307c371e01e5dd9c8fa41a2a28849e4719d6ce201be798061fa0b1b2347","observation_id":"ae4335e1-87c5-4a7d-b29c-32a55d66cbc2","resolution":{"observed_at":"2026-08-07T10:20:23.503135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.18823","last_updated":"2023-11-30T18:58:26Z","snapshot_observed_at":"2026-08-20T09:36:48.779761Z","submitted_at":"2023-11-30T18:58:26Z","title":"Initializing Models with Larger Ones","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.18823","snapshot_observed_at":"2026-08-07T10:20:23.507736Z","title":"Initializing models with larger ones","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05641","last_updated":"2025-06-06T00:05:38Z","snapshot_observed_at":"2026-08-18T08:29:31.140649Z","submitted_at":"2025-06-06T00:05:38Z","title":"Projectable Models: One-Shot Generation of Small Specialized Transformers from Large Ones","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T10:20:23.507736Z"},"links":{"cited_paper":"/paper/2311.18823","citing_paper":"/paper/2506.05641"},"observation_digest":"sha256:853a5a1ce4836bd8aca0a181bbd267cc6876da52c8b6501baf1250b6a2720b42","observation_id":"0d68f145-6488-44c9-aefe-85cb92153452","resolution":{"observed_at":"2026-08-07T10:20:23.507736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00420","last_updated":"2021-06-15T05:50:01Z","snapshot_observed_at":"2026-08-16T18:54:41.402428Z","submitted_at":"2021-01-02T10:50:23Z","title":"Learning to Generate Task-Specific Adapters from Task Description","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00420","snapshot_observed_at":"2026-08-07T10:20:23.512717Z","title":"and Ren, X","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.05641","last_updated":"2025-06-06T00:05:38Z","snapshot_observed_at":"2026-08-18T08:29:31.140649Z","submitted_at":"2025-06-06T00:05:38Z","title":"Projectable Models: One-Shot Generation of Small Specialized Transformers from Large Ones","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T10:20:23.512717Z"},"links":{"cited_paper":"/paper/2101.00420","citing_paper":"/paper/2506.05641"},"observation_digest":"sha256:8f9b2eabeb56dc64c6ff4ff3e0205b089c8d4a6d7d4a3660819552f380b8c287","observation_id":"5c73e39c-e67a-4057-8758-4ba43943c7b7","resolution":{"observed_at":"2026-08-07T10:20:23.512717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.05749","last_updated":"2020-12-18T18:01:04Z","snapshot_observed_at":"2026-08-17T15:44:23.287396Z","submitted_at":"2018-10-12T22:21:05Z","title":"Graph HyperNetworks for Neural Architecture Search","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.05749","snapshot_observed_at":"2026-08-07T10:20:23.517790Z","title":"Graph hypernetworks for neural architecture search","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.05641","last_updated":"2025-06-06T00:05:38Z","snapshot_observed_at":"2026-08-18T08:29:31.140649Z","submitted_at":"2025-06-06T00:05:38Z","title":"Projectable Models: One-Shot Generation of Small Specialized Transformers from Large Ones","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T10:20:23.517790Z"},"links":{"cited_paper":"/paper/1810.05749","citing_paper":"/paper/2506.05641"},"observation_digest":"sha256:5372cd6c2cbd338019f9a91c4f4eb2f187f1eb71312f57bb439b1edd9fa9970a","observation_id":"84fcaa74-7a48-4441-b0e1-242d3319bb33","resolution":{"observed_at":"2026-08-07T10:20:23.517790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:20:23.522276Z","title":"Adding conditional control to text-to-image diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05641","last_updated":"2025-06-06T00:05:38Z","snapshot_observed_at":"2026-08-18T08:29:31.140649Z","submitted_at":"2025-06-06T00:05:38Z","title":"Projectable Models: One-Shot Generation of Small Specialized Transformers from Large Ones","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T10:20:23.522276Z"},"links":{"citing_paper":"/paper/2506.05641"},"observation_digest":"sha256:f005fc0da88927915592a58972ae7cbe8a9dd8f1bf5bb285ae02201ab810b843","observation_id":"da0e948b-b922-44f4-97a2-54290bd35183","resolution":{"observed_at":"2026-08-07T10:20:23.522276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12656","last_updated":"2024-07-25T06:28:01Z","snapshot_observed_at":"2026-08-16T14:17:06.804304Z","submitted_at":"2024-02-20T02:09:55Z","title":"HyperMoE: Towards Better Mixture of Experts via Transferring Among Experts","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12656","snapshot_observed_at":"2026-08-07T10:20:23.528274Z","title":"Hypermoe: Towards better mixture of experts via transferring among experts","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05641","last_updated":"2025-06-06T00:05:38Z","snapshot_observed_at":"2026-08-18T08:29:31.140649Z","submitted_at":"2025-06-06T00:05:38Z","title":"Projectable Models: One-Shot Generation of Small Specialized Transformers from Large Ones","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T10:20:23.528274Z"},"links":{"cited_paper":"/paper/2402.12656","citing_paper":"/paper/2506.05641"},"observation_digest":"sha256:54dd76b9d6516df9d3238f2f11c9d046c9641184923a6375266d5d37a5ed22cd","observation_id":"0ebd817a-a2be-47aa-8a36-9740174c8161","resolution":{"observed_at":"2026-08-07T10:20:23.528274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.05641","last_updated":"2025-06-06T00:05:38Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-18T08:29:31.140649Z","submitted_at":"2025-06-06T00:05:38Z","title":"Projectable Models: One-Shot Generation of Small Specialized Transformers from Large Ones"},"reference_resolution":{"displayed":44,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":28,"verified_exact":4,"verified_fuzzy":12},"total_outbound_references":44},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 0 inbound Pith citation observations for arXiv:2506.05641."}