{"as_of":"2026-08-08T23:35:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7de4e006297a49da0ae83ee11d9b985d9ee70df0bec0bb9a613f4571b1adb977","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":16,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":16,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":16,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":16,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T16:20:38.370936Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T20:58:58.624838Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2109.10686","last_updated":"2022-01-30T16:42:46Z","snapshot_observed_at":"2026-07-06T11:50:13.578611Z","submitted_at":"2021-09-22T12:29:15Z","title":"Scale Efficiently: Insights from Pre-training and Fine-tuning Transformers","version":2},"cited_work":{"arxiv_id":"2109.10686","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2109.10686","snapshot_observed_at":"2026-07-03T20:58:58.624838Z","title":"Scale efficiently: Insights from pre-training and fine-tuning transformers.arXiv preprint arXiv:2109.10686","venue":null,"work_id":"e146a2de-a3c4-40f4-b460-0fe2d6535329","year":2021},"citing_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"reference_index":203,"source":"arxiv_source","source_observed_at":"2026-05-12T23:14:25.431471Z"},"links":{"cited_paper":"/paper/2109.10686","citing_paper":"/paper/2202.08906"},"observation_digest":"sha256:17eba526db338cbf0b1be42c7e80a0b81111096950aa0bbffee48462e9056fc7","observation_id":"f5c8e044-8d91-4c13-8ae6-394d6e6722d2","resolution":{"observed_at":"2026-05-12T23:14:25.884221Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.10686","last_updated":"2022-01-30T16:42:46Z","snapshot_observed_at":"2026-07-06T11:50:13.578611Z","submitted_at":"2021-09-22T12:29:15Z","title":"Scale Efficiently: Insights from Pre-training and Fine-tuning Transformers","version":2},"cited_work":{"arxiv_id":"2109.10686","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2109.10686","snapshot_observed_at":"2026-07-03T20:58:58.624838Z","title":"Scale efficiently: Insights from pre-training and fine-tuning transformers.arXiv preprint arXiv:2109.10686","venue":null,"work_id":"e146a2de-a3c4-40f4-b460-0fe2d6535329","year":2021},"citing_paper":{"arxiv_id":"2303.17564","last_updated":"2023-12-21T06:21:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-30T17:30:36Z","title":"BloombergGPT: A Large Language Model for Finance","version":3},"reference_index":114,"source":"arxiv_source","source_observed_at":"2026-05-13T23:19:46.231145Z"},"links":{"cited_paper":"/paper/2109.10686","citing_paper":"/paper/2303.17564"},"observation_digest":"sha256:1253a449a4d43a276a09f41392aaf058ef0b504c29bd6927061047c930a33e94","observation_id":"7cbb63ad-5a56-42f2-8554-9bf072061909","resolution":{"observed_at":"2026-05-13T23:19:46.822979Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.10686","last_updated":"2022-01-30T16:42:46Z","snapshot_observed_at":"2026-07-06T11:50:13.578611Z","submitted_at":"2021-09-22T12:29:15Z","title":"Scale Efficiently: Insights from Pre-training and Fine-tuning Transformers","version":2},"cited_work":{"arxiv_id":"2109.10686","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2109.10686","snapshot_observed_at":"2026-07-03T20:58:58.624838Z","title":"Scale efficiently: Insights from pre-training and fine-tuning transformers.arXiv preprint arXiv:2109.10686","venue":null,"work_id":"e146a2de-a3c4-40f4-b460-0fe2d6535329","year":2021},"citing_paper":{"arxiv_id":"2305.16264","last_updated":"2025-06-28T00:00:06Z","snapshot_observed_at":"2026-08-08T06:18:27.640980Z","submitted_at":"2023-05-25T17:18:55Z","title":"Scaling Data-Constrained Language Models","version":5},"reference_index":113,"source":"pdf_text","source_observed_at":"2026-05-18T01:35:21.150772Z"},"links":{"cited_paper":"/paper/2109.10686","citing_paper":"/paper/2305.16264"},"observation_digest":"sha256:f8694f9d2c9c1900e30fd4e3d9d698012ca16a0f7a057085a80d202c4dbcc644","observation_id":"5bdfa959-e310-4485-baac-dd5456fe053f","resolution":{"observed_at":"2026-05-18T01:35:21.396172Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.10686","last_updated":"2022-01-30T16:42:46Z","snapshot_observed_at":"2026-07-06T11:50:13.578611Z","submitted_at":"2021-09-22T12:29:15Z","title":"Scale Efficiently: Insights from Pre-training and Fine-tuning Transformers","version":2},"cited_work":{"arxiv_id":"2109.10686","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2109.10686","snapshot_observed_at":"2026-07-03T20:58:58.624838Z","title":"Scale efficiently: Insights from pre-training and fine-tuning transformers.arXiv preprint arXiv:2109.10686","venue":null,"work_id":"e146a2de-a3c4-40f4-b460-0fe2d6535329","year":2021},"citing_paper":{"arxiv_id":"2403.07815","last_updated":"2024-11-04T17:42:45Z","snapshot_observed_at":"2026-07-06T17:43:27.034067Z","submitted_at":"2024-03-12T16:53:54Z","title":"Chronos: Learning the Language of Time Series","version":3},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-05-13T08:27:23.298009Z"},"links":{"cited_paper":"/paper/2109.10686","citing_paper":"/paper/2403.07815"},"observation_digest":"sha256:76849550527d4048aec0f2526897bac5dda4707d334c5f49d79a09da9b1ff57b","observation_id":"4ac6baf2-3cc7-48da-a810-1e916a881b4e","resolution":{"observed_at":"2026-05-13T08:27:23.392866Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.10686","last_updated":"2022-01-30T16:42:46Z","snapshot_observed_at":"2026-07-06T11:50:13.578611Z","submitted_at":"2021-09-22T12:29:15Z","title":"Scale Efficiently: Insights from Pre-training and Fine-tuning Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.10686","snapshot_observed_at":"2026-08-08T16:20:38.370936Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-08T16:14:07.851679Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.370936Z"},"links":{"cited_paper":"/paper/2109.10686","citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:1b55e950012b8443b8d15e8d29a84d99a8b5cf32cca56bcf3efec049fc9e3242","observation_id":"f22ca0db-c68d-4623-9a52-b12d456b3865","resolution":{"observed_at":"2026-08-08T16:20:38.370936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.10686","last_updated":"2022-01-30T16:42:46Z","snapshot_observed_at":"2026-07-06T11:50:13.578611Z","submitted_at":"2021-09-22T12:29:15Z","title":"Scale Efficiently: Insights from Pre-training and Fine-tuning Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.10686","snapshot_observed_at":"2026-08-07T22:34:08.126213Z","title":"W., Narang, S., Yogatama, D., Vaswani, A., and Metzler, D","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.12170","last_updated":"2025-05-28T12:57:47Z","snapshot_observed_at":"2026-08-07T23:11:12.819339Z","submitted_at":"2025-02-13T10:26:27Z","title":"MUDDFormer: Breaking Residual Bottlenecks in Transformers via Multiway Dynamic Dense Connections","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T22:34:08.126213Z"},"links":{"cited_paper":"/paper/2109.10686","citing_paper":"/paper/2502.12170"},"observation_digest":"sha256:274a676a3c8c6db34d8716f81dbac6d8b06e2c8df5915782ec0437045fe1ac9f","observation_id":"ceb5ec8e-0c97-4438-a924-013435778864","resolution":{"observed_at":"2026-08-07T22:34:08.126213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.10686","last_updated":"2022-01-30T16:42:46Z","snapshot_observed_at":"2026-07-06T11:50:13.578611Z","submitted_at":"2021-09-22T12:29:15Z","title":"Scale Efficiently: Insights from Pre-training and Fine-tuning Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.10686","snapshot_observed_at":"2026-08-07T15:32:18.828359Z","title":"W., Narang, S., Yogatama, D., Vaswani, A., and Metzler, D","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.15252","last_updated":"2025-05-21T08:28:56Z","snapshot_observed_at":"2026-08-08T08:30:56.523574Z","submitted_at":"2025-05-21T08:28:56Z","title":"An Efficient Private GPT Never Autoregressively Decodes","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T15:32:18.828359Z"},"links":{"cited_paper":"/paper/2109.10686","citing_paper":"/paper/2505.15252"},"observation_digest":"sha256:62b0bb87f7e48296502ef5d49be55ed0def191f8f1a061004fbfd1b8ae482398","observation_id":"4b3b7d66-e4a5-42fb-8d59-7cbebfbb1b7c","resolution":{"observed_at":"2026-08-07T15:32:18.828359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.10686","last_updated":"2022-01-30T16:42:46Z","snapshot_observed_at":"2026-07-06T11:50:13.578611Z","submitted_at":"2021-09-22T12:29:15Z","title":"Scale Efficiently: Insights from Pre-training and Fine-tuning Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.10686","snapshot_observed_at":"2026-08-07T14:11:11.182755Z","title":"Scale ef- ficiently: Insights from pre-training and fine-tuning trans- formers.arXiv preprint arXiv:2109.10686, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.19990","last_updated":"2025-05-28T11:35:26Z","snapshot_observed_at":"2026-08-07T13:59:43.810989Z","submitted_at":"2025-05-26T13:45:27Z","title":"Progressive Scaling Visual Object Tracking","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:11.182755Z"},"links":{"cited_paper":"/paper/2109.10686","citing_paper":"/paper/2505.19990"},"observation_digest":"sha256:dee3c79e3ab3497a3324af1dd1f00f4af90ce71b1c014c6d2cb49f2220de6cd7","observation_id":"61d5f9ca-7202-40c5-8fdd-4c14bb08c6b2","resolution":{"observed_at":"2026-08-07T14:11:11.182755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.10686","last_updated":"2022-01-30T16:42:46Z","snapshot_observed_at":"2026-07-06T11:50:13.578611Z","submitted_at":"2021-09-22T12:29:15Z","title":"Scale Efficiently: Insights from Pre-training and Fine-tuning Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.10686","snapshot_observed_at":"2026-08-07T06:05:29.762633Z","title":"W., Narang, S., Yogatama, D., Vaswani, A., and Metzler, D","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.06105","last_updated":"2025-06-09T14:19:59Z","snapshot_observed_at":"2026-08-07T05:58:02.284272Z","submitted_at":"2025-06-06T14:11:27Z","title":"Text-to-LoRA: Instant Transformer Adaption","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T06:05:29.762633Z"},"links":{"cited_paper":"/paper/2109.10686","citing_paper":"/paper/2506.06105"},"observation_digest":"sha256:785641e7ab2141efdcf72defb10e748985a57d4ea58a23eaa4786694d86b9d39","observation_id":"bd6fc5f9-c955-458c-9330-f74c042996d9","resolution":{"observed_at":"2026-08-07T06:05:29.762633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.10686","last_updated":"2022-01-30T16:42:46Z","snapshot_observed_at":"2026-07-06T11:50:13.578611Z","submitted_at":"2021-09-22T12:29:15Z","title":"Scale Efficiently: Insights from Pre-training and Fine-tuning Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.10686","snapshot_observed_at":"2026-08-07T04:16:22.020141Z","title":"W., Narang, S., Yogatama, D., Vaswani, A., and Metzler, D","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.21570","last_updated":"2025-06-12T18:39:38Z","snapshot_observed_at":"2026-08-07T10:53:46.005293Z","submitted_at":"2025-06-12T18:39:38Z","title":"Random Initialization Can't Catch Up: The Advantage of Language Model Transfer for Time Series Forecasting","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T04:16:22.020141Z"},"links":{"cited_paper":"/paper/2109.10686","citing_paper":"/paper/2506.21570"},"observation_digest":"sha256:51d3e084a1804eea87f5f19c0240db335e9ee1206da6c253a6a233966ec38cdb","observation_id":"7f3d18c2-6685-4b5f-a35a-2ac7f7ab6ca8","resolution":{"observed_at":"2026-08-07T04:16:22.020141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.10686","last_updated":"2022-01-30T16:42:46Z","snapshot_observed_at":"2026-07-06T11:50:13.578611Z","submitted_at":"2021-09-22T12:29:15Z","title":"Scale Efficiently: Insights from Pre-training and Fine-tuning Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.10686","snapshot_observed_at":"2026-08-06T19:10:30.753766Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.06445","last_updated":"2026-07-21T16:59:32Z","snapshot_observed_at":"2026-08-08T03:00:34.577740Z","submitted_at":"2025-07-08T23:07:33Z","title":"Can Interpretation Predict Behavior on Unseen Data?","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T19:10:30.753766Z"},"links":{"cited_paper":"/paper/2109.10686","citing_paper":"/paper/2507.06445"},"observation_digest":"sha256:8ad01513db1b18e5002bac7d666afe5f7c090b6e424706ca91940615ad1fda40","observation_id":"348a92a7-7bae-4d58-bf8f-fbcd81cf3ceb","resolution":{"observed_at":"2026-08-06T19:10:30.753766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.10686","last_updated":"2022-01-30T16:42:46Z","snapshot_observed_at":"2026-07-06T11:50:13.578611Z","submitted_at":"2021-09-22T12:29:15Z","title":"Scale Efficiently: Insights from Pre-training and Fine-tuning Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.10686","snapshot_observed_at":"2026-08-05T19:29:00.389785Z","title":"Scale efficiently: Insights from pretraining and finetuning transformers,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.12464","last_updated":"2025-08-17T18:27:54Z","snapshot_observed_at":"2026-08-06T19:31:58.152011Z","submitted_at":"2025-08-17T18:27:54Z","title":"On the Fitness Landscape in the $NK$ Model","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-05T19:29:00.389785Z"},"links":{"cited_paper":"/paper/2109.10686","citing_paper":"/paper/2508.12464"},"observation_digest":"sha256:a6cd18dc8470660dd6d1113eeefdbc50fa327116adb80330747ee58da69f3206","observation_id":"080ef9b7-cddb-4152-bcc5-4922789c9383","resolution":{"observed_at":"2026-08-05T19:29:00.389785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.10686","last_updated":"2022-01-30T16:42:46Z","snapshot_observed_at":"2026-07-06T11:50:13.578611Z","submitted_at":"2021-09-22T12:29:15Z","title":"Scale Efficiently: Insights from Pre-training and Fine-tuning Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.10686","snapshot_observed_at":"2026-08-04T09:14:46.158438Z","title":"Scale efficiently: Insights from pre-training and fine-tuning trans- formers,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.16658","last_updated":"2026-05-27T22:39:15Z","snapshot_observed_at":"2026-08-04T09:14:35.954475Z","submitted_at":"2025-10-18T22:45:59Z","title":"Large-Scale AI and Foundation Models for Neuroscience: A Comprehensive Review","version":3},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-04T09:14:46.158438Z"},"links":{"cited_paper":"/paper/2109.10686","citing_paper":"/paper/2510.16658"},"observation_digest":"sha256:04f713e821185597d6536c2021ffa50e7247ac6c5734fc19cf2c52dfb12922c0","observation_id":"573986e9-fc42-4169-9db4-cb78c5561e47","resolution":{"observed_at":"2026-08-04T09:14:46.158438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.10686","last_updated":"2022-01-30T16:42:46Z","snapshot_observed_at":"2026-07-06T11:50:13.578611Z","submitted_at":"2021-09-22T12:29:15Z","title":"Scale Efficiently: Insights from Pre-training and Fine-tuning Transformers","version":2},"cited_work":{"arxiv_id":"2109.10686","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2109.10686","snapshot_observed_at":"2026-07-03T20:58:58.624838Z","title":"Scale efficiently: Insights from pre-training and fine-tuning transformers.arXiv preprint arXiv:2109.10686","venue":null,"work_id":"e146a2de-a3c4-40f4-b460-0fe2d6535329","year":2021},"citing_paper":{"arxiv_id":"2510.18245","last_updated":"2026-05-13T04:16:31Z","snapshot_observed_at":"2026-08-08T00:42:38.787054Z","submitted_at":"2025-10-21T03:08:48Z","title":"Scaling Laws Meet Model Architecture: Toward Inference-Efficient LLMs","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-18T05:30:11.389756Z"},"links":{"cited_paper":"/paper/2109.10686","citing_paper":"/paper/2510.18245"},"observation_digest":"sha256:de787560c7ac1177af1214f1f372c9a43ab11431b51a6631a7821bd33c804f0f","observation_id":"ad6a4eb1-b724-46c8-9c8d-59507364db17","resolution":{"observed_at":"2026-05-18T05:30:55.097385Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.10686","last_updated":"2022-01-30T16:42:46Z","snapshot_observed_at":"2026-07-06T11:50:13.578611Z","submitted_at":"2021-09-22T12:29:15Z","title":"Scale Efficiently: Insights from Pre-training and Fine-tuning Transformers","version":2},"cited_work":{"arxiv_id":"2109.10686","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2109.10686","snapshot_observed_at":"2026-07-03T20:58:58.624838Z","title":"Scale efficiently: Insights from pre-training and fine-tuning transformers.arXiv preprint arXiv:2109.10686","venue":null,"work_id":"e146a2de-a3c4-40f4-b460-0fe2d6535329","year":2021},"citing_paper":{"arxiv_id":"2604.02320","last_updated":"2026-04-07T17:25:24Z","snapshot_observed_at":"2026-08-03T09:00:04.952404Z","submitted_at":"2026-04-02T17:58:40Z","title":"Large-scale Codec Avatars: The Unreasonable Effectiveness of Large-scale Avatar Pretraining","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-13T21:32:39.946578Z"},"links":{"cited_paper":"/paper/2109.10686","citing_paper":"/paper/2604.02320"},"observation_digest":"sha256:34c59e5b9cf1416aaef7b0223db23478f4e400b241b83e7a3ab7bff562fdd8d5","observation_id":"15cfc1ff-6bfc-4712-9e17-e679d507a60f","resolution":{"observed_at":"2026-05-13T21:33:18.336782Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.10686","last_updated":"2022-01-30T16:42:46Z","snapshot_observed_at":"2026-07-06T11:50:13.578611Z","submitted_at":"2021-09-22T12:29:15Z","title":"Scale Efficiently: Insights from Pre-training and Fine-tuning Transformers","version":2},"cited_work":{"arxiv_id":"2109.10686","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2109.10686","snapshot_observed_at":"2026-07-03T20:58:58.624838Z","title":"Scale efficiently: Insights from pre-training and fine-tuning transformers.arXiv preprint arXiv:2109.10686","venue":null,"work_id":"e146a2de-a3c4-40f4-b460-0fe2d6535329","year":2021},"citing_paper":{"arxiv_id":"2606.18246","last_updated":"2026-06-16T17:59:03Z","snapshot_observed_at":"2026-08-02T16:01:00.670614Z","submitted_at":"2026-06-16T17:59:03Z","title":"Variable-Width Transformers","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-06-27T00:57:22.872902Z"},"links":{"cited_paper":"/paper/2109.10686","citing_paper":"/paper/2606.18246"},"observation_digest":"sha256:d2cdb739abed7115e0504fbced87944bb8eb9c6fee1f5fd6ffd72486b858ad21","observation_id":"93b62383-9748-40ad-aebb-e83093829b24","resolution":{"observed_at":"2026-07-03T20:58:58.626372Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2109.10686/citation-record","integrity":"/paper/2109.10686/integrity","json":"/paper/2109.10686/citation-record.json","paper":"/paper/2109.10686"},"outbound":[],"paper":{"arxiv_id":"2109.10686","last_updated":"2022-01-30T16:42:46Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-07-06T11:50:13.578611Z","submitted_at":"2021-09-22T12:29:15Z","title":"Scale Efficiently: Insights from Pre-training and Fine-tuning Transformers"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 16 inbound Pith citation observations for arXiv:2109.10686."}