{"as_of":"2026-08-11T00:09:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:88aaeedc029d623c647a3c199b10b3598bd33f6e1b273d10e4febac7522e418c","coverage":[{"denominator":31,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T22:14:20.461704Z","state":"measured"},{"denominator":31,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":31,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.22389/citation-record","integrity":"/paper/2506.22389/integrity","json":"/paper/2506.22389/citation-record.json","paper":"/paper/2506.22389"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T22:14:18.370267Z","title":"Gpt-4 technical report.arXiv preprint arXiv:2303.08774,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.22389","last_updated":"2025-06-27T16:57:59Z","snapshot_observed_at":"2026-08-08T09:56:16.215858Z","submitted_at":"2025-06-27T16:57:59Z","title":"Towards Distributed Neural Architectures","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T22:14:18.370267Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.22389"},"observation_digest":"sha256:eb1f347bdcc7d9e24f943250225fe69a9509d1017c018e23bed5417febfe3038","observation_id":"b0975920-8ccb-4fc5-bfeb-2264c07accdc","resolution":{"observed_at":"2026-08-06T22:14:18.370267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:14:18.796382Z","title":"Jia Deng, Wei Dong, Richard Socher, Li-Jia Li, Kai Li, and Li Fei-Fei","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.22389","last_updated":"2025-06-27T16:57:59Z","snapshot_observed_at":"2026-08-08T09:56:16.215858Z","submitted_at":"2025-06-27T16:57:59Z","title":"Towards Distributed Neural Architectures","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T22:14:18.796382Z"},"links":{"citing_paper":"/paper/2506.22389"},"observation_digest":"sha256:40ad26f50044484a3397684a747982b19c9ac547c1e0beb71a15c5e2917276fd","observation_id":"2482fa62-7024-41dd-992c-ebe0d7109451","resolution":{"observed_at":"2026-08-06T22:14:18.796382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05171","last_updated":"2025-02-17T17:14:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-07T18:55:02Z","title":"Scaling up Test-Time Compute with Latent Reasoning: A Recurrent Depth Approach","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05171","snapshot_observed_at":"2026-08-06T22:14:18.944144Z","title":"Scaling up test-time compute with latent reasoning: A recurrent depth approach","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.22389","last_updated":"2025-06-27T16:57:59Z","snapshot_observed_at":"2026-08-08T09:56:16.215858Z","submitted_at":"2025-06-27T16:57:59Z","title":"Towards Distributed Neural Architectures","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T22:14:18.944144Z"},"links":{"cited_paper":"/paper/2502.05171","citing_paper":"/paper/2506.22389"},"observation_digest":"sha256:8fa2f65a811efddd180ea45dc2e0390efd1a34639fe70b64df87be7780ed3a4f","observation_id":"280f67af-b0b0-4421-a7a3-b66c0271f621","resolution":{"observed_at":"2026-08-06T22:14:18.944144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:14:21.498186Z","title":"This may be because we are not considering a setting with high sparsity","venue":null,"work_id":"638c18dd-208a-47d2-aae9-95280f3cb351","year":2017},"citing_paper":{"arxiv_id":"2506.22389","last_updated":"2025-06-27T16:57:59Z","snapshot_observed_at":"2026-08-08T09:56:16.215858Z","submitted_at":"2025-06-27T16:57:59Z","title":"Towards Distributed Neural Architectures","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T22:14:20.148222Z"},"links":{"citing_paper":"/paper/2506.22389"},"observation_digest":"sha256:1a175e1b42147c4156fa0be6464fec2b47a7dfde8a7139b24099498d9cc9d086","observation_id":"1ca5aea9-79ea-4d95-a551-6c355c8775e5","resolution":{"observed_at":"2026-08-06T22:14:21.567025Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-10T17:02:50.054809Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-06T22:14:19.357714Z","title":"Deepseek-v3 technical report.arXiv preprint arXiv:2412.19437,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.22389","last_updated":"2025-06-27T16:57:59Z","snapshot_observed_at":"2026-08-08T09:56:16.215858Z","submitted_at":"2025-06-27T16:57:59Z","title":"Towards Distributed Neural Architectures","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T22:14:19.357714Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2506.22389"},"observation_digest":"sha256:253b5b568c6b008a92b068782ee3274386a4ca678970d7ce9ddd2d2b79bef98a","observation_id":"16ee2b9c-a491-44bb-b343-14df6bd663b4","resolution":{"observed_at":"2026-08-06T22:14:19.357714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1806.09055","last_updated":"2019-04-23T06:29:32Z","snapshot_observed_at":"2026-08-09T13:23:20.015254Z","submitted_at":"2018-06-24T00:06:13Z","title":"DARTS: Differentiable Architecture Search","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1806.09055","snapshot_observed_at":"2026-08-06T22:14:19.416905Z","title":"Darts: Differentiable architecture search","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.22389","last_updated":"2025-06-27T16:57:59Z","snapshot_observed_at":"2026-08-08T09:56:16.215858Z","submitted_at":"2025-06-27T16:57:59Z","title":"Towards Distributed Neural Architectures","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T22:14:19.416905Z"},"links":{"cited_paper":"/paper/1806.09055","citing_paper":"/paper/2506.22389"},"observation_digest":"sha256:a86bd7ac56d6d897592b71212ae230ecfebdce8d8621a5454f4270076e07ab36","observation_id":"b37c74e1-eadf-4001-8422-2a432370ff72","resolution":{"observed_at":"2026-08-06T22:14:19.416905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:14:22.063718Z","title":"Fineweb-edu: the finest collection of educational content, 2024.https://huggingface.co/datasets/HuggingFaceFW/fineweb-edu","venue":null,"work_id":"5a17e53d-850e-45c7-8bca-1234dcef21fd","year":2024},"citing_paper":{"arxiv_id":"2506.22389","last_updated":"2025-06-27T16:57:59Z","snapshot_observed_at":"2026-08-08T09:56:16.215858Z","submitted_at":"2025-06-27T16:57:59Z","title":"Towards Distributed Neural Architectures","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T22:14:19.468676Z"},"links":{"citing_paper":"/paper/2506.22389"},"observation_digest":"sha256:25ca6661948a9e3a81a38727f01605790d31206455608b429e128fc067889af0","observation_id":"45d82e4b-be64-4207-a54c-5c5bbec99369","resolution":{"observed_at":"2026-08-06T22:14:22.111671Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.00448","last_updated":"2025-04-14T10:11:13Z","snapshot_observed_at":"2026-08-09T11:34:40.162228Z","submitted_at":"2023-12-31T10:53:58Z","title":"Beyond Chinchilla-Optimal: Accounting for Inference in Language Model Scaling Laws","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.00448","snapshot_observed_at":"2026-08-06T22:14:19.596966Z","title":"Beyond chinchilla-optimal: Accounting for inference in language model scaling laws.arXiv preprint arXiv:2401.00448,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.22389","last_updated":"2025-06-27T16:57:59Z","snapshot_observed_at":"2026-08-08T09:56:16.215858Z","submitted_at":"2025-06-27T16:57:59Z","title":"Towards Distributed Neural Architectures","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T22:14:19.596966Z"},"links":{"cited_paper":"/paper/2401.00448","citing_paper":"/paper/2506.22389"},"observation_digest":"sha256:5ce1ef928ae4fef1482d51df8c796596a5429b912ca5ceffd544d588e65baf0d","observation_id":"691fbcff-885e-4b63-9d50-80ac488b6cdc","resolution":{"observed_at":"2026-08-06T22:14:19.596966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1611.01232","last_updated":"2017-04-04T19:36:14Z","snapshot_observed_at":"2026-08-10T08:47:08.603823Z","submitted_at":"2016-11-04T00:44:32Z","title":"Deep Information Propagation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1611.01232","snapshot_observed_at":"2026-08-06T22:14:19.643965Z","title":"Deep information propagation.arXiv preprint arXiv:1611.01232,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.22389","last_updated":"2025-06-27T16:57:59Z","snapshot_observed_at":"2026-08-08T09:56:16.215858Z","submitted_at":"2025-06-27T16:57:59Z","title":"Towards Distributed Neural Architectures","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T22:14:19.643965Z"},"links":{"cited_paper":"/paper/1611.01232","citing_paper":"/paper/2506.22389"},"observation_digest":"sha256:de1e9724f08c1a69b6b665a81dae7d4d967787c2021c9166035fe394e46f36b2","observation_id":"d1811a32-701b-46bc-9a0f-716da38d2905","resolution":{"observed_at":"2026-08-06T22:14:19.643965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1701.06538","last_updated":"2017-01-23T18:10:00Z","snapshot_observed_at":"2026-07-06T05:27:13.416519Z","submitted_at":"2017-01-23T18:10:00Z","title":"Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1701.06538","snapshot_observed_at":"2026-08-06T22:14:19.690467Z","title":"Outrageously large neural networks: The sparsely-gated mixture-of-experts layer.arXiv preprint arXiv:1701.06538,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.22389","last_updated":"2025-06-27T16:57:59Z","snapshot_observed_at":"2026-08-08T09:56:16.215858Z","submitted_at":"2025-06-27T16:57:59Z","title":"Towards Distributed Neural Architectures","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T22:14:19.690467Z"},"links":{"cited_paper":"/paper/1701.06538","citing_paper":"/paper/2506.22389"},"observation_digest":"sha256:0c96a9540c8cee7c0d0fd74640f74f5288ddefe29d9ce054dbba75be9878014d","observation_id":"b3c29bac-d4fe-4df1-bc35-eb61e82108aa","resolution":{"observed_at":"2026-08-06T22:14:19.690467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:14:21.974529Z","title":"Dropout: a simple way to prevent neural networks from overfitting.The journal of machine learning research, 15(1):1929–1958,","venue":null,"work_id":"e5b8330e-5cac-4619-a33a-f83e8ae623ba","year":1929},"citing_paper":{"arxiv_id":"2506.22389","last_updated":"2025-06-27T16:57:59Z","snapshot_observed_at":"2026-08-08T09:56:16.215858Z","submitted_at":"2025-06-27T16:57:59Z","title":"Towards Distributed Neural Architectures","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T22:14:19.742140Z"},"links":{"citing_paper":"/paper/2506.22389"},"observation_digest":"sha256:70488c7791015a2790783df2f46edae3e93dcd1a560a6d00ca727c33c0edb366","observation_id":"2a4618a6-8bc6-4de1-82ac-58aa2f2a9a07","resolution":{"observed_at":"2026-08-06T22:14:22.010935Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:14:21.861929Z","title":"torchtune: Pytorch’s finetuning library, April 2024.https//github.com/ pytorch/torchtune","venue":null,"work_id":"e1290304-d696-4a25-8ae1-27794b703419","year":2024},"citing_paper":{"arxiv_id":"2506.22389","last_updated":"2025-06-27T16:57:59Z","snapshot_observed_at":"2026-08-08T09:56:16.215858Z","submitted_at":"2025-06-27T16:57:59Z","title":"Towards Distributed Neural Architectures","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T22:14:19.869553Z"},"links":{"citing_paper":"/paper/2506.22389"},"observation_digest":"sha256:369c7a33d4eb0b8d54d04deafec688de584c8b8911beb98da15af156ee43b1f6","observation_id":"66a3de26-abb7-40ef-a9d7-45045dcee1bd","resolution":{"observed_at":"2026-08-06T22:14:21.905199Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1611.01578","last_updated":"2017-02-15T05:28:05Z","snapshot_observed_at":"2026-07-06T05:17:29.499249Z","submitted_at":"2016-11-05T00:41:37Z","title":"Neural Architecture Search with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1611.01578","snapshot_observed_at":"2026-08-06T22:14:19.952473Z","title":"Neural architecture search with reinforcement learning.arXiv preprint arXiv:1611.01578,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.22389","last_updated":"2025-06-27T16:57:59Z","snapshot_observed_at":"2026-08-08T09:56:16.215858Z","submitted_at":"2025-06-27T16:57:59Z","title":"Towards Distributed Neural Architectures","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T22:14:19.952473Z"},"links":{"cited_paper":"/paper/1611.01578","citing_paper":"/paper/2506.22389"},"observation_digest":"sha256:f20d4329baaa724c6aa109fe1273ea7561c1575cca605eb07632e018e04c607a","observation_id":"9c6aa4a5-2d58-45df-9390-c1ea56231cb4","resolution":{"observed_at":"2026-08-06T22:14:19.952473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:14:21.747003Z","title":null,"venue":null,"work_id":"14cc8d70-74fe-4e60-a64f-bdb1b450ba0e","year":2023},"citing_paper":{"arxiv_id":"2506.22389","last_updated":"2025-06-27T16:57:59Z","snapshot_observed_at":"2026-08-08T09:56:16.215858Z","submitted_at":"2025-06-27T16:57:59Z","title":"Towards Distributed Neural Architectures","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T22:14:20.040098Z"},"links":{"citing_paper":"/paper/2506.22389"},"observation_digest":"sha256:bf7e66fc87ec7e1d41b17e0405a2ed518aa2b3816b3de1c0ed2504f2f392cc85","observation_id":"126d581e-3eb2-482f-8a24-b3638f6ea7a0","resolution":{"observed_at":"2026-08-06T22:14:21.820871Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:14:21.614690Z","title":"B Module Usage and Load Balancing We plot the module usage distribution for all DNA models used in the main text in Fig","venue":null,"work_id":"2e547f09-220d-454d-a87d-e1d7041606ba","year":2016},"citing_paper":{"arxiv_id":"2506.22389","last_updated":"2025-06-27T16:57:59Z","snapshot_observed_at":"2026-08-08T09:56:16.215858Z","submitted_at":"2025-06-27T16:57:59Z","title":"Towards Distributed Neural Architectures","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T22:14:20.045284Z"},"links":{"citing_paper":"/paper/2506.22389"},"observation_digest":"sha256:5cc0b2e4dd16ab7cc8661a568d18528eca9c33630adf71d45d6880c600ed8afa","observation_id":"ba1c9cb3-de61-4bc8-baaf-a7e2e568a5b4","resolution":{"observed_at":"2026-08-06T22:14:21.678283Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:14:21.303455Z","title":"The random noise is per-pixel zero-mean, and has a linearly decaying variance, starting at 1 and ending at 0 by the end of the optimization procedure","venue":null,"work_id":"8a237e29-6681-4f2e-b606-7456191e3eab","year":null},"citing_paper":{"arxiv_id":"2506.22389","last_updated":"2025-06-27T16:57:59Z","snapshot_observed_at":"2026-08-08T09:56:16.215858Z","submitted_at":"2025-06-27T16:57:59Z","title":"Towards Distributed Neural Architectures","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T22:14:20.256809Z"},"links":{"citing_paper":"/paper/2506.22389"},"observation_digest":"sha256:8017b93d93c6ab7929e0adcb33d575e442330b148b28cffd0ae4603f4eadf213","observation_id":"6395a7bd-f507-47d1-b607-48576b07aec8","resolution":{"observed_at":"2026-08-06T22:14:21.382742Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:14:21.162301Z","title":"3, we find that the patches following the same path in a randomly initialized model share much greater visual similarities","venue":null,"work_id":"2b9cb57f-a619-488b-9524-324bce5a6ce0","year":2016},"citing_paper":{"arxiv_id":"2506.22389","last_updated":"2025-06-27T16:57:59Z","snapshot_observed_at":"2026-08-08T09:56:16.215858Z","submitted_at":"2025-06-27T16:57:59Z","title":"Towards Distributed Neural Architectures","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T22:14:20.374982Z"},"links":{"citing_paper":"/paper/2506.22389"},"observation_digest":"sha256:9cd8465b7eb69061d907e35ed5317f61d0283c469bed591d88302923c6a45a00","observation_id":"bbb959d7-42ec-4192-bbe4-8f53e54d3e56","resolution":{"observed_at":"2026-08-06T22:14:21.216489Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:14:21.078321Z","title":"9 is a zoomed-in version of those two figures","venue":null,"work_id":"9784d8ff-5d6e-4c36-b065-10a42fcd2388","year":1966},"citing_paper":{"arxiv_id":"2506.22389","last_updated":"2025-06-27T16:57:59Z","snapshot_observed_at":"2026-08-08T09:56:16.215858Z","submitted_at":"2025-06-27T16:57:59Z","title":"Towards Distributed Neural Architectures","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T22:14:20.461704Z"},"links":{"citing_paper":"/paper/2506.22389"},"observation_digest":"sha256:1e8ad889bbcaf8b44989ca2b62717627e482b794ac3239cc1e976ed15b00436d","observation_id":"08fb4c44-9031-43fa-a905-51093eb1bc92","resolution":{"observed_at":"2026-08-06T22:14:21.112995Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-06T22:14:19.232811Z","title":"Scaling laws for neural language models.arXiv preprint arXiv:2001.08361,","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2506.22389","last_updated":"2025-06-27T16:57:59Z","snapshot_observed_at":"2026-08-08T09:56:16.215858Z","submitted_at":"2025-06-27T16:57:59Z","title":"Towards Distributed Neural Architectures","version":1},"reference_index":1991,"source":"pdf_text","source_observed_at":"2026-08-06T22:14:19.232811Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2506.22389"},"observation_digest":"sha256:5709482d93e5f9d3c4b2e20073b4bd01950307dda7bff2eca35a1b3fa268b9ce","observation_id":"88848d09-fc48-4bfe-9fbd-977fbd2abc37","resolution":{"observed_at":"2026-08-06T22:14:19.232811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:14:22.171286Z","title":"RACE: Large-scale ReAding comprehension dataset from examinations","venue":null,"work_id":"72ac8f06-dc85-4147-9f88-25cb88b8d117","year":2017},"citing_paper":{"arxiv_id":"2506.22389","last_updated":"2025-06-27T16:57:59Z","snapshot_observed_at":"2026-08-08T09:56:16.215858Z","submitted_at":"2025-06-27T16:57:59Z","title":"Towards Distributed Neural Architectures","version":1},"reference_index":2012,"source":"pdf_text","source_observed_at":"2026-08-06T22:14:19.291521Z"},"links":{"citing_paper":"/paper/2506.22389"},"observation_digest":"sha256:6e9d182f51cdd56981549d05bd7911a1b3e2e6a7777dfc07f85178b440b37a7f","observation_id":"5161ef2f-64d8-456b-9d59-5bfba7bd16c5","resolution":{"observed_at":"2026-08-06T22:14:22.229680Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.08524","last_updated":"2025-02-12T16:00:11Z","snapshot_observed_at":"2026-08-08T04:44:23.355074Z","submitted_at":"2025-02-12T16:00:11Z","title":"LLM Pretraining with Continuous Concepts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.08524","snapshot_observed_at":"2026-08-06T22:14:19.808871Z","title":"Llm pretraining with continuous concepts.arXiv preprint arXiv:2502.08524,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.22389","last_updated":"2025-06-27T16:57:59Z","snapshot_observed_at":"2026-08-08T09:56:16.215858Z","submitted_at":"2025-06-27T16:57:59Z","title":"Towards Distributed Neural Architectures","version":1},"reference_index":2014,"source":"pdf_text","source_observed_at":"2026-08-06T22:14:19.808871Z"},"links":{"cited_paper":"/paper/2502.08524","citing_paper":"/paper/2506.22389"},"observation_digest":"sha256:0015fb47978dfcf648a3941fde5374a482aed0b456a43611cf30e270fa5bc56b","observation_id":"e9f46559-0637-4498-a104-7320a4abcc83","resolution":{"observed_at":"2026-08-06T22:14:19.808871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1503.02531","last_updated":"2015-03-09T15:44:49Z","snapshot_observed_at":"2026-07-06T04:11:24.157003Z","submitted_at":"2015-03-09T15:44:49Z","title":"Distilling the Knowledge in a Neural Network","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1503.02531","snapshot_observed_at":"2026-08-06T22:14:19.192043Z","title":"Distilling the knowledge in a neural network","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.22389","last_updated":"2025-06-27T16:57:59Z","snapshot_observed_at":"2026-08-08T09:56:16.215858Z","submitted_at":"2025-06-27T16:57:59Z","title":"Towards Distributed Neural Architectures","version":1},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-06T22:14:19.192043Z"},"links":{"cited_paper":"/paper/1503.02531","citing_paper":"/paper/2506.22389"},"observation_digest":"sha256:b1310e96798923aa31aa732d9460060ebafd6128b249946f28a3c7320f5e8fba","observation_id":"99607442-268c-4eac-9c9c-65012a38d471","resolution":{"observed_at":"2026-08-06T22:14:19.192043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.01703","last_updated":"2019-12-03T22:06:05Z","snapshot_observed_at":"2026-07-06T08:41:49.632205Z","submitted_at":"2019-12-03T22:06:05Z","title":"PyTorch: An Imperative Style, High-Performance Deep Learning Library","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.01703","snapshot_observed_at":"2026-08-06T22:14:19.516841Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.22389","last_updated":"2025-06-27T16:57:59Z","snapshot_observed_at":"2026-08-08T09:56:16.215858Z","submitted_at":"2025-06-27T16:57:59Z","title":"Towards Distributed Neural Architectures","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-06T22:14:19.516841Z"},"links":{"cited_paper":"/paper/1912.01703","citing_paper":"/paper/2506.22389"},"observation_digest":"sha256:6b88edb18551b0940e8e17ad24d0d4a7534283854ae3d48bcacf91efebbd4ab9","observation_id":"1d627122-77c7-40cc-9e44-a97146762004","resolution":{"observed_at":"2026-08-06T22:14:19.516841Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:14:18.721573Z","title":"Do language models use their depth efficiently? arXiv preprint arXiv:2505.13898,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.22389","last_updated":"2025-06-27T16:57:59Z","snapshot_observed_at":"2026-08-08T09:56:16.215858Z","submitted_at":"2025-06-27T16:57:59Z","title":"Towards Distributed Neural Architectures","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-06T22:14:18.721573Z"},"links":{"citing_paper":"/paper/2506.22389"},"observation_digest":"sha256:6357b1c5628a07fec9761dc5321e1a8864528f05803da5bcb38c10b2bd177429","observation_id":"b2f7d93b-bee0-48bd-bfb2-1abc51917bee","resolution":{"observed_at":"2026-08-06T22:14:18.721573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-06T22:14:18.635699Z","title":"Think you have solved question answering? try arc, the ai2 reasoning challenge.arXiv:1803.05457v1,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.22389","last_updated":"2025-06-27T16:57:59Z","snapshot_observed_at":"2026-08-08T09:56:16.215858Z","submitted_at":"2025-06-27T16:57:59Z","title":"Towards Distributed Neural Architectures","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-06T22:14:18.635699Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2506.22389"},"observation_digest":"sha256:f642d7cff90729f50833d7c26112b214e98e34db895030e71439bce2b186e55c","observation_id":"e1b911b4-b597-4b18-8395-38a785d1ba97","resolution":{"observed_at":"2026-08-06T22:14:18.635699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.05176","last_updated":"2023-05-09T05:11:02Z","snapshot_observed_at":"2026-08-10T11:59:11.481480Z","submitted_at":"2023-05-09T05:11:02Z","title":"FrugalGPT: How to Use Large Language Models While Reducing Cost and Improving Performance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.05176","snapshot_observed_at":"2026-08-06T22:14:18.547802Z","title":"Frugalgpt: How to use large language models while reducing cost and improving performance","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.22389","last_updated":"2025-06-27T16:57:59Z","snapshot_observed_at":"2026-08-08T09:56:16.215858Z","submitted_at":"2025-06-27T16:57:59Z","title":"Towards Distributed Neural Architectures","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-06T22:14:18.547802Z"},"links":{"cited_paper":"/paper/2305.05176","citing_paper":"/paper/2506.22389"},"observation_digest":"sha256:18d63c669a0fba068841431c0651e9fcaf8e908074529c8ef21f4fa1a3899a6b","observation_id":"ef8483eb-53bc-4772-9926-b0885c75eb1e","resolution":{"observed_at":"2026-08-06T22:14:18.547802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16710","last_updated":"2024-10-18T04:02:31Z","snapshot_observed_at":"2026-08-08T01:15:44.293937Z","submitted_at":"2024-04-25T16:20:23Z","title":"LayerSkip: Enabling Early Exit Inference and Self-Speculative Decoding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16710","snapshot_observed_at":"2026-08-06T22:14:18.881708Z","title":"Layerskip: Enabling early exit inference and self-speculative decoding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.22389","last_updated":"2025-06-27T16:57:59Z","snapshot_observed_at":"2026-08-08T09:56:16.215858Z","submitted_at":"2025-06-27T16:57:59Z","title":"Towards Distributed Neural Architectures","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-06T22:14:18.881708Z"},"links":{"cited_paper":"/paper/2404.16710","citing_paper":"/paper/2506.22389"},"observation_digest":"sha256:895ed01f8489d5fc102f8ae3cfd370fe3afcf4ee65aa06b46b9497de1e7b99c3","observation_id":"9122c42c-cc6e-464e-84c7-8063b72564ae","resolution":{"observed_at":"2026-08-06T22:14:18.881708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-10T16:40:37.411115Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-06T22:14:19.055624Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.22389","last_updated":"2025-06-27T16:57:59Z","snapshot_observed_at":"2026-08-08T09:56:16.215858Z","submitted_at":"2025-06-27T16:57:59Z","title":"Towards Distributed Neural Architectures","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-06T22:14:19.055624Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.22389"},"observation_digest":"sha256:b0599191ef64905f60e8d86f47c8caa7c503d961ca2673455d546a71ffbc7459","observation_id":"538acbe2-ac9c-413a-928f-44ade83f4014","resolution":{"observed_at":"2026-08-06T22:14:19.055624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1308.3432","last_updated":"2013-08-15T15:19:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2013-08-15T15:19:34Z","title":"Estimating or Propagating Gradients Through Stochastic Neurons for Conditional Computation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1308.3432","snapshot_observed_at":"2026-08-06T22:14:18.461421Z","title":"Estimating or propagating gradients through stochastic neurons for conditional computation.arXiv preprint arXiv:1308.3432,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.22389","last_updated":"2025-06-27T16:57:59Z","snapshot_observed_at":"2026-08-08T09:56:16.215858Z","submitted_at":"2025-06-27T16:57:59Z","title":"Towards Distributed Neural Architectures","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T22:14:18.461421Z"},"links":{"cited_paper":"/paper/1308.3432","citing_paper":"/paper/2506.22389"},"observation_digest":"sha256:da43475e7304baf38742dc62931766a3ddd4132fc0a1529731c8826596481018","observation_id":"1e1d56b4-b56f-412e-8ea8-f24089f2cff0","resolution":{"observed_at":"2026-08-06T22:14:18.461421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17887","last_updated":"2025-03-03T17:02:05Z","snapshot_observed_at":"2026-08-03T06:33:46.668360Z","submitted_at":"2024-03-26T17:20:04Z","title":"The Unreasonable Ineffectiveness of the Deeper Layers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17887","snapshot_observed_at":"2026-08-06T22:14:19.114883Z","title":"The unreasonable ineffectiveness of the deeper layers.arXiv preprint arXiv:2403.17887,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.22389","last_updated":"2025-06-27T16:57:59Z","snapshot_observed_at":"2026-08-08T09:56:16.215858Z","submitted_at":"2025-06-27T16:57:59Z","title":"Towards Distributed Neural Architectures","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T22:14:19.114883Z"},"links":{"cited_paper":"/paper/2403.17887","citing_paper":"/paper/2506.22389"},"observation_digest":"sha256:ad5e04bfc252a44819e9cd224c5c171a1340ebe5d3dfc3f96ffbb7c747fdc6e3","observation_id":"a0a084e5-e6ef-4663-85d2-3565f95c0be8","resolution":{"observed_at":"2026-08-06T22:14:19.114883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06727","last_updated":"2022-12-13T16:55:12Z","snapshot_observed_at":"2026-08-09T10:52:28.294442Z","submitted_at":"2022-12-13T16:55:12Z","title":"What do Vision Transformers Learn? A Visual Exploration","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.06727","snapshot_observed_at":"2026-08-06T22:14:19.008165Z","title":"What do vision transformers learn? a visual exploration.arXiv preprint arXiv:2212.06727,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.22389","last_updated":"2025-06-27T16:57:59Z","snapshot_observed_at":"2026-08-08T09:56:16.215858Z","submitted_at":"2025-06-27T16:57:59Z","title":"Towards Distributed Neural Architectures","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T22:14:19.008165Z"},"links":{"cited_paper":"/paper/2212.06727","citing_paper":"/paper/2506.22389"},"observation_digest":"sha256:055893a0b1dae22020a67fe3a6b7f7a9a7c0e958b9aa49c57039c26a16e45cd9","observation_id":"98349d3c-4cf6-4b1e-bfa9-44ccd5c843da","resolution":{"observed_at":"2026-08-06T22:14:19.008165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.22389","last_updated":"2025-06-27T16:57:59Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-08T09:56:16.215858Z","submitted_at":"2025-06-27T16:57:59Z","title":"Towards Distributed Neural Architectures"},"reference_resolution":{"displayed":31,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":21,"verified_exact":0,"verified_fuzzy":9},"total_outbound_references":31},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 31 of 31 outbound references and 0 inbound Pith citation observations for arXiv:2506.22389."}