{"as_of":"2026-08-10T00:33:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:03942999b727bf72970196854bca6270a47b076a4fc969f26a2135f851a33817","coverage":[{"denominator":26,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":26,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T01:39:49.827447Z","state":"measured"},{"denominator":26,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":26,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.27230/citation-record","integrity":"/paper/2607.27230/integrity","json":"/paper/2607.27230/citation-record.json","paper":"/paper/2607.27230"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-04T01:39:47.618608Z","title":"Training verifiers to solve math word problems.arXiv preprint arXiv:2110.14168,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27230","last_updated":"2026-07-31T23:34:57Z","snapshot_observed_at":"2026-08-09T20:39:07.521033Z","submitted_at":"2026-07-22T06:51:51Z","title":"Multi-Head Attention Residuals","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T01:39:47.618608Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2607.27230"},"observation_digest":"sha256:1680038658edd2dd2316a75e888231df23924b2cef94d9153e2a3f317972926f","observation_id":"728e9bfb-469e-4fb0-a36a-4ab7e731f525","resolution":{"observed_at":"2026-08-04T01:39:47.618608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:39:49.569360Z","title":"This is the loss-level counterpart of the width-isolated disagreement in Table 6 (which rises 0.235→0.281 over the same widening)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.27230","last_updated":"2026-07-31T23:34:57Z","snapshot_observed_at":"2026-08-09T20:39:07.521033Z","submitted_at":"2026-07-22T06:51:51Z","title":"Multi-Head Attention Residuals","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T01:39:49.569360Z"},"links":{"citing_paper":"/paper/2607.27230"},"observation_digest":"sha256:fc01d5a68dd0436c9b21ee0f7df1b2dce5cd566be6ba3d05e8ad9a2f25c537ed","observation_id":"5f87f737-1654-432c-b6d6-123c36b929e5","resolution":{"observed_at":"2026-08-04T01:39:49.569360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.24880","last_updated":"2026-01-05T16:51:18Z","snapshot_observed_at":"2026-08-03T01:54:33.526522Z","submitted_at":"2025-12-31T14:16:26Z","title":"mHC: Manifold-Constrained Hyper-Connections","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.24880","snapshot_observed_at":"2026-08-04T01:39:47.758808Z","title":"Manifold-constrained hyper-connections.arXiv preprint arXiv:2512.24880,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27230","last_updated":"2026-07-31T23:34:57Z","snapshot_observed_at":"2026-08-09T20:39:07.521033Z","submitted_at":"2026-07-22T06:51:51Z","title":"Multi-Head Attention Residuals","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T01:39:47.758808Z"},"links":{"cited_paper":"/paper/2512.24880","citing_paper":"/paper/2607.27230"},"observation_digest":"sha256:87298c307bb992a58c0a742360cd102662f6797b28b64c1fb7ea64383d3d1948","observation_id":"3f3ca8a2-f101-455b-bb99-d121b105a5cf","resolution":{"observed_at":"2026-08-04T01:39:47.758808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:39:49.451208Z","title":"This control is a self-contained 5×10 −4 comparison on the web corpus, so its d512 deltas differ slightly from Table 10’s tuned-rate (1×10 −3) numbers","venue":null,"work_id":null,"year":2048},"citing_paper":{"arxiv_id":"2607.27230","last_updated":"2026-07-31T23:34:57Z","snapshot_observed_at":"2026-08-09T20:39:07.521033Z","submitted_at":"2026-07-22T06:51:51Z","title":"Multi-Head Attention Residuals","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T01:39:49.451208Z"},"links":{"citing_paper":"/paper/2607.27230"},"observation_digest":"sha256:0b3cd400849eca49cdca14169956d3688f4a1d94a31559fe095b56446db3097a","observation_id":"1c3ef572-3e4e-4748-ac27-05cfea4c7845","resolution":{"observed_at":"2026-08-04T01:39:49.451208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06708","last_updated":"2025-05-10T17:15:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-10T17:15:49Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.06708","snapshot_observed_at":"2026-08-04T01:39:48.142895Z","title":"Gated attention for large language models: Non-linearity, sparsity, and attention-sink-free.arXiv preprint arXiv:2505.06708,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27230","last_updated":"2026-07-31T23:34:57Z","snapshot_observed_at":"2026-08-09T20:39:07.521033Z","submitted_at":"2026-07-22T06:51:51Z","title":"Multi-Head Attention Residuals","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T01:39:48.142895Z"},"links":{"cited_paper":"/paper/2505.06708","citing_paper":"/paper/2607.27230"},"observation_digest":"sha256:1064c5840978b70554ccc36c16ac93a89fc0dab3c8bbb40dd67268d36d32d6e2","observation_id":"066941b7-06c5-4da0-b5ea-677bcaf10f87","resolution":{"observed_at":"2026-08-04T01:39:48.142895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02258","last_updated":"2024-04-02T19:28:11Z","snapshot_observed_at":"2026-07-06T17:54:47.689340Z","submitted_at":"2024-04-02T19:28:11Z","title":"Mixture-of-Depths: Dynamically allocating compute in transformer-based language models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02258","snapshot_observed_at":"2026-08-04T01:39:48.300907Z","title":"Mixture-of-depths: Dynamically allocating compute in transformer-based language models.arXiv preprint arXiv:2404.02258,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27230","last_updated":"2026-07-31T23:34:57Z","snapshot_observed_at":"2026-08-09T20:39:07.521033Z","submitted_at":"2026-07-22T06:51:51Z","title":"Multi-Head Attention Residuals","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T01:39:48.300907Z"},"links":{"cited_paper":"/paper/2404.02258","citing_paper":"/paper/2607.27230"},"observation_digest":"sha256:12eed2520d68fe78d0f2e7f141967b0f104cc3e408347ba2649fa604c7437e38","observation_id":"11a3f45a-48b3-48c5-96c1-dc835482131c","resolution":{"observed_at":"2026-08-04T01:39:48.300907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.00555","last_updated":"2022-03-01T15:36:38Z","snapshot_observed_at":"2026-08-07T12:15:22.242632Z","submitted_at":"2022-03-01T15:36:38Z","title":"DeepNet: Scaling Transformers to 1,000 Layers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.00555","snapshot_observed_at":"2026-08-04T01:39:48.498444Z","title":"Deepnet: Scaling transformers to 1,000 layers.arXiv preprint arXiv:2203.00555,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27230","last_updated":"2026-07-31T23:34:57Z","snapshot_observed_at":"2026-08-09T20:39:07.521033Z","submitted_at":"2026-07-22T06:51:51Z","title":"Multi-Head Attention Residuals","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T01:39:48.498444Z"},"links":{"cited_paper":"/paper/2203.00555","citing_paper":"/paper/2607.27230"},"observation_digest":"sha256:9e377d54d4dcbf06a7f5109fb7a4738848fa38ae0f69bfe0b6b3b450388bc8a7","observation_id":"3b4514cd-824d-47b6-a1ff-8b93512acde5","resolution":{"observed_at":"2026-08-04T01:39:48.498444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.00417","last_updated":"2026-07-27T23:05:42Z","snapshot_observed_at":"2026-08-03T13:08:22.353654Z","submitted_at":"2026-01-01T18:11:38Z","title":"Deep Delta Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.00417","snapshot_observed_at":"2026-08-04T01:39:48.637581Z","title":"Deep delta learning.arXiv preprint arXiv:2601.00417, 2026a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27230","last_updated":"2026-07-31T23:34:57Z","snapshot_observed_at":"2026-08-09T20:39:07.521033Z","submitted_at":"2026-07-22T06:51:51Z","title":"Multi-Head Attention Residuals","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T01:39:48.637581Z"},"links":{"cited_paper":"/paper/2601.00417","citing_paper":"/paper/2607.27230"},"observation_digest":"sha256:e16f8e097d3ce2c9516aba2a1cea309939ccb90a4cd11e0359ddf95e50feec64","observation_id":"1b4b545e-1df6-442e-887d-8467c30f4459","resolution":{"observed_at":"2026-08-04T01:39:48.637581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:39:48.762582Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.27230","last_updated":"2026-07-31T23:34:57Z","snapshot_observed_at":"2026-08-09T20:39:07.521033Z","submitted_at":"2026-07-22T06:51:51Z","title":"Multi-Head Attention Residuals","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T01:39:48.762582Z"},"links":{"citing_paper":"/paper/2607.27230"},"observation_digest":"sha256:9b946572b1ff82f56b496b584494c66cde9755a9923a707cb062c7e5e5c9bff7","observation_id":"2440badd-7c79-4ad8-a11c-bebdd9b04be3","resolution":{"observed_at":"2026-08-04T01:39:48.762582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:39:48.845383Z","title":"DenseNets [Huang et al., 2017] instead concatenate all previous feature maps, giving each layer direct access to every earlier one","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.27230","last_updated":"2026-07-31T23:34:57Z","snapshot_observed_at":"2026-08-09T20:39:07.521033Z","submitted_at":"2026-07-22T06:51:51Z","title":"Multi-Head Attention Residuals","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T01:39:48.845383Z"},"links":{"citing_paper":"/paper/2607.27230"},"observation_digest":"sha256:2076b19c8046acca7a7ee13f32a2c1fd65ea64a5a5baf51295d059e98145189f","observation_id":"1f04883f-7124-4e14-b24a-b76a06508a4f","resolution":{"observed_at":"2026-08-04T01:39:48.845383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:39:48.951279Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.27230","last_updated":"2026-07-31T23:34:57Z","snapshot_observed_at":"2026-08-09T20:39:07.521033Z","submitted_at":"2026-07-22T06:51:51Z","title":"Multi-Head Attention Residuals","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T01:39:48.951279Z"},"links":{"citing_paper":"/paper/2607.27230"},"observation_digest":"sha256:096e15125edd3b97f164e5c00c2877f57f90efe38342e949da62d815fd6ba685","observation_id":"57b1671f-e634-491e-829c-25da364d1fca","resolution":{"observed_at":"2026-08-04T01:39:48.951279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:39:49.073527Z","title":"\"\"Single-head depth routing = attention residuals (Kimi 2025): 3one shared query, one softmax over depth, read by all D coords. 4Equals the MHAR route at H=1","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27230","last_updated":"2026-07-31T23:34:57Z","snapshot_observed_at":"2026-08-09T20:39:07.521033Z","submitted_at":"2026-07-22T06:51:51Z","title":"Multi-Head Attention Residuals","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T01:39:49.073527Z"},"links":{"citing_paper":"/paper/2607.27230"},"observation_digest":"sha256:fe63d91c84415e8bce2cdd99dc9042904422747f70a93d5622fe89d0ed8ea9cb","observation_id":"3de68183-1647-46f1-a52b-0fc0f9eb984e","resolution":{"observed_at":"2026-08-04T01:39:49.073527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:39:49.154723Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.27230","last_updated":"2026-07-31T23:34:57Z","snapshot_observed_at":"2026-08-09T20:39:07.521033Z","submitted_at":"2026-07-22T06:51:51Z","title":"Multi-Head Attention Residuals","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T01:39:49.154723Z"},"links":{"citing_paper":"/paper/2607.27230"},"observation_digest":"sha256:9555349b0eaf31f2cbc5312aa27250183831c01da06d4e902d63814be3e316c1","observation_id":"facae91e-418f-4e50-97d6-62e00a0dc625","resolution":{"observed_at":"2026-08-04T01:39:49.154723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:39:49.279598Z","title":"1def route_bwd(V, W, dout, dV, dq_part, dg_part):# one program per pos","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.27230","last_updated":"2026-07-31T23:34:57Z","snapshot_observed_at":"2026-08-09T20:39:07.521033Z","submitted_at":"2026-07-22T06:51:51Z","title":"Multi-Head Attention Residuals","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T01:39:49.279598Z"},"links":{"citing_paper":"/paper/2607.27230"},"observation_digest":"sha256:8be6a743d6dcf943fd4e00e4125771958e58a0cb57108080b67a1950a893faf1","observation_id":"c49e995e-a5b1-42dc-8414-8c458585ca37","resolution":{"observed_at":"2026-08-04T01:39:49.279598Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:39:49.745960Z","title":"The two runs are identical except for the routing mechanism (same node, software, data order, and global batch)","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.27230","last_updated":"2026-07-31T23:34:57Z","snapshot_observed_at":"2026-08-09T20:39:07.521033Z","submitted_at":"2026-07-22T06:51:51Z","title":"Multi-Head Attention Residuals","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T01:39:49.745960Z"},"links":{"citing_paper":"/paper/2607.27230"},"observation_digest":"sha256:17d0ab87dcc70a9c16c4de81bdee2eecdad8c476b13fcf6aa638837923777113","observation_id":"acec9d32-567d-49a0-842f-c2ec04ea46e2","resolution":{"observed_at":"2026-08-04T01:39:49.745960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:39:49.827447Z","title":"Documents are streamed from the corpus shards, joined with the end-of-text token (id 151,645), and packed into contiguous sequences of length T with no padding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.27230","last_updated":"2026-07-31T23:34:57Z","snapshot_observed_at":"2026-08-09T20:39:07.521033Z","submitted_at":"2026-07-22T06:51:51Z","title":"Multi-Head Attention Residuals","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T01:39:49.827447Z"},"links":{"citing_paper":"/paper/2607.27230"},"observation_digest":"sha256:4ae97cdd088205d8b389dbc11f67d441b29f8d386a143a7043900c45dcdb3887","observation_id":"c97f8e7b-24f5-447a-aa26-f057f1ce44bc","resolution":{"observed_at":"2026-08-04T01:39:49.827447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02595","last_updated":"2025-05-30T20:49:42Z","snapshot_observed_at":"2026-08-04T07:58:32.632698Z","submitted_at":"2024-12-03T17:28:50Z","title":"Nemotron-CC: Transforming Common Crawl into a Refined Long-Horizon Pretraining Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.02595","snapshot_observed_at":"2026-08-04T01:39:48.386899Z","title":"Nemotron-CC: Transforming Common Crawl into a refined long-horizon pretraining dataset.arXiv preprint arXiv:2412.02595,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27230","last_updated":"2026-07-31T23:34:57Z","snapshot_observed_at":"2026-08-09T20:39:07.521033Z","submitted_at":"2026-07-22T06:51:51Z","title":"Multi-Head Attention Residuals","version":2},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-04T01:39:48.386899Z"},"links":{"cited_paper":"/paper/2412.02595","citing_paper":"/paper/2607.27230"},"observation_digest":"sha256:075d9d789b24058eb4dbbbf9a46c39062f9c2f079af9746ccccfb7ec94676e17","observation_id":"a1f35164-2779-4fc8-84ae-617baf6f448c","resolution":{"observed_at":"2026-08-04T01:39:48.386899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17557","last_updated":"2024-10-31T11:37:49Z","snapshot_observed_at":"2026-08-02T15:25:02.551919Z","submitted_at":"2024-06-25T13:50:56Z","title":"The FineWeb Datasets: Decanting the Web for the Finest Text Data at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.17557","snapshot_observed_at":"2026-08-04T01:39:48.074782Z","title":"The fineweb datasets: Decanting the web for the finest text data at scale.arXiv preprint arXiv:2406.17557,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27230","last_updated":"2026-07-31T23:34:57Z","snapshot_observed_at":"2026-08-09T20:39:07.521033Z","submitted_at":"2026-07-22T06:51:51Z","title":"Multi-Head Attention Residuals","version":2},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-04T01:39:48.074782Z"},"links":{"cited_paper":"/paper/2406.17557","citing_paper":"/paper/2607.27230"},"observation_digest":"sha256:e3702257ad2cf9042070c50bd6a60c68113fc32cdd4dd438f42a2b22dc95af3a","observation_id":"5b4d62da-a1ce-4e72-9d89-e3afa7859275","resolution":{"observed_at":"2026-08-04T01:39:48.074782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.15031","snapshot_observed_at":"2026-08-04T01:39:47.872763Z","title":"Finepdfs","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27230","last_updated":"2026-07-31T23:34:57Z","snapshot_observed_at":"2026-08-09T20:39:07.521033Z","submitted_at":"2026-07-22T06:51:51Z","title":"Multi-Head Attention Residuals","version":2},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-04T01:39:47.872763Z"},"links":{"cited_paper":"/paper/2603.15031","citing_paper":"/paper/2607.27230"},"observation_digest":"sha256:2971699ae4ed959a32d00ce3d5a42b7f424ceb3d6502be07544574bc6a831e0f","observation_id":"bd5aa1d8-db5a-42db-a10d-2648fef6ea78","resolution":{"observed_at":"2026-08-04T01:39:47.872763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.18855","last_updated":"2026-05-13T16:05:30Z","snapshot_observed_at":"2026-07-06T23:29:38.069295Z","submitted_at":"2026-05-13T16:05:30Z","title":"Delta Attention Residuals","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.18855","snapshot_observed_at":"2026-08-04T01:39:47.959950Z","title":"Delta attention residuals.arXiv preprint arXiv:2605.18855,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27230","last_updated":"2026-07-31T23:34:57Z","snapshot_observed_at":"2026-08-09T20:39:07.521033Z","submitted_at":"2026-07-22T06:51:51Z","title":"Multi-Head Attention Residuals","version":2},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-04T01:39:47.959950Z"},"links":{"cited_paper":"/paper/2605.18855","citing_paper":"/paper/2607.27230"},"observation_digest":"sha256:5b931a310fb93d329987beb961a70a11980a5fcbc732e406958ebcf23dc72904","observation_id":"7b329004-10d6-4462-83c2-3c2d4c8f0fc0","resolution":{"observed_at":"2026-08-04T01:39:47.959950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-04T01:39:47.559252Z","title":"Evaluating large language models trained on code.arXiv preprint arXiv:2107.03374,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27230","last_updated":"2026-07-31T23:34:57Z","snapshot_observed_at":"2026-08-09T20:39:07.521033Z","submitted_at":"2026-07-22T06:51:51Z","title":"Multi-Head Attention Residuals","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-04T01:39:47.559252Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2607.27230"},"observation_digest":"sha256:8c2b5a5990c189da7b8cc02f463817451b1861fdb6518031621afa5e042dd878","observation_id":"1879db55-f1bc-43f6-a35b-bbed25a828e3","resolution":{"observed_at":"2026-08-04T01:39:47.559252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07413","last_updated":"2023-12-12T16:34:19Z","snapshot_observed_at":"2026-07-06T17:00:33.386675Z","submitted_at":"2023-12-12T16:34:19Z","title":"AI capabilities can be significantly improved without expensive retraining","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.07413","snapshot_observed_at":"2026-08-04T01:39:47.687200Z","title":"AI capabilities can be significantly improved without expensive retraining.arXiv preprint arXiv:2312.07413,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27230","last_updated":"2026-07-31T23:34:57Z","snapshot_observed_at":"2026-08-09T20:39:07.521033Z","submitted_at":"2026-07-22T06:51:51Z","title":"Multi-Head Attention Residuals","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-04T01:39:47.687200Z"},"links":{"cited_paper":"/paper/2312.07413","citing_paper":"/paper/2607.27230"},"observation_digest":"sha256:a66166dcb7e8b2b6eb2b1d45c3567ae91f6de56dc74bf58e37ca4b0105747de7","observation_id":"4cc59b98-1840-4561-9278-3d5203a95c98","resolution":{"observed_at":"2026-08-04T01:39:47.687200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07732","last_updated":"2021-08-16T03:57:30Z","snapshot_observed_at":"2026-08-02T19:23:53.535075Z","submitted_at":"2021-08-16T03:57:30Z","title":"Program Synthesis with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07732","snapshot_observed_at":"2026-08-04T01:39:47.523424Z","title":"Program synthesis with large language models.arXiv preprint arXiv:2108.07732,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27230","last_updated":"2026-07-31T23:34:57Z","snapshot_observed_at":"2026-08-09T20:39:07.521033Z","submitted_at":"2026-07-22T06:51:51Z","title":"Multi-Head Attention Residuals","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-04T01:39:47.523424Z"},"links":{"cited_paper":"/paper/2108.07732","citing_paper":"/paper/2607.27230"},"observation_digest":"sha256:1ddfd98a7b7608028efb38e3da8692c55a23f7b319f135367196d5d190cec085","observation_id":"a434357d-c39c-4d8e-8c1c-98c850430191","resolution":{"observed_at":"2026-08-04T01:39:47.523424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:39:47.822580Z","title":"Kaiming He, Xiangyu Zhang, Shaoqing Ren, and Jian Sun","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27230","last_updated":"2026-07-31T23:34:57Z","snapshot_observed_at":"2026-08-09T20:39:07.521033Z","submitted_at":"2026-07-22T06:51:51Z","title":"Multi-Head Attention Residuals","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-04T01:39:47.822580Z"},"links":{"citing_paper":"/paper/2607.27230"},"observation_digest":"sha256:b48d28f63c29701169150ff6f86c6d840d3b06e5683910aeeaa462638eec8315","observation_id":"480fa5e1-fb6a-4b47-b397-75347d8550e0","resolution":{"observed_at":"2026-08-04T01:39:47.822580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-04T01:39:48.221064Z","title":"Qwen3 technical report.arXiv preprint arXiv:2505.09388,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27230","last_updated":"2026-07-31T23:34:57Z","snapshot_observed_at":"2026-08-09T20:39:07.521033Z","submitted_at":"2026-07-22T06:51:51Z","title":"Multi-Head Attention Residuals","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-04T01:39:48.221064Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2607.27230"},"observation_digest":"sha256:dc6025c89258077623368aa3b4ca41ac4d6bdd6bcf9bf40230fe920656dce6cb","observation_id":"cfb25400-5397-4712-bb6d-1b422a71d696","resolution":{"observed_at":"2026-08-04T01:39:48.221064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02622","last_updated":"2024-03-21T10:57:40Z","snapshot_observed_at":"2026-08-05T10:38:23.917277Z","submitted_at":"2024-02-04T21:44:09Z","title":"DenseFormer: Enhancing Information Flow in Transformers via Depth Weighted Averaging","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.02622","snapshot_observed_at":"2026-08-04T01:39:48.022554Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27230","last_updated":"2026-07-31T23:34:57Z","snapshot_observed_at":"2026-08-09T20:39:07.521033Z","submitted_at":"2026-07-22T06:51:51Z","title":"Multi-Head Attention Residuals","version":2},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-04T01:39:48.022554Z"},"links":{"cited_paper":"/paper/2402.02622","citing_paper":"/paper/2607.27230"},"observation_digest":"sha256:ea7edecd24137097d49e395b19c321be07f0ab99e68695f5642fe9b8c03a4d48","observation_id":"88939309-ecc3-4dce-96b2-19a208537475","resolution":{"observed_at":"2026-08-04T01:39:48.022554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.27230","last_updated":"2026-07-31T23:34:57Z","latest_version":2,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-09T20:39:07.521033Z","submitted_at":"2026-07-22T06:51:51Z","title":"Multi-Head Attention Residuals"},"reference_resolution":{"displayed":26,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":25,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":26},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 26 of 26 outbound references and 0 inbound Pith citation observations for arXiv:2607.27230."}