{"as_of":"2026-08-21T19:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:62841534888b893886f2243e0720b508cb2e5edbb6f96c6979438edf74a820df","coverage":[{"denominator":19,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":19,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T22:48:10.830682Z","state":"measured"},{"denominator":19,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":19,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2501.00823/citation-record","integrity":"/paper/2501.00823/integrity","json":"/paper/2501.00823/citation-record.json","paper":"/paper/2501.00823"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:48:10.737781Z","title":"Neural module networks","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.00823","last_updated":"2025-01-06T14:26:41Z","snapshot_observed_at":"2026-08-21T07:53:20.144398Z","submitted_at":"2025-01-01T12:55:57Z","title":"Decoupling Knowledge and Reasoning in Transformers: A Modular Architecture with Generalized Cross-Attention","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T22:48:10.737781Z"},"links":{"citing_paper":"/paper/2501.00823"},"observation_digest":"sha256:f4799ce341eba9148fcffed0e7787bea8304d5590a5c19fe0aab8e8db195494b","observation_id":"68d2ad62-9815-4416-b550-c63db1adb201","resolution":{"observed_at":"2026-08-10T22:48:10.737781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1409.0473","last_updated":"2016-05-19T21:53:22Z","snapshot_observed_at":"2026-08-18T12:17:42.484599Z","submitted_at":"2014-09-01T16:33:02Z","title":"Neural Machine Translation by Jointly Learning to Align and Translate","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1409.0473","snapshot_observed_at":"2026-08-10T22:48:10.743325Z","title":"Neural machine translation by jointly learning to align and translate","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2501.00823","last_updated":"2025-01-06T14:26:41Z","snapshot_observed_at":"2026-08-21T07:53:20.144398Z","submitted_at":"2025-01-01T12:55:57Z","title":"Decoupling Knowledge and Reasoning in Transformers: A Modular Architecture with Generalized Cross-Attention","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T22:48:10.743325Z"},"links":{"cited_paper":"/paper/1409.0473","citing_paper":"/paper/2501.00823"},"observation_digest":"sha256:a3b28c7cc04384ca170f4904c86931aef3bbabf9e615d289670e6420389fc036","observation_id":"8bef3166-2b04-4471-9ce3-ff97781e5a4a","resolution":{"observed_at":"2026-08-10T22:48:10.743325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:48:11.149597Z","title":"Language models are few-shot learners","venue":null,"work_id":"029298e0-c459-4b13-8b80-1bd55ecd8441","year":1901},"citing_paper":{"arxiv_id":"2501.00823","last_updated":"2025-01-06T14:26:41Z","snapshot_observed_at":"2026-08-21T07:53:20.144398Z","submitted_at":"2025-01-01T12:55:57Z","title":"Decoupling Knowledge and Reasoning in Transformers: A Modular Architecture with Generalized Cross-Attention","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T22:48:10.748756Z"},"links":{"citing_paper":"/paper/2501.00823"},"observation_digest":"sha256:2e9a0ae1f22b5640405df035e2b8c71ed36e93ba5d6214c33af932d88c502ea1","observation_id":"e9c29b99-5ed4-40e1-8696-cddc63fd653c","resolution":{"observed_at":"2026-08-10T22:48:11.155154Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:48:11.132708Z","title":"Decouple knowledge from parameters for plug-and-play language modeling","venue":null,"work_id":"a6993983-9e7e-47c1-8fb3-d4fabb7b72b8","year":2023},"citing_paper":{"arxiv_id":"2501.00823","last_updated":"2025-01-06T14:26:41Z","snapshot_observed_at":"2026-08-21T07:53:20.144398Z","submitted_at":"2025-01-01T12:55:57Z","title":"Decoupling Knowledge and Reasoning in Transformers: A Modular Architecture with Generalized Cross-Attention","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T22:48:10.753812Z"},"links":{"citing_paper":"/paper/2501.00823"},"observation_digest":"sha256:814dadc18515b44f64a6740b6a218e3e1fec28e94cef2cb5196e82b76b1ae024","observation_id":"6212ed3e-ec18-4ca3-bd25-96f7476358ed","resolution":{"observed_at":"2026-08-10T22:48:11.138139Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:48:11.114292Z","title":"What does bert look at? an analysis of bert’s attention","venue":null,"work_id":"564ead09-33d5-4b55-808e-813abf6bc9a5","year":2019},"citing_paper":{"arxiv_id":"2501.00823","last_updated":"2025-01-06T14:26:41Z","snapshot_observed_at":"2026-08-21T07:53:20.144398Z","submitted_at":"2025-01-01T12:55:57Z","title":"Decoupling Knowledge and Reasoning in Transformers: A Modular Architecture with Generalized Cross-Attention","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T22:48:10.758933Z"},"links":{"citing_paper":"/paper/2501.00823"},"observation_digest":"sha256:9cf4b3e6d2a416e016f8344470c6161cae9b8f74d4b6e6b591ad43e45bbd8d1e","observation_id":"2703d6f4-c895-4980-b9cf-592da8a953ee","resolution":{"observed_at":"2026-08-10T22:48:11.120482Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:48:11.095803Z","title":"What you can cram into a single vector: Probing sentence embeddings for linguistic properties","venue":null,"work_id":"2ccfe275-42fb-49be-b866-aadf4b5eec25","year":2018},"citing_paper":{"arxiv_id":"2501.00823","last_updated":"2025-01-06T14:26:41Z","snapshot_observed_at":"2026-08-21T07:53:20.144398Z","submitted_at":"2025-01-01T12:55:57Z","title":"Decoupling Knowledge and Reasoning in Transformers: A Modular Architecture with Generalized Cross-Attention","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T22:48:10.764561Z"},"links":{"citing_paper":"/paper/2501.00823"},"observation_digest":"sha256:2a8fd063c4c48e5fb8774b25735cf332ccb6c2e914e15309bc554e2e82334ab1","observation_id":"3a468c94-b02d-4473-8ab7-b63a145a299a","resolution":{"observed_at":"2026-08-10T22:48:11.102738Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-08-14T18:16:28.847993Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-10T22:48:10.770397Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.00823","last_updated":"2025-01-06T14:26:41Z","snapshot_observed_at":"2026-08-21T07:53:20.144398Z","submitted_at":"2025-01-01T12:55:57Z","title":"Decoupling Knowledge and Reasoning in Transformers: A Modular Architecture with Generalized Cross-Attention","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T22:48:10.770397Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2501.00823"},"observation_digest":"sha256:0a3786799fff6fcd46e678538ebf74742aa9ec61ae1ddc7fa3bad0c3060fb7ea","observation_id":"61789194-cd27-45b1-a610-4383bef020ae","resolution":{"observed_at":"2026-08-10T22:48:10.770397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2012.14913","last_updated":"2021-09-05T17:32:27Z","snapshot_observed_at":"2026-08-13T01:11:33.500647Z","submitted_at":"2020-12-29T19:12:05Z","title":"Transformer Feed-Forward Layers Are Key-Value Memories","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.14913","snapshot_observed_at":"2026-08-10T22:48:10.775587Z","title":"Transformer feed-forward layers are key-value memories","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2501.00823","last_updated":"2025-01-06T14:26:41Z","snapshot_observed_at":"2026-08-21T07:53:20.144398Z","submitted_at":"2025-01-01T12:55:57Z","title":"Decoupling Knowledge and Reasoning in Transformers: A Modular Architecture with Generalized Cross-Attention","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T22:48:10.775587Z"},"links":{"cited_paper":"/paper/2012.14913","citing_paper":"/paper/2501.00823"},"observation_digest":"sha256:5f8358a49be50f7db1f960a3cd15350ffa75880e55fc6c79966cfee794cf95bc","observation_id":"0bcb0aef-e63b-426b-aaf7-c8d9283b198b","resolution":{"observed_at":"2026-08-10T22:48:10.775587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04868","last_updated":"2024-07-05T21:13:41Z","snapshot_observed_at":"2026-08-16T13:36:39.238591Z","submitted_at":"2024-07-05T21:13:41Z","title":"Looking into Black Box Code Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04868","snapshot_observed_at":"2026-08-10T22:48:10.781303Z","title":"Siddique, and Mark Marron","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00823","last_updated":"2025-01-06T14:26:41Z","snapshot_observed_at":"2026-08-21T07:53:20.144398Z","submitted_at":"2025-01-01T12:55:57Z","title":"Decoupling Knowledge and Reasoning in Transformers: A Modular Architecture with Generalized Cross-Attention","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T22:48:10.781303Z"},"links":{"cited_paper":"/paper/2407.04868","citing_paper":"/paper/2501.00823"},"observation_digest":"sha256:9ceaa180d32a69ab88c1fc162058fccfb66cfd785ef34bd9f7657061f64e4ac8","observation_id":"ffc3439e-06eb-429d-a5c2-aa575890b0ae","resolution":{"observed_at":"2026-08-10T22:48:10.781303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:48:11.078950Z","title":"A joint many- task model: Growing a neural network for multiple nlp tasks","venue":null,"work_id":"978bd8ba-1924-4843-b1dc-38dc177c9742","year":2018},"citing_paper":{"arxiv_id":"2501.00823","last_updated":"2025-01-06T14:26:41Z","snapshot_observed_at":"2026-08-21T07:53:20.144398Z","submitted_at":"2025-01-01T12:55:57Z","title":"Decoupling Knowledge and Reasoning in Transformers: A Modular Architecture with Generalized Cross-Attention","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T22:48:10.786538Z"},"links":{"citing_paper":"/paper/2501.00823"},"observation_digest":"sha256:a95b9c42808d3b76285e3e11c4dc71539eecec9ca1435d0c951f4b6cd0d97dd2","observation_id":"56832787-e3fd-49fe-bb12-b9386f8e838e","resolution":{"observed_at":"2026-08-10T22:48:11.084345Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:48:10.791462Z","title":"Adaptive mixtures of local experts","venue":null,"work_id":null,"year":1991},"citing_paper":{"arxiv_id":"2501.00823","last_updated":"2025-01-06T14:26:41Z","snapshot_observed_at":"2026-08-21T07:53:20.144398Z","submitted_at":"2025-01-01T12:55:57Z","title":"Decoupling Knowledge and Reasoning in Transformers: A Modular Architecture with Generalized Cross-Attention","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T22:48:10.791462Z"},"links":{"citing_paper":"/paper/2501.00823"},"observation_digest":"sha256:1076e619ef4c5c0f504e9134dbc4d9d46eebf3c5903320e12734c92d1041e4e4","observation_id":"07c18f2e-5bea-4ecc-8ebe-e247a2b9b0ad","resolution":{"observed_at":"2026-08-10T22:48:10.791462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:48:11.051574Z","title":"Retrieval-augmented generation for knowledge-intensive nlp tasks","venue":null,"work_id":"1b7affb4-ffc2-491d-83b0-38612991ce0c","year":2020},"citing_paper":{"arxiv_id":"2501.00823","last_updated":"2025-01-06T14:26:41Z","snapshot_observed_at":"2026-08-21T07:53:20.144398Z","submitted_at":"2025-01-01T12:55:57Z","title":"Decoupling Knowledge and Reasoning in Transformers: A Modular Architecture with Generalized Cross-Attention","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T22:48:10.796514Z"},"links":{"citing_paper":"/paper/2501.00823"},"observation_digest":"sha256:5dffea5e52e90b56ebaa886914d27f24591a87c764fa78b9449d7d762fe02754","observation_id":"13eb4147-f5dc-4c5e-81c5-2f1091be96fb","resolution":{"observed_at":"2026-08-10T22:48:11.056826Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.23168","last_updated":"2025-03-24T03:43:02Z","snapshot_observed_at":"2026-08-20T18:35:28.837488Z","submitted_at":"2024-10-30T16:19:00Z","title":"TokenFormer: Rethinking Transformer Scaling with Tokenized Model Parameters","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.23168","snapshot_observed_at":"2026-08-10T22:48:10.801282Z","title":"To- kenformer: Rethinking transformer scaling with tokenized model parameters","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00823","last_updated":"2025-01-06T14:26:41Z","snapshot_observed_at":"2026-08-21T07:53:20.144398Z","submitted_at":"2025-01-01T12:55:57Z","title":"Decoupling Knowledge and Reasoning in Transformers: A Modular Architecture with Generalized Cross-Attention","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T22:48:10.801282Z"},"links":{"cited_paper":"/paper/2410.23168","citing_paper":"/paper/2501.00823"},"observation_digest":"sha256:dae4a87d89794a01087ebac70fcd13efa4cf22438c8c440d04b01f5f60227c0d","observation_id":"569b32db-d4d7-4a47-ad52-2d462ce4d619","resolution":{"observed_at":"2026-08-10T22:48:10.801282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.06146","last_updated":"2018-05-23T09:23:47Z","snapshot_observed_at":"2026-08-14T19:54:00.470999Z","submitted_at":"2018-01-18T17:54:52Z","title":"Universal Language Model Fine-tuning for Text Classification","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.06146","snapshot_observed_at":"2026-08-10T22:48:10.806872Z","title":"Improving language understanding by generative pre-training","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.00823","last_updated":"2025-01-06T14:26:41Z","snapshot_observed_at":"2026-08-21T07:53:20.144398Z","submitted_at":"2025-01-01T12:55:57Z","title":"Decoupling Knowledge and Reasoning in Transformers: A Modular Architecture with Generalized Cross-Attention","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T22:48:10.806872Z"},"links":{"cited_paper":"/paper/1801.06146","citing_paper":"/paper/2501.00823"},"observation_digest":"sha256:375792daa3ed3ec14c35b05ecc63190217d1e5a1bbbca1f6b0965a11fd03b8ae","observation_id":"1caf7237-ec8a-4cad-81d7-b3bd631f8da0","resolution":{"observed_at":"2026-08-10T22:48:10.806872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:48:11.035041Z","title":"Self-attention with relative position rep- resentations","venue":null,"work_id":"3a7430dc-f0f2-44f2-8134-674093a26f28","year":2018},"citing_paper":{"arxiv_id":"2501.00823","last_updated":"2025-01-06T14:26:41Z","snapshot_observed_at":"2026-08-21T07:53:20.144398Z","submitted_at":"2025-01-01T12:55:57Z","title":"Decoupling Knowledge and Reasoning in Transformers: A Modular Architecture with Generalized Cross-Attention","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T22:48:10.811887Z"},"links":{"citing_paper":"/paper/2501.00823"},"observation_digest":"sha256:2c472a47d105e44221a0524db0d3939f673a85259d1d5739d23bc4de60676ba3","observation_id":"6a63faa7-031d-4473-b52f-fb43caae246f","resolution":{"observed_at":"2026-08-10T22:48:11.040321Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:48:11.018092Z","title":"Deep inside convolutional networks: Visualising image classification models and saliency maps","venue":null,"work_id":"9dc8e4ff-d01e-4a67-9e94-d24300671630","year":2013},"citing_paper":{"arxiv_id":"2501.00823","last_updated":"2025-01-06T14:26:41Z","snapshot_observed_at":"2026-08-21T07:53:20.144398Z","submitted_at":"2025-01-01T12:55:57Z","title":"Decoupling Knowledge and Reasoning in Transformers: A Modular Architecture with Generalized Cross-Attention","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T22:48:10.816576Z"},"links":{"citing_paper":"/paper/2501.00823"},"observation_digest":"sha256:21b054a3786efcf6418d292f61df2bc87796e638e214246429b1420bccc929f7","observation_id":"d757b1a6-0996-4525-9a98-14f71ea9ebf5","resolution":{"observed_at":"2026-08-10T22:48:11.023520Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:48:10.821185Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.00823","last_updated":"2025-01-06T14:26:41Z","snapshot_observed_at":"2026-08-21T07:53:20.144398Z","submitted_at":"2025-01-01T12:55:57Z","title":"Decoupling Knowledge and Reasoning in Transformers: A Modular Architecture with Generalized Cross-Attention","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T22:48:10.821185Z"},"links":{"citing_paper":"/paper/2501.00823"},"observation_digest":"sha256:2540b635a0c9057b72389305525c8acc36fe4c8dfb2335659536edc104b17c0b","observation_id":"b6c41dcf-89f7-4344-8aac-b996332aa4af","resolution":{"observed_at":"2026-08-10T22:48:10.821185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:48:10.987824Z","title":"Multiscale visualization of attention in the transformer model","venue":null,"work_id":"6beb4f04-ffbf-4b79-a4f9-5e7218642cb3","year":2019},"citing_paper":{"arxiv_id":"2501.00823","last_updated":"2025-01-06T14:26:41Z","snapshot_observed_at":"2026-08-21T07:53:20.144398Z","submitted_at":"2025-01-01T12:55:57Z","title":"Decoupling Knowledge and Reasoning in Transformers: A Modular Architecture with Generalized Cross-Attention","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T22:48:10.825959Z"},"links":{"citing_paper":"/paper/2501.00823"},"observation_digest":"sha256:9cba58ac7185e096d33d6215715b671180e3228bd0e4fa33a365cf6aab3e111d","observation_id":"a2550a77-d33e-4388-8886-b27efd886529","resolution":{"observed_at":"2026-08-10T22:48:10.995067Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:48:10.969651Z","title":"Parameterized transformers","venue":null,"work_id":"59f312c0-e4f7-4127-bfd5-f0e7e0ed66e1","year":2021},"citing_paper":{"arxiv_id":"2501.00823","last_updated":"2025-01-06T14:26:41Z","snapshot_observed_at":"2026-08-21T07:53:20.144398Z","submitted_at":"2025-01-01T12:55:57Z","title":"Decoupling Knowledge and Reasoning in Transformers: A Modular Architecture with Generalized Cross-Attention","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T22:48:10.830682Z"},"links":{"citing_paper":"/paper/2501.00823"},"observation_digest":"sha256:1ecfc92ce0a3e12150ee00aeec3ea538279332beef53c3c82e3889680a0cc1f8","observation_id":"4ddf0089-0d06-4c2b-b199-8d3ef2db154f","resolution":{"observed_at":"2026-08-10T22:48:10.975700Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.00823","last_updated":"2025-01-06T14:26:41Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-21T07:53:20.144398Z","submitted_at":"2025-01-01T12:55:57Z","title":"Decoupling Knowledge and Reasoning in Transformers: A Modular Architecture with Generalized Cross-Attention"},"reference_resolution":{"displayed":19,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":9,"verified_exact":0,"verified_fuzzy":10},"total_outbound_references":19},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 19 of 19 outbound references and 0 inbound Pith citation observations for arXiv:2501.00823."}