{"as_of":"2026-08-12T16:49:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c8586f8e815d99c713e46edfbb976741f8a10471e6a5efa2b7d85b943259d043","coverage":[{"denominator":36,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":36,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T21:16:23.996106Z","state":"measured"},{"denominator":36,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":36,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2502.09503/citation-record","integrity":"/paper/2502.09503/integrity","json":"/paper/2502.09503/citation-record.json","paper":"/paper/2502.09503"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1706.03762","last_updated":"2023-08-02T00:41:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-06-12T17:57:34Z","title":"Attention Is All You Need","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.03762","snapshot_observed_at":"2026-08-07T21:16:23.841412Z","title":"Attention Is All You Need,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09503","last_updated":"2025-02-14T21:38:39Z","snapshot_observed_at":"2026-08-11T04:53:11.381200Z","submitted_at":"2025-02-13T17:15:26Z","title":"AttentionSmithy: A Modular Framework for Rapid Transformer Development and Customization","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T21:16:23.841412Z"},"links":{"cited_paper":"/paper/1706.03762","citing_paper":"/paper/2502.09503"},"observation_digest":"sha256:2f11c3b490e90e080a3960f553ca121817d7c20e42c0a81a67d80e9f4d7657d8","observation_id":"a7c903d0-88b4-49ab-bb9b-71c93de71f13","resolution":{"observed_at":"2026-08-07T21:16:23.841412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/s43681-024-00435-4","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"Exploring ChatGPT and its impact on society,","venue":"AI and Ethics","work_id":"af339fea-714a-4fc1-b94d-47131b06cfa3","year":2024},"citing_paper":{"arxiv_id":"2502.09503","last_updated":"2025-02-14T21:38:39Z","snapshot_observed_at":"2026-08-11T04:53:11.381200Z","submitted_at":"2025-02-13T17:15:26Z","title":"AttentionSmithy: A Modular Framework for Rapid Transformer Development and Customization","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T21:16:23.846097Z"},"links":{"citing_paper":"/paper/2502.09503"},"observation_digest":"sha256:01145c6c570c43400fba902e715108b715694ef48236920615bc3e3987c0eb5d","observation_id":"be2c4fc7-d896-4238-94be-86553b5877ae","resolution":{"observed_at":"2026-08-07T21:16:24.248893Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:16:23.850026Z","title":"Long Short-Term Memory,","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2502.09503","last_updated":"2025-02-14T21:38:39Z","snapshot_observed_at":"2026-08-11T04:53:11.381200Z","submitted_at":"2025-02-13T17:15:26Z","title":"AttentionSmithy: A Modular Framework for Rapid Transformer Development and Customization","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T21:16:23.850026Z"},"links":{"citing_paper":"/paper/2502.09503"},"observation_digest":"sha256:ac7a7d4e035d69374837e0d91aebca21c7b5081ab43c426a887ff45516159790","observation_id":"1477fe55-62db-40d3-b771-26d7aa9e2253","resolution":{"observed_at":"2026-08-07T21:16:23.850026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:16:23.854008Z","title":"Transformers in the Real World: A Survey on NLP Applications,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09503","last_updated":"2025-02-14T21:38:39Z","snapshot_observed_at":"2026-08-11T04:53:11.381200Z","submitted_at":"2025-02-13T17:15:26Z","title":"AttentionSmithy: A Modular Framework for Rapid Transformer Development and Customization","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T21:16:23.854008Z"},"links":{"citing_paper":"/paper/2502.09503"},"observation_digest":"sha256:33ef4720928ddd24881c91bdfcc29239a74569cc8151130ab884e21718fb1dd4","observation_id":"48e2639d-b16b-43eb-acf8-a6839ea65116","resolution":{"observed_at":"2026-08-07T21:16:23.854008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15178","last_updated":"2024-08-27T16:22:18Z","snapshot_observed_at":"2026-08-10T14:08:53.727460Z","submitted_at":"2024-08-27T16:22:18Z","title":"A Review of Transformer-Based Models for Computer Vision Tasks: Capturing Global Context and Spatial Relationships","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15178","snapshot_observed_at":"2026-08-07T21:16:23.858245Z","title":"A Review of Transformer-Based Models for Computer Vision Tasks: Capturing Global Context and Spatial Relationships,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09503","last_updated":"2025-02-14T21:38:39Z","snapshot_observed_at":"2026-08-11T04:53:11.381200Z","submitted_at":"2025-02-13T17:15:26Z","title":"AttentionSmithy: A Modular Framework for Rapid Transformer Development and Customization","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T21:16:23.858245Z"},"links":{"cited_paper":"/paper/2408.15178","citing_paper":"/paper/2502.09503"},"observation_digest":"sha256:3ad3d680aaedfe17c1468dc75e9175d26cc1e161c0f6d71a94c7d8e96511dbb1","observation_id":"d1040475-88c4-42d2-b88c-532ed7d5800e","resolution":{"observed_at":"2026-08-07T21:16:23.858245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2024.10290","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:16:24.656869Z","title":"Transformers in Healthcare: A Survey,","venue":null,"work_id":"4652d608-005e-4bbb-add3-ccc9296e90a0","year":2024},"citing_paper":{"arxiv_id":"2502.09503","last_updated":"2025-02-14T21:38:39Z","snapshot_observed_at":"2026-08-11T04:53:11.381200Z","submitted_at":"2025-02-13T17:15:26Z","title":"AttentionSmithy: A Modular Framework for Rapid Transformer Development and Customization","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T21:16:23.863006Z"},"links":{"citing_paper":"/paper/2502.09503"},"observation_digest":"sha256:6756fd6de97fdf0f6cb7decd232f78497a3fbe6d4ba24d3c06bcf4e1b8b8258b","observation_id":"a5d2b36f-b503-4804-a3f6-00fc2d1d7433","resolution":{"observed_at":"2026-08-07T21:16:24.664387Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:16:23.868559Z","title":"Transformer technology in molecular science,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09503","last_updated":"2025-02-14T21:38:39Z","snapshot_observed_at":"2026-08-11T04:53:11.381200Z","submitted_at":"2025-02-13T17:15:26Z","title":"AttentionSmithy: A Modular Framework for Rapid Transformer Development and Customization","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T21:16:23.868559Z"},"links":{"citing_paper":"/paper/2502.09503"},"observation_digest":"sha256:17a593c1926cf8b6db16e30c29fac8b9b76f31c72d64231e74cb5bca29ffe04e","observation_id":"56f322a3-8e11-44b4-bb50-12c7900b0228","resolution":{"observed_at":"2026-08-07T21:16:23.868559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:16:23.873199Z","title":"Transformer Architecture and Attention Mechanisms in Genome Data Analysis: A Comprehensive Review,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09503","last_updated":"2025-02-14T21:38:39Z","snapshot_observed_at":"2026-08-11T04:53:11.381200Z","submitted_at":"2025-02-13T17:15:26Z","title":"AttentionSmithy: A Modular Framework for Rapid Transformer Development and Customization","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T21:16:23.873199Z"},"links":{"citing_paper":"/paper/2502.09503"},"observation_digest":"sha256:6f2bdefbe114976ebf772b64dd260586445d7a62512eb299954d1cbc5ad0321d","observation_id":"a13bb1ab-cfa3-4754-8123-6d3f278017ed","resolution":{"observed_at":"2026-08-07T21:16:23.873199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.04903","last_updated":"2020-10-10T05:03:14Z","snapshot_observed_at":"2026-07-06T10:03:10.192827Z","submitted_at":"2020-10-10T05:03:14Z","title":"What Do Position Embeddings Learn? An Empirical Study of Pre-Trained Language Model Positional Encoding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.04903","snapshot_observed_at":"2026-08-07T21:16:23.878829Z","title":"What Do Position Embeddings Learn? An Empirical Study of Pre-Trained Language Model Positional Encoding,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.09503","last_updated":"2025-02-14T21:38:39Z","snapshot_observed_at":"2026-08-11T04:53:11.381200Z","submitted_at":"2025-02-13T17:15:26Z","title":"AttentionSmithy: A Modular Framework for Rapid Transformer Development and Customization","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T21:16:23.878829Z"},"links":{"cited_paper":"/paper/2010.04903","citing_paper":"/paper/2502.09503"},"observation_digest":"sha256:f04519297f5392879d02eaf2767a02d50719e6a0e089abbbe61104ba87b5ad83","observation_id":"6f06bcc8-4d3a-4688-9a06-bdb63175cfc6","resolution":{"observed_at":"2026-08-07T21:16:23.878829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.09864","last_updated":"2023-11-08T13:36:32Z","snapshot_observed_at":"2026-08-12T04:55:58.532015Z","submitted_at":"2021-04-20T09:54:06Z","title":"RoFormer: Enhanced Transformer with Rotary Position Embedding","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.09864","snapshot_observed_at":"2026-08-07T21:16:23.884912Z","title":"RoFormer: Enhanced Transformer with Rotary Position Embedding,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09503","last_updated":"2025-02-14T21:38:39Z","snapshot_observed_at":"2026-08-11T04:53:11.381200Z","submitted_at":"2025-02-13T17:15:26Z","title":"AttentionSmithy: A Modular Framework for Rapid Transformer Development and Customization","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T21:16:23.884912Z"},"links":{"cited_paper":"/paper/2104.09864","citing_paper":"/paper/2502.09503"},"observation_digest":"sha256:5586206da19e1f9c03848ca2a5861b498b056f02bf21b38ccf040394be83cc2f","observation_id":"ec86cbc9-646a-456f-a50c-1da7fdb0e33c","resolution":{"observed_at":"2026-08-07T21:16:23.884912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.12409","last_updated":"2022-04-22T18:20:48Z","snapshot_observed_at":"2026-08-07T11:26:24.970964Z","submitted_at":"2021-08-27T17:35:06Z","title":"Train Short, Test Long: Attention with Linear Biases Enables Input Length Extrapolation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.12409","snapshot_observed_at":"2026-08-07T21:16:23.890216Z","title":"Train Short, Test Long: Attention with Linear Biases Enables Input Length Extrapolation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.09503","last_updated":"2025-02-14T21:38:39Z","snapshot_observed_at":"2026-08-11T04:53:11.381200Z","submitted_at":"2025-02-13T17:15:26Z","title":"AttentionSmithy: A Modular Framework for Rapid Transformer Development and Customization","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T21:16:23.890216Z"},"links":{"cited_paper":"/paper/2108.12409","citing_paper":"/paper/2502.09503"},"observation_digest":"sha256:d1b7055b6f24065aa69d108c6d6644b4d9edb4a9639b55c4a6427665fb284a74","observation_id":"9bd981ac-a718-4cbe-b92d-2f59c0d99f00","resolution":{"observed_at":"2026-08-07T21:16:23.890216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:16:23.895155Z","title":"Neural Architecture Search for Transformers: A Survey,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.09503","last_updated":"2025-02-14T21:38:39Z","snapshot_observed_at":"2026-08-11T04:53:11.381200Z","submitted_at":"2025-02-13T17:15:26Z","title":"AttentionSmithy: A Modular Framework for Rapid Transformer Development and Customization","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T21:16:23.895155Z"},"links":{"citing_paper":"/paper/2502.09503"},"observation_digest":"sha256:1c6ae821d341b3b33cf5adae4625dd8834b591c3d1bd913913ac8d56eb1f8807","observation_id":"170585b3-b345-4701-97d4-48ef25201b80","resolution":{"observed_at":"2026-08-07T21:16:23.895155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.13955","last_updated":"2022-07-28T08:41:41Z","snapshot_observed_at":"2026-07-06T13:36:14.246767Z","submitted_at":"2022-07-28T08:41:41Z","title":"Neural Architecture Search on Efficient Transformers and Beyond","version":1},"cited_work":{"arxiv_id":"2207.13955","doi":"10.48550/arxiv.2207.13955","metadata_source":"pith","pith_arxiv_id":"2207.13955","snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"Neural Architecture Search on Efficient Transformers and Beyond","venue":"cs.CL","work_id":"43172bc6-2489-4af4-9359-e6af5d57f9c5","year":2022},"citing_paper":{"arxiv_id":"2502.09503","last_updated":"2025-02-14T21:38:39Z","snapshot_observed_at":"2026-08-11T04:53:11.381200Z","submitted_at":"2025-02-13T17:15:26Z","title":"AttentionSmithy: A Modular Framework for Rapid Transformer Development and Customization","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T21:16:23.899442Z"},"links":{"cited_paper":"/paper/2207.13955","citing_paper":"/paper/2502.09503"},"observation_digest":"sha256:77345550d7b1f5dc81891ad6da029ffdfd3e4d9c7cac0087ba237f1a0312ccac","observation_id":"107cda2f-aa03-4e18-8842-43c65e39329a","resolution":{"observed_at":"2026-08-07T21:16:24.144286Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.03771","last_updated":"2020-07-14T03:42:34Z","snapshot_observed_at":"2026-07-06T08:27:58.343233Z","submitted_at":"2019-10-09T03:23:22Z","title":"HuggingFace's Transformers: State-of-the-art Natural Language Processing","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.03771","snapshot_observed_at":"2026-08-07T21:16:23.904751Z","title":"HuggingFace’s Transformers: State-of-the-art Natural Language Processing,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.09503","last_updated":"2025-02-14T21:38:39Z","snapshot_observed_at":"2026-08-11T04:53:11.381200Z","submitted_at":"2025-02-13T17:15:26Z","title":"AttentionSmithy: A Modular Framework for Rapid Transformer Development and Customization","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T21:16:23.904751Z"},"links":{"cited_paper":"/paper/1910.03771","citing_paper":"/paper/2502.09503"},"observation_digest":"sha256:f1f4d7202f618de3ce97e30592da9595f52ca030d544451dcb904e7b5886e7c2","observation_id":"a5d7cc69-6324-4ccf-ba85-57e2ae95a064","resolution":{"observed_at":"2026-08-07T21:16:23.904751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:16:23.910279Z","title":"PyTorch 2: Faster Machine Learning Through Dynamic Python Bytecode Transformation and Graph Compilation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09503","last_updated":"2025-02-14T21:38:39Z","snapshot_observed_at":"2026-08-11T04:53:11.381200Z","submitted_at":"2025-02-13T17:15:26Z","title":"AttentionSmithy: A Modular Framework for Rapid Transformer Development and Customization","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T21:16:23.910279Z"},"links":{"citing_paper":"/paper/2502.09503"},"observation_digest":"sha256:5259cb22557e22cd48011ab586cf7ab413c6bf394f6a7530fac79b8a301f654c","observation_id":"7c70131f-c03b-46f9-a8fd-068c9f19667f","resolution":{"observed_at":"2026-08-07T21:16:23.910279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:16:24.819295Z","title":"Transformer — PyTorch 2.6 documentation","venue":null,"work_id":"72f286ae-d190-4d21-ac79-2e4cdb9ca42b","year":2025},"citing_paper":{"arxiv_id":"2502.09503","last_updated":"2025-02-14T21:38:39Z","snapshot_observed_at":"2026-08-11T04:53:11.381200Z","submitted_at":"2025-02-13T17:15:26Z","title":"AttentionSmithy: A Modular Framework for Rapid Transformer Development and Customization","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T21:16:23.914158Z"},"links":{"citing_paper":"/paper/2502.09503"},"observation_digest":"sha256:d0ba5b598a84ce8ded47268799e1036141a1fb70457ed154706774d0293b71f1","observation_id":"baee90fe-fb98-41fb-9cc3-d855b892c0db","resolution":{"observed_at":"2026-08-07T21:16:24.823779Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:16:24.805199Z","title":"TensorFlow: Large-Scale Machine Learning on Heterogeneous Systems","venue":null,"work_id":"0103f424-2817-4082-b2e0-86a4a7a9ea4a","year":2015},"citing_paper":{"arxiv_id":"2502.09503","last_updated":"2025-02-14T21:38:39Z","snapshot_observed_at":"2026-08-11T04:53:11.381200Z","submitted_at":"2025-02-13T17:15:26Z","title":"AttentionSmithy: A Modular Framework for Rapid Transformer Development and Customization","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T21:16:23.918292Z"},"links":{"citing_paper":"/paper/2502.09503"},"observation_digest":"sha256:1cada0f7c8081ef285c2178b9467d08618e363c17ba9d6b01f711ab1d33b20af","observation_id":"2f3e7d39-534d-40c2-a965-c2db54ed4916","resolution":{"observed_at":"2026-08-07T21:16:24.810082Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:16:24.790328Z","title":"models/official/nlp/modeling at master · tensorflow/models,","venue":null,"work_id":"63acc359-db2b-4cc2-978c-424a3cef52c5","year":null},"citing_paper":{"arxiv_id":"2502.09503","last_updated":"2025-02-14T21:38:39Z","snapshot_observed_at":"2026-08-11T04:53:11.381200Z","submitted_at":"2025-02-13T17:15:26Z","title":"AttentionSmithy: A Modular Framework for Rapid Transformer Development and Customization","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T21:16:23.922551Z"},"links":{"citing_paper":"/paper/2502.09503"},"observation_digest":"sha256:1046cf9ee055164f225c8714d0d7fa74d97e0bc6561611cbabe375ec228da0a3","observation_id":"604ae2bb-25d1-4f78-87ef-4d8aad830bc2","resolution":{"observed_at":"2026-08-07T21:16:24.795337Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:16:24.762150Z","title":"Customizing a Transformer Encoder | Text,","venue":null,"work_id":"26c392d6-bab2-41f6-972e-47e96c33710a","year":2025},"citing_paper":{"arxiv_id":"2502.09503","last_updated":"2025-02-14T21:38:39Z","snapshot_observed_at":"2026-08-11T04:53:11.381200Z","submitted_at":"2025-02-13T17:15:26Z","title":"AttentionSmithy: A Modular Framework for Rapid Transformer Development and Customization","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T21:16:23.931141Z"},"links":{"citing_paper":"/paper/2502.09503"},"observation_digest":"sha256:12122232f5588153555a3295cf7b4e09685d8d2242ecfed141faeb8c14ed902f","observation_id":"0b16a03c-1384-4f7b-8168-646c12729cd4","resolution":{"observed_at":"2026-08-07T21:16:24.767234Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:16:24.750235Z","title":"Ousterhout, A Philosophy of Software Design, 1st ed","venue":null,"work_id":"9f4e8cb0-5613-4ac9-b887-d606c4b4640b","year":2018},"citing_paper":{"arxiv_id":"2502.09503","last_updated":"2025-02-14T21:38:39Z","snapshot_observed_at":"2026-08-11T04:53:11.381200Z","submitted_at":"2025-02-13T17:15:26Z","title":"AttentionSmithy: A Modular Framework for Rapid Transformer Development and Customization","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T21:16:23.934782Z"},"links":{"citing_paper":"/paper/2502.09503"},"observation_digest":"sha256:4822ea7566f9b6ab67edf1af2bedafb90d4d2580180944ac10c45b9e59a94542","observation_id":"03121d5e-0919-4fff-b09d-60b2844a24ce","resolution":{"observed_at":"2026-08-07T21:16:24.753797Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:16:24.736285Z","title":"Vogel, I","venue":null,"work_id":"1456ebbb-cd21-4593-a4ca-36b681ceebe9","year":2011},"citing_paper":{"arxiv_id":"2502.09503","last_updated":"2025-02-14T21:38:39Z","snapshot_observed_at":"2026-08-11T04:53:11.381200Z","submitted_at":"2025-02-13T17:15:26Z","title":"AttentionSmithy: A Modular Framework for Rapid Transformer Development and Customization","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T21:16:23.938080Z"},"links":{"citing_paper":"/paper/2502.09503"},"observation_digest":"sha256:979de6be9cac49c0693c62eb02881710954bbd119d92a9cd79ce382b45c4abef","observation_id":"92c51d2c-ae24-48fd-92c2-32dbaafa9a1d","resolution":{"observed_at":"2026-08-07T21:16:24.740843Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:16:24.722223Z","title":"Gamma, R","venue":null,"work_id":"8c284a27-4039-4792-b867-0d55c3bdb418","year":1995},"citing_paper":{"arxiv_id":"2502.09503","last_updated":"2025-02-14T21:38:39Z","snapshot_observed_at":"2026-08-11T04:53:11.381200Z","submitted_at":"2025-02-13T17:15:26Z","title":"AttentionSmithy: A Modular Framework for Rapid Transformer Development and Customization","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T21:16:23.941604Z"},"links":{"citing_paper":"/paper/2502.09503"},"observation_digest":"sha256:42c9fb4f448791a1e1fc01d48a162ca2f87b1c3a7e37e764f1b13608b0ebfe51","observation_id":"8d5f6a7a-3418-44ea-b022-a600062ad15a","resolution":{"observed_at":"2026-08-07T21:16:24.726535Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.07730","last_updated":"2024-03-31T21:20:30Z","snapshot_observed_at":"2026-08-12T06:59:58.128322Z","submitted_at":"2023-02-12T01:26:49Z","title":"Transformer models: an introduction and catalog","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.07730","snapshot_observed_at":"2026-08-07T21:16:23.945094Z","title":"Transformer models: an introduction and catalog,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09503","last_updated":"2025-02-14T21:38:39Z","snapshot_observed_at":"2026-08-11T04:53:11.381200Z","submitted_at":"2025-02-13T17:15:26Z","title":"AttentionSmithy: A Modular Framework for Rapid Transformer Development and Customization","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T21:16:23.945094Z"},"links":{"cited_paper":"/paper/2302.07730","citing_paper":"/paper/2502.09503"},"observation_digest":"sha256:6a30412cf00bdca713758414f5647a28170f2ee459c85df7f1b09c5f54b8c8ad","observation_id":"ef530dd1-be08-4945-8da0-e38e9d66a056","resolution":{"observed_at":"2026-08-07T21:16:23.945094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.05150","last_updated":"2020-12-02T17:52:35Z","snapshot_observed_at":"2026-07-31T17:17:17.205582Z","submitted_at":"2020-04-10T17:54:09Z","title":"Longformer: The Long-Document Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.05150","snapshot_observed_at":"2026-08-07T21:16:23.948909Z","title":"Longformer: The Long-Document Transformer,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.09503","last_updated":"2025-02-14T21:38:39Z","snapshot_observed_at":"2026-08-11T04:53:11.381200Z","submitted_at":"2025-02-13T17:15:26Z","title":"AttentionSmithy: A Modular Framework for Rapid Transformer Development and Customization","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T21:16:23.948909Z"},"links":{"cited_paper":"/paper/2004.05150","citing_paper":"/paper/2502.09503"},"observation_digest":"sha256:52d29e5a0df4637e4969600a013ecd443ca4488356f593d10ba4b1c4fab74bab","observation_id":"f0d55313-bcf2-4da0-a770-796c0e8d1bfc","resolution":{"observed_at":"2026-08-07T21:16:23.948909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2007.14062","last_updated":"2021-01-08T07:41:50Z","snapshot_observed_at":"2026-08-10T19:17:03.595450Z","submitted_at":"2020-07-28T08:34:04Z","title":"Big Bird: Transformers for Longer Sequences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2007.14062","snapshot_observed_at":"2026-08-07T21:16:23.953420Z","title":"Big Bird: Transformers for Longer Sequences,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.09503","last_updated":"2025-02-14T21:38:39Z","snapshot_observed_at":"2026-08-11T04:53:11.381200Z","submitted_at":"2025-02-13T17:15:26Z","title":"AttentionSmithy: A Modular Framework for Rapid Transformer Development and Customization","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T21:16:23.953420Z"},"links":{"cited_paper":"/paper/2007.14062","citing_paper":"/paper/2502.09503"},"observation_digest":"sha256:1be593bbca6da79d0df234efb102a037887d67ca089ff68ecdf3d2d477035ceb","observation_id":"b397da3b-45e4-45d1-9190-91316e544687","resolution":{"observed_at":"2026-08-07T21:16:23.953420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:16:24.706197Z","title":"Multi-Objective NAS with Ax — PyTorch Tutorials 2.3.0+cu121 documentation","venue":null,"work_id":"eeaddd8e-8dcb-40b4-975b-3f063f6c67c3","year":2024},"citing_paper":{"arxiv_id":"2502.09503","last_updated":"2025-02-14T21:38:39Z","snapshot_observed_at":"2026-08-11T04:53:11.381200Z","submitted_at":"2025-02-13T17:15:26Z","title":"AttentionSmithy: A Modular Framework for Rapid Transformer Development and Customization","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T21:16:23.957896Z"},"links":{"citing_paper":"/paper/2502.09503"},"observation_digest":"sha256:54e05558b9de275b208a3fcb85533ff3f2c8013bdd4b26a405142c0e6575314a","observation_id":"d691a8a2-e03f-46c8-a0d2-8e7ccd23dd1b","resolution":{"observed_at":"2026-08-07T21:16:24.711717Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:16:24.689829Z","title":null,"venue":null,"work_id":"a042efed-ac06-4c91-8ae8-7669e798e52c","year":2025},"citing_paper":{"arxiv_id":"2502.09503","last_updated":"2025-02-14T21:38:39Z","snapshot_observed_at":"2026-08-11T04:53:11.381200Z","submitted_at":"2025-02-13T17:15:26Z","title":"AttentionSmithy: A Modular Framework for Rapid Transformer Development and Customization","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T21:16:23.961946Z"},"links":{"citing_paper":"/paper/2502.09503"},"observation_digest":"sha256:345f140a543609f4e4145b9b878dc6a1847732a4d6774361a47d25d4268d2619","observation_id":"3135ca8d-93ea-4186-9873-44aa9246d986","resolution":{"observed_at":"2026-08-07T21:16:24.694949Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:16:23.966460Z","title":"Bleu: a Method for Automatic Evaluation of Machine Translation,","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2502.09503","last_updated":"2025-02-14T21:38:39Z","snapshot_observed_at":"2026-08-11T04:53:11.381200Z","submitted_at":"2025-02-13T17:15:26Z","title":"AttentionSmithy: A Modular Framework for Rapid Transformer Development and Customization","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T21:16:23.966460Z"},"links":{"citing_paper":"/paper/2502.09503"},"observation_digest":"sha256:971af36ad0cd01e6c9c92e098de55ca4c0223f4a99e236f9027aed2972fc8507","observation_id":"1bf265f4-29f5-4bfe-8504-040fdbfcd4b3","resolution":{"observed_at":"2026-08-07T21:16:23.966460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:16:23.970525Z","title":"Findings of the 2014 Workshop on Statistical Machine Translation,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2502.09503","last_updated":"2025-02-14T21:38:39Z","snapshot_observed_at":"2026-08-11T04:53:11.381200Z","submitted_at":"2025-02-13T17:15:26Z","title":"AttentionSmithy: A Modular Framework for Rapid Transformer Development and Customization","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T21:16:23.970525Z"},"links":{"citing_paper":"/paper/2502.09503"},"observation_digest":"sha256:a29261f4d1f9024ae99ce3a8a23d742c1be9273e1a2446db0f1ea6305b145389","observation_id":"baeb10ee-aefd-4eb5-96d0-41a7f2904a95","resolution":{"observed_at":"2026-08-07T21:16:23.970525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:16:23.974616Z","title":"Transfer learning enables predictions in network biology,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09503","last_updated":"2025-02-14T21:38:39Z","snapshot_observed_at":"2026-08-11T04:53:11.381200Z","submitted_at":"2025-02-13T17:15:26Z","title":"AttentionSmithy: A Modular Framework for Rapid Transformer Development and Customization","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T21:16:23.974616Z"},"links":{"citing_paper":"/paper/2502.09503"},"observation_digest":"sha256:2abba1736a26a30aa8be821d19a00c9ed39a1972d9004ad223e21f2549962ae7","observation_id":"f1871e75-2ded-4e99-a8a9-3aed688dfa7c","resolution":{"observed_at":"2026-08-07T21:16:23.974616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:16:24.675897Z","title":"The Annotated Transformer","venue":null,"work_id":"b72e4dd9-cf37-44ee-be32-d753f6f1bc30","year":2024},"citing_paper":{"arxiv_id":"2502.09503","last_updated":"2025-02-14T21:38:39Z","snapshot_observed_at":"2026-08-11T04:53:11.381200Z","submitted_at":"2025-02-13T17:15:26Z","title":"AttentionSmithy: A Modular Framework for Rapid Transformer Development and Customization","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T21:16:23.978977Z"},"links":{"citing_paper":"/paper/2502.09503"},"observation_digest":"sha256:0a225f849babe1f2d90d7380114e6313183f2c1c62651295a913b94eacb8260a","observation_id":"7f036fde-c48d-44e0-ae7e-4c8ff50ee1fb","resolution":{"observed_at":"2026-08-07T21:16:24.680458Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:16:23.982912Z","title":"Falcon and The PyTorch Lightning team, PyTorch Lightning","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.09503","last_updated":"2025-02-14T21:38:39Z","snapshot_observed_at":"2026-08-11T04:53:11.381200Z","submitted_at":"2025-02-13T17:15:26Z","title":"AttentionSmithy: A Modular Framework for Rapid Transformer Development and Customization","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T21:16:23.982912Z"},"links":{"citing_paper":"/paper/2502.09503"},"observation_digest":"sha256:50dddf46c0cdb3d5eec8ea605ea78a84331cc878eb5280987c299cae53b4bbce","observation_id":"d86ed43f-8388-47f0-a250-b83367a1d105","resolution":{"observed_at":"2026-08-07T21:16:23.982912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:16:23.986855Z","title":"Self-Supervised Speech Representation Learning: A Review,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.09503","last_updated":"2025-02-14T21:38:39Z","snapshot_observed_at":"2026-08-11T04:53:11.381200Z","submitted_at":"2025-02-13T17:15:26Z","title":"AttentionSmithy: A Modular Framework for Rapid Transformer Development and Customization","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T21:16:23.986855Z"},"links":{"citing_paper":"/paper/2502.09503"},"observation_digest":"sha256:cf7ccbba4eeb05f9942bcd7b028b9dc8617ffb5e3eac78a2897896b1cd430d61","observation_id":"ab1a82ba-219a-44da-b27b-9e7bb57b7cfa","resolution":{"observed_at":"2026-08-07T21:16:23.986855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.02155","last_updated":"2018-04-12T18:51:33Z","snapshot_observed_at":"2026-08-10T12:31:20.109533Z","submitted_at":"2018-03-06T13:13:11Z","title":"Self-Attention with Relative Position Representations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.02155","snapshot_observed_at":"2026-08-07T21:16:23.991407Z","title":"Self-Attention with Relative Position Representations,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.09503","last_updated":"2025-02-14T21:38:39Z","snapshot_observed_at":"2026-08-11T04:53:11.381200Z","submitted_at":"2025-02-13T17:15:26Z","title":"AttentionSmithy: A Modular Framework for Rapid Transformer Development and Customization","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T21:16:23.991407Z"},"links":{"cited_paper":"/paper/1803.02155","citing_paper":"/paper/2502.09503"},"observation_digest":"sha256:b277e1571815fe81f90bec4885822265c9c921b78603514f7080a8214e1b3add","observation_id":"d05b35df-7c56-4102-98a8-c2fdf7cef293","resolution":{"observed_at":"2026-08-07T21:16:23.991407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.10683","last_updated":"2023-09-19T15:14:48Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-10-23T17:37:36Z","title":"Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.10683","snapshot_observed_at":"2026-08-07T21:16:23.996106Z","title":"Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09503","last_updated":"2025-02-14T21:38:39Z","snapshot_observed_at":"2026-08-11T04:53:11.381200Z","submitted_at":"2025-02-13T17:15:26Z","title":"AttentionSmithy: A Modular Framework for Rapid Transformer Development and Customization","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T21:16:23.996106Z"},"links":{"cited_paper":"/paper/1910.10683","citing_paper":"/paper/2502.09503"},"observation_digest":"sha256:f3ae99d470a6df59aebc62650c1059f0dd55d541ae0d05953ec09c13519d523b","observation_id":"fedc2b9e-5ccf-436a-a4c1-f125cf785349","resolution":{"observed_at":"2026-08-07T21:16:23.996106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:16:24.776298Z","title":"Available: https://github.com/tensorflow/models/tree/master/official/nlp/modeling","venue":null,"work_id":"9a92eef3-1997-403e-b7de-a83e62087255","year":null},"citing_paper":{"arxiv_id":"2502.09503","last_updated":"2025-02-14T21:38:39Z","snapshot_observed_at":"2026-08-11T04:53:11.381200Z","submitted_at":"2025-02-13T17:15:26Z","title":"AttentionSmithy: A Modular Framework for Rapid Transformer Development and Customization","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T21:16:23.927058Z"},"links":{"citing_paper":"/paper/2502.09503"},"observation_digest":"sha256:92b0847257b0fbf9be8659e58bfdcf2f8fd2d3f57a345cd4512b1423e87df93d","observation_id":"20423c3b-536c-45a6-88b0-3659935f46d5","resolution":{"observed_at":"2026-08-07T21:16:24.780824Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2502.09503","last_updated":"2025-02-14T21:38:39Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-11T04:53:11.381200Z","submitted_at":"2025-02-13T17:15:26Z","title":"AttentionSmithy: A Modular Framework for Rapid Transformer Development and Customization"},"reference_resolution":{"displayed":36,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":23,"verified_exact":2,"verified_fuzzy":10},"total_outbound_references":36},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 36 of 36 outbound references and 0 inbound Pith citation observations for arXiv:2502.09503."}