{"as_of":"2026-08-20T11:14:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:83334c662d69bdb3db6311c08391d8ed3caaebdd5f869f283000b13f1450a70d","coverage":[{"denominator":17,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":17,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T16:50:02.473697Z","state":"measured"},{"denominator":18,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":18,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T21:20:34.027247Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.17679","last_updated":"2025-08-25T05:22:27Z","snapshot_observed_at":"2026-08-17T02:31:17.392838Z","submitted_at":"2025-08-25T05:22:27Z","title":"Characterizing the Behavior of Training Mamba-based State Space Models on GPUs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.17679","snapshot_observed_at":"2026-08-03T21:20:34.027247Z","title":"Characterizing the behavior of training mamba-based state space models on gpus.arXiv preprint arXiv:2508.17679,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.15927","last_updated":"2026-07-17T11:40:17Z","snapshot_observed_at":"2026-08-19T01:24:17.846553Z","submitted_at":"2025-11-19T23:23:49Z","title":"DiffuMamba: High-Throughput Diffusion LMs with Mamba Backbone","version":4},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-03T21:20:34.027247Z"},"links":{"cited_paper":"/paper/2508.17679","citing_paper":"/paper/2511.15927"},"observation_digest":"sha256:cab7ebeee6168ec95aa0af1f01417c3773a04a0caa80085582075b902bd8bfd1","observation_id":"5b5e4834-e7fa-4450-b62d-2122592db34c","resolution":{"observed_at":"2026-08-03T21:20:34.027247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2508.17679/citation-record","integrity":"/paper/2508.17679/integrity","json":"/paper/2508.17679/citation-record.json","paper":"/paper/2508.17679"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:50:00.614989Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.17679","last_updated":"2025-08-25T05:22:27Z","snapshot_observed_at":"2026-08-17T02:31:17.392838Z","submitted_at":"2025-08-25T05:22:27Z","title":"Characterizing the Behavior of Training Mamba-based State Space Models on GPUs","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-05T16:50:00.614989Z"},"links":{"citing_paper":"/paper/2508.17679"},"observation_digest":"sha256:a5f694b7d2382d9a45cf16d94cc84e6fdfa15a82118629159e91d36fc71cdf1c","observation_id":"b9af813f-ae51-4524-b579-2c2266262273","resolution":{"observed_at":"2026-08-05T16:50:00.614989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08691","last_updated":"2023-07-17T17:50:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-17T17:50:36Z","title":"FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08691","snapshot_observed_at":"2026-08-05T16:50:00.724836Z","title":"Dao, ``Flashattention-2: Faster attention with better parallelism and work partitioning,'' arXiv preprint arXiv:2307.08691, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.17679","last_updated":"2025-08-25T05:22:27Z","snapshot_observed_at":"2026-08-17T02:31:17.392838Z","submitted_at":"2025-08-25T05:22:27Z","title":"Characterizing the Behavior of Training Mamba-based State Space Models on GPUs","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-05T16:50:00.724836Z"},"links":{"cited_paper":"/paper/2307.08691","citing_paper":"/paper/2508.17679"},"observation_digest":"sha256:92432ed59b5a4f02d4b13c24348d3bd2822be824d48f0d10f94b1b8036453d06","observation_id":"92f81c77-0f04-4a7d-b488-97688db6d958","resolution":{"observed_at":"2026-08-05T16:50:00.724836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:50:04.852086Z","title":null,"venue":null,"work_id":"4d819813-f90d-4950-8b04-b4a5c0c2ed76","year":2024},"citing_paper":{"arxiv_id":"2508.17679","last_updated":"2025-08-25T05:22:27Z","snapshot_observed_at":"2026-08-17T02:31:17.392838Z","submitted_at":"2025-08-25T05:22:27Z","title":"Characterizing the Behavior of Training Mamba-based State Space Models on GPUs","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-05T16:50:00.864754Z"},"links":{"citing_paper":"/paper/2508.17679"},"observation_digest":"sha256:2ec9cedfe003e16399a03b5eff26b22b32e8fea2dfe6ce383ddfa7a06db97488","observation_id":"7ab62b5b-b1cb-402e-96e8-e7be6b331730","resolution":{"observed_at":"2026-08-05T16:50:04.957336Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.05150","last_updated":"2020-12-02T17:52:35Z","snapshot_observed_at":"2026-07-31T17:17:17.205582Z","submitted_at":"2020-04-10T17:54:09Z","title":"Longformer: The Long-Document Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.05150","snapshot_observed_at":"2026-08-05T16:50:00.975503Z","title":"Beltagy, M","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2508.17679","last_updated":"2025-08-25T05:22:27Z","snapshot_observed_at":"2026-08-17T02:31:17.392838Z","submitted_at":"2025-08-25T05:22:27Z","title":"Characterizing the Behavior of Training Mamba-based State Space Models on GPUs","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-05T16:50:00.975503Z"},"links":{"cited_paper":"/paper/2004.05150","citing_paper":"/paper/2508.17679"},"observation_digest":"sha256:e729c729691cb522dae3a100a8f8261e9241d231f051a91b8b9ece5767dc2cf7","observation_id":"e4cb347b-97a7-4c66-a864-af0379ef8ec2","resolution":{"observed_at":"2026-08-05T16:50:00.975503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.00396","last_updated":"2022-08-05T17:54:38Z","snapshot_observed_at":"2026-08-14T01:02:41.198730Z","submitted_at":"2021-10-31T03:32:18Z","title":"Efficiently Modeling Long Sequences with Structured State Spaces","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.00396","snapshot_observed_at":"2026-08-05T16:50:01.096258Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.17679","last_updated":"2025-08-25T05:22:27Z","snapshot_observed_at":"2026-08-17T02:31:17.392838Z","submitted_at":"2025-08-25T05:22:27Z","title":"Characterizing the Behavior of Training Mamba-based State Space Models on GPUs","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-05T16:50:01.096258Z"},"links":{"cited_paper":"/paper/2111.00396","citing_paper":"/paper/2508.17679"},"observation_digest":"sha256:ae045cbbfb689e6f374767da31c00728f9f4bd90464f92113050755fda0dd874","observation_id":"63f19a92-e4d5-4787-aa64-30d766a834c1","resolution":{"observed_at":"2026-08-05T16:50:01.096258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00752","last_updated":"2024-05-31T17:55:27Z","snapshot_observed_at":"2026-08-17T20:47:46.242385Z","submitted_at":"2023-12-01T18:01:34Z","title":"Mamba: Linear-Time Sequence Modeling with Selective State Spaces","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00752","snapshot_observed_at":"2026-08-05T16:50:01.254754Z","title":"Gu and T","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.17679","last_updated":"2025-08-25T05:22:27Z","snapshot_observed_at":"2026-08-17T02:31:17.392838Z","submitted_at":"2025-08-25T05:22:27Z","title":"Characterizing the Behavior of Training Mamba-based State Space Models on GPUs","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-05T16:50:01.254754Z"},"links":{"cited_paper":"/paper/2312.00752","citing_paper":"/paper/2508.17679"},"observation_digest":"sha256:352a0f987006c1da8f8636faf07993d129230b2504e6be11ccd5b541b925fc98","observation_id":"8f6b34a5-d215-4a07-bf53-1d4d3ff05604","resolution":{"observed_at":"2026-08-05T16:50:01.254754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21060","last_updated":"2024-05-31T17:50:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:50:01Z","title":"Transformers are SSMs: Generalized Models and Efficient Algorithms Through Structured State Space Duality","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21060","snapshot_observed_at":"2026-08-05T16:50:01.341549Z","title":"Dao and A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.17679","last_updated":"2025-08-25T05:22:27Z","snapshot_observed_at":"2026-08-17T02:31:17.392838Z","submitted_at":"2025-08-25T05:22:27Z","title":"Characterizing the Behavior of Training Mamba-based State Space Models on GPUs","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-05T16:50:01.341549Z"},"links":{"cited_paper":"/paper/2405.21060","citing_paper":"/paper/2508.17679"},"observation_digest":"sha256:9f83ee829def8574079e51a968e4a88b7aeab67c63f5689843b9219452cc5673","observation_id":"d0e2b325-d6c1-4e91-a041-913b50e71689","resolution":{"observed_at":"2026-08-05T16:50:01.341549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:50:04.669409Z","title":"Narayanan, M","venue":null,"work_id":"447126c0-b529-456f-b7d9-7489c4d7edd0","year":2021},"citing_paper":{"arxiv_id":"2508.17679","last_updated":"2025-08-25T05:22:27Z","snapshot_observed_at":"2026-08-17T02:31:17.392838Z","submitted_at":"2025-08-25T05:22:27Z","title":"Characterizing the Behavior of Training Mamba-based State Space Models on GPUs","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-05T16:50:01.436449Z"},"links":{"citing_paper":"/paper/2508.17679"},"observation_digest":"sha256:92fcc0ab6e7fb3e82495b0e37f52d750b49fcac85b79a40a1913af4d89f71a74","observation_id":"f396a69d-d714-4d04-898f-c59d5fcb2509","resolution":{"observed_at":"2026-08-05T16:50:04.738351Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:50:04.413922Z","title":null,"venue":null,"work_id":"186842e0-5508-4065-8c15-91900d77f589","year":2002},"citing_paper":{"arxiv_id":"2508.17679","last_updated":"2025-08-25T05:22:27Z","snapshot_observed_at":"2026-08-17T02:31:17.392838Z","submitted_at":"2025-08-25T05:22:27Z","title":"Characterizing the Behavior of Training Mamba-based State Space Models on GPUs","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-05T16:50:01.501357Z"},"links":{"citing_paper":"/paper/2508.17679"},"observation_digest":"sha256:59cc3dfad035690d486ba87307b1ba9e4ee6f570379cc5a79294b2da60e411c4","observation_id":"748d2e50-fc50-4927-9d96-013a759c7afa","resolution":{"observed_at":"2026-08-05T16:50:04.494776Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:50:04.140128Z","title":"Vaswani, N","venue":null,"work_id":"d8d487b8-103c-4062-998e-126f24928b3b","year":2017},"citing_paper":{"arxiv_id":"2508.17679","last_updated":"2025-08-25T05:22:27Z","snapshot_observed_at":"2026-08-17T02:31:17.392838Z","submitted_at":"2025-08-25T05:22:27Z","title":"Characterizing the Behavior of Training Mamba-based State Space Models on GPUs","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-05T16:50:01.589542Z"},"links":{"citing_paper":"/paper/2508.17679"},"observation_digest":"sha256:b7cbac126df5fa82f1402c099c8847988cb16e63a81bdad4dc55b7828d1266e7","observation_id":"7b0caa37-f713-4e85-a3f8-b0e3e292212c","resolution":{"observed_at":"2026-08-05T16:50:04.254773Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07887","last_updated":"2024-06-12T05:25:15Z","snapshot_observed_at":"2026-07-06T18:29:21.709395Z","submitted_at":"2024-06-12T05:25:15Z","title":"An Empirical Study of Mamba-based Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07887","snapshot_observed_at":"2026-08-05T16:50:01.777995Z","title":"Waleffe, W","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.17679","last_updated":"2025-08-25T05:22:27Z","snapshot_observed_at":"2026-08-17T02:31:17.392838Z","submitted_at":"2025-08-25T05:22:27Z","title":"Characterizing the Behavior of Training Mamba-based State Space Models on GPUs","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-05T16:50:01.777995Z"},"links":{"cited_paper":"/paper/2406.07887","citing_paper":"/paper/2508.17679"},"observation_digest":"sha256:f49af8e0eb13d4d4140b733cd9f815143a29be96d69f517f4aa2d724aef83caf","observation_id":"d1252783-09ef-4dfd-94a6-211529a7b715","resolution":{"observed_at":"2026-08-05T16:50:01.777995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:50:03.832380Z","title":null,"venue":null,"work_id":"12ccefae-6ebf-4dd5-b2c0-db5bb867ad73","year":2020},"citing_paper":{"arxiv_id":"2508.17679","last_updated":"2025-08-25T05:22:27Z","snapshot_observed_at":"2026-08-17T02:31:17.392838Z","submitted_at":"2025-08-25T05:22:27Z","title":"Characterizing the Behavior of Training Mamba-based State Space Models on GPUs","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-05T16:50:01.918539Z"},"links":{"citing_paper":"/paper/2508.17679"},"observation_digest":"sha256:011368ee88f6ab9e2bacbb5697c2e543fdbb06d21df2f3ad69b615fd75e2311f","observation_id":"63d096aa-58f2-44e1-81e2-304605b2b61c","resolution":{"observed_at":"2026-08-05T16:50:03.974038Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:50:03.588379Z","title":"Hatamizadeh and J","venue":null,"work_id":"f8de0478-3095-4f8f-be70-3d6722f320d4","year":2025},"citing_paper":{"arxiv_id":"2508.17679","last_updated":"2025-08-25T05:22:27Z","snapshot_observed_at":"2026-08-17T02:31:17.392838Z","submitted_at":"2025-08-25T05:22:27Z","title":"Characterizing the Behavior of Training Mamba-based State Space Models on GPUs","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-05T16:50:02.006795Z"},"links":{"citing_paper":"/paper/2508.17679"},"observation_digest":"sha256:a290f207d057bbd3396344e0cdde2c69d11aa848ae7c0613338575d476410073","observation_id":"f7c37d5b-b609-4da0-b7de-2366541adc90","resolution":{"observed_at":"2026-08-05T16:50:03.676665Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:50:03.362633Z","title":null,"venue":null,"work_id":"37d55a94-6b33-4a87-818a-80519811a5bf","year":2009},"citing_paper":{"arxiv_id":"2508.17679","last_updated":"2025-08-25T05:22:27Z","snapshot_observed_at":"2026-08-17T02:31:17.392838Z","submitted_at":"2025-08-25T05:22:27Z","title":"Characterizing the Behavior of Training Mamba-based State Space Models on GPUs","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-05T16:50:02.154751Z"},"links":{"citing_paper":"/paper/2508.17679"},"observation_digest":"sha256:92de71844c8e96c5fd4c5c60e6111e781a679bee8bedeb4c9ac575fbb132a297","observation_id":"6fa7658c-9cfd-4caa-b340-cbf79f52229b","resolution":{"observed_at":"2026-08-05T16:50:03.454757Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.19887","last_updated":"2024-07-03T14:30:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-28T23:55:06Z","title":"Jamba: A Hybrid Transformer-Mamba Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.19887","snapshot_observed_at":"2026-08-05T16:50:02.249490Z","title":"Lieber, B","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.17679","last_updated":"2025-08-25T05:22:27Z","snapshot_observed_at":"2026-08-17T02:31:17.392838Z","submitted_at":"2025-08-25T05:22:27Z","title":"Characterizing the Behavior of Training Mamba-based State Space Models on GPUs","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-05T16:50:02.249490Z"},"links":{"cited_paper":"/paper/2403.19887","citing_paper":"/paper/2508.17679"},"observation_digest":"sha256:2076184d5f6152ff02a2c772332b7847dd9918f74b3402f3c16509c903eb82fd","observation_id":"a9f398f1-a230-4e15-ad70-f18cc196ac96","resolution":{"observed_at":"2026-08-05T16:50:02.249490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:50:03.122473Z","title":"Behrouz and F","venue":null,"work_id":"4c487cb7-8fe8-4964-8653-e45add253ecb","year":2024},"citing_paper":{"arxiv_id":"2508.17679","last_updated":"2025-08-25T05:22:27Z","snapshot_observed_at":"2026-08-17T02:31:17.392838Z","submitted_at":"2025-08-25T05:22:27Z","title":"Characterizing the Behavior of Training Mamba-based State Space Models on GPUs","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-05T16:50:02.384762Z"},"links":{"citing_paper":"/paper/2508.17679"},"observation_digest":"sha256:64c1d95e8a53609c99124d443791368048c1bff6e86b80d796be420eb53ccf9d","observation_id":"a402bcce-46aa-4277-9cac-293867b99b18","resolution":{"observed_at":"2026-08-05T16:50:03.235533Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:50:02.924757Z","title":"Gupta, J","venue":null,"work_id":"ca15b5f2-02bb-481e-b06d-9eda4ade897c","year":2012},"citing_paper":{"arxiv_id":"2508.17679","last_updated":"2025-08-25T05:22:27Z","snapshot_observed_at":"2026-08-17T02:31:17.392838Z","submitted_at":"2025-08-25T05:22:27Z","title":"Characterizing the Behavior of Training Mamba-based State Space Models on GPUs","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-05T16:50:02.473697Z"},"links":{"citing_paper":"/paper/2508.17679"},"observation_digest":"sha256:d9ccc5556ae578ad06ffaa10fcb84f0bcb94155a012b07bc6bfe8fa1f720aab4","observation_id":"849ad6bd-4d50-4341-b4f1-97b40586a624","resolution":{"observed_at":"2026-08-05T16:50:03.005167Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2508.17679","last_updated":"2025-08-25T05:22:27Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-17T02:31:17.392838Z","submitted_at":"2025-08-25T05:22:27Z","title":"Characterizing the Behavior of Training Mamba-based State Space Models on GPUs"},"reference_resolution":{"displayed":17,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":12,"verified_exact":0,"verified_fuzzy":5},"total_outbound_references":17},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 17 of 17 outbound references and 1 inbound Pith citation observation for arXiv:2508.17679."}