{"as_of":"2026-08-09T00:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b50b594cf7db5a6d087ee48db8f6a43850e0dc23ce7d3ee8e625de6009478202","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":15,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":15,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":15,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":15,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:55:04.112273Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-23T08:42:45.265620Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2402.12376","last_updated":"2024-10-15T02:51:00Z","snapshot_observed_at":"2026-08-08T17:18:09.872627Z","submitted_at":"2024-02-19T18:59:07Z","title":"FiT: Flexible Vision Transformer for Diffusion Model","version":4},"cited_work":{"arxiv_id":"2402.12376","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.12376","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fit: Flexible vision transformer for diffusion model","venue":null,"work_id":"38da81cd-23a3-423f-bbe6-b7d30c811e2b","year":2024},"citing_paper":{"arxiv_id":"2412.00131","last_updated":"2024-11-28T14:07:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-28T14:07:45Z","title":"Open-Sora Plan: Open-Source Large Video Generation Model","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-23T08:38:27.946746Z"},"links":{"cited_paper":"/paper/2402.12376","citing_paper":"/paper/2412.00131"},"observation_digest":"sha256:43fb97f222485047a6306041345e5f912ad775d67eb7a2d950e1858e8e6789ef","observation_id":"73009a21-2caf-4f69-81db-9eb190b1b2c6","resolution":{"observed_at":"2026-05-23T08:42:45.269086Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12376","last_updated":"2024-10-15T02:51:00Z","snapshot_observed_at":"2026-08-08T17:18:09.872627Z","submitted_at":"2024-02-19T18:59:07Z","title":"FiT: Flexible Vision Transformer for Diffusion Model","version":4},"cited_work":{"arxiv_id":"2402.12376","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.12376","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fit: Flexible vision transformer for diffusion model","venue":null,"work_id":"38da81cd-23a3-423f-bbe6-b7d30c811e2b","year":2024},"citing_paper":{"arxiv_id":"2412.20404","last_updated":"2024-12-29T08:52:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-29T08:52:49Z","title":"Open-Sora: Democratizing Efficient Video Production for All","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-11T12:01:51.366667Z"},"links":{"cited_paper":"/paper/2402.12376","citing_paper":"/paper/2412.20404"},"observation_digest":"sha256:9869a5b238194ec6ce4501260b62c0f9bcb20966a7d59b591aea46314fdc37bd","observation_id":"4909bd1a-5938-4876-9623-636287ab0945","resolution":{"observed_at":"2026-05-11T12:01:51.723341Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12376","last_updated":"2024-10-15T02:51:00Z","snapshot_observed_at":"2026-08-08T17:18:09.872627Z","submitted_at":"2024-02-19T18:59:07Z","title":"FiT: Flexible Vision Transformer for Diffusion Model","version":4},"cited_work":{"arxiv_id":"2402.12376","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.12376","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fit: Flexible vision transformer for diffusion model","venue":null,"work_id":"38da81cd-23a3-423f-bbe6-b7d30c811e2b","year":2024},"citing_paper":{"arxiv_id":"2501.00103","last_updated":"2024-12-30T19:00:25Z","snapshot_observed_at":"2026-07-06T20:14:54.297131Z","submitted_at":"2024-12-30T19:00:25Z","title":"LTX-Video: Realtime Video Latent Diffusion","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-11T10:36:12.058970Z"},"links":{"cited_paper":"/paper/2402.12376","citing_paper":"/paper/2501.00103"},"observation_digest":"sha256:abd313531fe919aa2f9db712bcfd0687e5f01389c5b89378a0ae9fffde24d137","observation_id":"a3c774d1-25f2-4fd5-9be4-3abfc338d138","resolution":{"observed_at":"2026-05-11T10:36:12.409398Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12376","last_updated":"2024-10-15T02:51:00Z","snapshot_observed_at":"2026-08-08T17:18:09.872627Z","submitted_at":"2024-02-19T18:59:07Z","title":"FiT: Flexible Vision Transformer for Diffusion Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12376","snapshot_observed_at":"2026-08-07T14:55:04.112273Z","title":"Fit: Flexible vision transformer for diffusion model.arXiv preprint arXiv:2402.12376, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17351","last_updated":"2025-05-23T00:07:59Z","snapshot_observed_at":"2026-08-07T22:43:27.490712Z","submitted_at":"2025-05-23T00:07:59Z","title":"FLEX: A Backbone for Diffusion-Based Modeling of Spatio-temporal Physical Systems","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:04.112273Z"},"links":{"cited_paper":"/paper/2402.12376","citing_paper":"/paper/2505.17351"},"observation_digest":"sha256:51d5524f25a869bf5245c7d5f4c945cddd52016b267549e4182a7d03e77f1ed2","observation_id":"57e1e637-586f-4d2d-a6e5-b2baf3401453","resolution":{"observed_at":"2026-08-07T14:55:04.112273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12376","last_updated":"2024-10-15T02:51:00Z","snapshot_observed_at":"2026-08-08T17:18:09.872627Z","submitted_at":"2024-02-19T18:59:07Z","title":"FiT: Flexible Vision Transformer for Diffusion Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12376","snapshot_observed_at":"2026-08-06T20:26:37.882309Z","title":"Fit: Flexible vision transformer for diffusion model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02713","last_updated":"2025-07-04T14:45:23Z","snapshot_observed_at":"2026-08-07T22:42:38.118521Z","submitted_at":"2025-07-03T15:27:28Z","title":"UniMC: Taming Diffusion Transformer for Unified Keypoint-Guided Multi-Class Image Generation","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:37.882309Z"},"links":{"cited_paper":"/paper/2402.12376","citing_paper":"/paper/2507.02713"},"observation_digest":"sha256:6fd0720a71d64528234841c0691a1a811b8be8ad571155c88a1f0c009b1ab925","observation_id":"7215d8bd-8432-4be5-a886-136d3118ed11","resolution":{"observed_at":"2026-08-06T20:26:37.882309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12376","last_updated":"2024-10-15T02:51:00Z","snapshot_observed_at":"2026-08-08T17:18:09.872627Z","submitted_at":"2024-02-19T18:59:07Z","title":"FiT: Flexible Vision Transformer for Diffusion Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12376","snapshot_observed_at":"2026-08-06T14:52:30.393598Z","title":"Fit: Flexible vision transformer for diffusion model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.17795","last_updated":"2025-07-23T14:01:16Z","snapshot_observed_at":"2026-08-07T22:30:34.067188Z","submitted_at":"2025-07-23T14:01:16Z","title":"LSDM: LLM-Enhanced Spatio-temporal Diffusion Model for Service-Level Mobile Traffic Prediction","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T14:52:30.393598Z"},"links":{"cited_paper":"/paper/2402.12376","citing_paper":"/paper/2507.17795"},"observation_digest":"sha256:87608ef8a8e44fccb91e4a942fb547d14b958ef94dec18034b6cfbd7de87f612","observation_id":"bc875865-23ec-4d0a-8c9c-318b9df21e4f","resolution":{"observed_at":"2026-08-06T14:52:30.393598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12376","last_updated":"2024-10-15T02:51:00Z","snapshot_observed_at":"2026-08-08T17:18:09.872627Z","submitted_at":"2024-02-19T18:59:07Z","title":"FiT: Flexible Vision Transformer for Diffusion Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12376","snapshot_observed_at":"2026-08-06T10:59:53.705503Z","title":"Fit: Flexible vision transformer for diffusion model.arXiv preprint arXiv:2402.12376, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.23268","last_updated":"2025-08-04T02:46:11Z","snapshot_observed_at":"2026-08-07T21:03:40.851564Z","submitted_at":"2025-07-31T06:07:20Z","title":"PixNerd: Pixel Neural Field Diffusion","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T10:59:53.705503Z"},"links":{"cited_paper":"/paper/2402.12376","citing_paper":"/paper/2507.23268"},"observation_digest":"sha256:092ba46aea43fcfcab504332d5ac87eacdc8398669585c11200a7544404facc2","observation_id":"6f6e9f36-37e8-4ab2-a1b2-6c1e369abac8","resolution":{"observed_at":"2026-08-06T10:59:53.705503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12376","last_updated":"2024-10-15T02:51:00Z","snapshot_observed_at":"2026-08-08T17:18:09.872627Z","submitted_at":"2024-02-19T18:59:07Z","title":"FiT: Flexible Vision Transformer for Diffusion Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12376","snapshot_observed_at":"2026-08-05T10:36:59.766582Z","title":"Fit: Flexible vision transformer for diffusion model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03973","last_updated":"2025-09-04T07:58:52Z","snapshot_observed_at":"2026-08-05T10:36:57.332431Z","submitted_at":"2025-09-04T07:58:52Z","title":"SAC-MIL: Spatial-Aware Correlated Multiple Instance Learning for Histopathology Whole Slide Image Classification","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:59.766582Z"},"links":{"cited_paper":"/paper/2402.12376","citing_paper":"/paper/2509.03973"},"observation_digest":"sha256:e01b3e5487f8623b640b4f1879a9f7959c621d51eec6fa4f8ade3b53a5d5087e","observation_id":"916169ce-a29e-4382-9e51-70d15fbdde50","resolution":{"observed_at":"2026-08-05T10:36:59.766582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12376","last_updated":"2024-10-15T02:51:00Z","snapshot_observed_at":"2026-08-08T17:18:09.872627Z","submitted_at":"2024-02-19T18:59:07Z","title":"FiT: Flexible Vision Transformer for Diffusion Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12376","snapshot_observed_at":"2026-08-03T20:30:32.838768Z","title":"Fit: Flexible vision transformer for diffusion model.arXiv preprint arXiv:2402.12376, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.19778","last_updated":"2026-06-30T01:28:09Z","snapshot_observed_at":"2026-08-07T03:18:48.553937Z","submitted_at":"2025-11-24T23:10:15Z","title":"Phase-Aligned RoPE for Mixed-Resolution Diffusion Transformer","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-03T20:30:32.838768Z"},"links":{"cited_paper":"/paper/2402.12376","citing_paper":"/paper/2511.19778"},"observation_digest":"sha256:1d1fbcd0837b740301b74acddd0e19db974759b37c8e559093bbde79c1118000","observation_id":"f64126a2-b27a-449b-8818-07cfecbbca4b","resolution":{"observed_at":"2026-08-03T20:30:32.838768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12376","last_updated":"2024-10-15T02:51:00Z","snapshot_observed_at":"2026-08-08T17:18:09.872627Z","submitted_at":"2024-02-19T18:59:07Z","title":"FiT: Flexible Vision Transformer for Diffusion Model","version":4},"cited_work":{"arxiv_id":"2402.12376","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.12376","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fit: Flexible vision transformer for diffusion model","venue":null,"work_id":"38da81cd-23a3-423f-bbe6-b7d30c811e2b","year":2024},"citing_paper":{"arxiv_id":"2604.24885","last_updated":"2026-04-27T18:08:05Z","snapshot_observed_at":"2026-07-06T23:10:52.763251Z","submitted_at":"2026-04-27T18:08:05Z","title":"VibeToken: Scaling 1D Image Tokenizers and Autoregressive Models for Dynamic Resolution Generations","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-08T04:12:58.100610Z"},"links":{"cited_paper":"/paper/2402.12376","citing_paper":"/paper/2604.24885"},"observation_digest":"sha256:2a5fac1e179f14d296beb21f82b3318c689e2e5546e68078b723c1d872d23cfc","observation_id":"dce0c06f-883f-4ace-84dc-3b155bf75d1c","resolution":{"observed_at":"2026-05-11T21:51:11.626899Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12376","last_updated":"2024-10-15T02:51:00Z","snapshot_observed_at":"2026-08-08T17:18:09.872627Z","submitted_at":"2024-02-19T18:59:07Z","title":"FiT: Flexible Vision Transformer for Diffusion Model","version":4},"cited_work":{"arxiv_id":"2402.12376","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.12376","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fit: Flexible vision transformer for diffusion model","venue":null,"work_id":"38da81cd-23a3-423f-bbe6-b7d30c811e2b","year":2024},"citing_paper":{"arxiv_id":"2605.05331","last_updated":"2026-05-06T18:03:13Z","snapshot_observed_at":"2026-07-06T23:17:58.119336Z","submitted_at":"2026-05-06T18:03:13Z","title":"ViTok-v2: Scaling Native Resolution Auto-Encoders to 5 Billion Parameters","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-08T17:06:21.438738Z"},"links":{"cited_paper":"/paper/2402.12376","citing_paper":"/paper/2605.05331"},"observation_digest":"sha256:ae8f687ad8ffa06a3b7f956dcab3319b279e81e1a18964455f03acc4b8354710","observation_id":"e7e98791-e6ed-4797-9486-9348fea1e263","resolution":{"observed_at":"2026-05-11T17:46:17.514215Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12376","last_updated":"2024-10-15T02:51:00Z","snapshot_observed_at":"2026-08-08T17:18:09.872627Z","submitted_at":"2024-02-19T18:59:07Z","title":"FiT: Flexible Vision Transformer for Diffusion Model","version":4},"cited_work":{"arxiv_id":"2402.12376","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.12376","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fit: Flexible vision transformer for diffusion model","venue":null,"work_id":"38da81cd-23a3-423f-bbe6-b7d30c811e2b","year":2024},"citing_paper":{"arxiv_id":"2605.09151","last_updated":"2026-05-09T20:29:24Z","snapshot_observed_at":"2026-08-07T01:10:01.218480Z","submitted_at":"2026-05-09T20:29:24Z","title":"MultiMedVision: Multi-Modal Medical Vision Framework","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-12T02:46:23.767997Z"},"links":{"cited_paper":"/paper/2402.12376","citing_paper":"/paper/2605.09151"},"observation_digest":"sha256:6aa8f279c68669934d2cc5acc5a312aa836ee5466f797caec47b199f6a71c608","observation_id":"1b83d50e-4033-498f-b0d2-081b0bbf721b","resolution":{"observed_at":"2026-05-12T07:31:24.744895Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12376","last_updated":"2024-10-15T02:51:00Z","snapshot_observed_at":"2026-08-08T17:18:09.872627Z","submitted_at":"2024-02-19T18:59:07Z","title":"FiT: Flexible Vision Transformer for Diffusion Model","version":4},"cited_work":{"arxiv_id":"2402.12376","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.12376","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fit: Flexible vision transformer for diffusion model","venue":null,"work_id":"38da81cd-23a3-423f-bbe6-b7d30c811e2b","year":2024},"citing_paper":{"arxiv_id":"2605.12491","last_updated":"2026-05-12T17:59:26Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T17:59:26Z","title":"Elastic Attention Cores for Scalable Vision Transformers","version":1},"reference_index":129,"source":"pdf_text","source_observed_at":"2026-05-13T06:02:40.158866Z"},"links":{"cited_paper":"/paper/2402.12376","citing_paper":"/paper/2605.12491"},"observation_digest":"sha256:9f0352ba97e5e8c9a382506f5f85726ace06e2c1cc50bdf144ca77b318746085","observation_id":"80b15fce-7d29-4bf4-bd81-ccffd2e10c78","resolution":{"observed_at":"2026-05-13T06:07:22.645667Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12376","last_updated":"2024-10-15T02:51:00Z","snapshot_observed_at":"2026-08-08T17:18:09.872627Z","submitted_at":"2024-02-19T18:59:07Z","title":"FiT: Flexible Vision Transformer for Diffusion Model","version":4},"cited_work":{"arxiv_id":"2402.12376","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.12376","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fit: Flexible vision transformer for diffusion model","venue":null,"work_id":"38da81cd-23a3-423f-bbe6-b7d30c811e2b","year":2024},"citing_paper":{"arxiv_id":"2605.15908","last_updated":"2026-05-15T12:45:17Z","snapshot_observed_at":"2026-07-06T23:27:11.118592Z","submitted_at":"2026-05-15T12:45:17Z","title":"RaPD: Resolution-Agnostic Pixel Diffusion via Semantics-Enriched Implicit Representations","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-20T19:01:52.883915Z"},"links":{"cited_paper":"/paper/2402.12376","citing_paper":"/paper/2605.15908"},"observation_digest":"sha256:2d8bdf35910fedf4b94a2516f9d6ef70ea5e301f3053d419f33062d1169956dc","observation_id":"03cb5f2e-cef6-49ad-8295-ad057ba87be0","resolution":{"observed_at":"2026-05-20T19:03:39.585528Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12376","last_updated":"2024-10-15T02:51:00Z","snapshot_observed_at":"2026-08-08T17:18:09.872627Z","submitted_at":"2024-02-19T18:59:07Z","title":"FiT: Flexible Vision Transformer for Diffusion Model","version":4},"cited_work":{"arxiv_id":"2402.12376","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.12376","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fit: Flexible vision transformer for diffusion model","venue":null,"work_id":"38da81cd-23a3-423f-bbe6-b7d30c811e2b","year":2024},"citing_paper":{"arxiv_id":"2605.22668","last_updated":"2026-05-21T16:09:01Z","snapshot_observed_at":"2026-08-08T06:27:13.102957Z","submitted_at":"2026-05-21T16:09:01Z","title":"SEGA: Spectral-Energy Guided Attention for Resolution Extrapolation in Diffusion Transformers","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-22T06:10:14.080177Z"},"links":{"cited_paper":"/paper/2402.12376","citing_paper":"/paper/2605.22668"},"observation_digest":"sha256:d51113fe9221f12aa3d0f41a5fce9a55bb31a56e995765996b72b69f608f6446","observation_id":"51fec154-7cf0-4a4a-b93a-b2ed32255ba0","resolution":{"observed_at":"2026-05-22T06:11:09.080526Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2402.12376/citation-record","integrity":"/paper/2402.12376/integrity","json":"/paper/2402.12376/citation-record.json","paper":"/paper/2402.12376"},"outbound":[],"paper":{"arxiv_id":"2402.12376","last_updated":"2024-10-15T02:51:00Z","latest_version":4,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T17:18:09.872627Z","submitted_at":"2024-02-19T18:59:07Z","title":"FiT: Flexible Vision Transformer for Diffusion Model"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 15 inbound Pith citation observations for arXiv:2402.12376."}