{"as_of":"2026-08-10T10:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9e5cbadd3cb46bd4962bee5c395592499ed322b27dfcc631fdb6bb773ed29df2","coverage":[{"denominator":17,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":17,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:42:01.742085Z","state":"measured"},{"denominator":19,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":19,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-29T08:06:27.191812Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-29T08:13:15.764565Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.12853","last_updated":"2025-08-17T15:50:47Z","snapshot_observed_at":"2026-08-09T19:18:45.424161Z","submitted_at":"2025-06-15T13:59:57Z","title":"EraserDiT: Fast Video Inpainting with Diffusion Transformer Model","version":2},"cited_work":{"arxiv_id":"2506.12853","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.12853","snapshot_observed_at":"2026-06-29T08:13:15.764565Z","title":"and Hui, Z","venue":null,"work_id":"c96db0a1-3eee-4af9-985c-a006c12899fd","year":2025},"citing_paper":{"arxiv_id":"2603.21901","last_updated":"2026-05-11T11:26:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-03-23T12:23:35Z","title":"CLEAR: Context-Aware Learning with End-to-End Mask-Free Inference for Adaptive Video Subtitle Removal","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-15T00:39:15.790131Z"},"links":{"cited_paper":"/paper/2506.12853","citing_paper":"/paper/2603.21901"},"observation_digest":"sha256:014c5bb0d1c20dfb28ace3d66f9ac2e662f5b92942f06135bbbc300db127be83","observation_id":"97933a7e-95b9-450b-a998-2f41a4d87ec0","resolution":{"observed_at":"2026-05-15T00:39:35.679421Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.12853","last_updated":"2025-08-17T15:50:47Z","snapshot_observed_at":"2026-08-09T19:18:45.424161Z","submitted_at":"2025-06-15T13:59:57Z","title":"EraserDiT: Fast Video Inpainting with Diffusion Transformer Model","version":2},"cited_work":{"arxiv_id":"2506.12853","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.12853","snapshot_observed_at":"2026-06-29T08:13:15.764565Z","title":"and Hui, Z","venue":null,"work_id":"c96db0a1-3eee-4af9-985c-a006c12899fd","year":2025},"citing_paper":{"arxiv_id":"2605.30045","last_updated":"2026-05-28T14:58:36Z","snapshot_observed_at":"2026-08-02T08:49:19.518638Z","submitted_at":"2026-05-28T14:58:36Z","title":"GenEraser: Generalizable Video Object Removal via Balanced Text-Mask Guidance and Decoupled Locator-Preserver","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-29T08:06:27.191812Z"},"links":{"cited_paper":"/paper/2506.12853","citing_paper":"/paper/2605.30045"},"observation_digest":"sha256:41e8e72940b687ddc590f925f01dbec8a2268e79c84e369793b32beae418db52","observation_id":"c6e7c9ce-3d05-4f72-b280-60117090d07c","resolution":{"observed_at":"2026-06-29T08:13:15.766085Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.12853/citation-record","integrity":"/paper/2506.12853/integrity","json":"/paper/2506.12853/citation-record.json","paper":"/paper/2506.12853"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:42:00.389964Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.12853","last_updated":"2025-08-17T15:50:47Z","snapshot_observed_at":"2026-08-09T19:18:45.424161Z","submitted_at":"2025-06-15T13:59:57Z","title":"EraserDiT: Fast Video Inpainting with Diffusion Transformer Model","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:00.389964Z"},"links":{"citing_paper":"/paper/2506.12853"},"observation_digest":"sha256:4c375eb00cdd63b8ed0510778c542ae72544dd57513bf93695d529002239dd68","observation_id":"3483ca62-74a1-4e0d-84ba-3c21b377a598","resolution":{"observed_at":"2026-08-07T00:42:00.389964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-10T01:12:16.468283Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-07T00:42:00.453980Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2506.12853","last_updated":"2025-08-17T15:50:47Z","snapshot_observed_at":"2026-08-09T19:18:45.424161Z","submitted_at":"2025-06-15T13:59:57Z","title":"EraserDiT: Fast Video Inpainting with Diffusion Transformer Model","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:00.453980Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2506.12853"},"observation_digest":"sha256:5bff9ea45286363f3c084ed9222fbc4f2c8a47f248f4307bb784d86a353726f0","observation_id":"53f16d1d-dc0d-4c48-abef-6605b054644b","resolution":{"observed_at":"2026-08-07T00:42:00.453980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:42:00.539849Z","title":"Scaling rectified flow transformers for high-resolution image synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12853","last_updated":"2025-08-17T15:50:47Z","snapshot_observed_at":"2026-08-09T19:18:45.424161Z","submitted_at":"2025-06-15T13:59:57Z","title":"EraserDiT: Fast Video Inpainting with Diffusion Transformer Model","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:00.539849Z"},"links":{"citing_paper":"/paper/2506.12853"},"observation_digest":"sha256:2230d3e00908bd44d1c802e44df08faae52a955724b2b214344435f25aa3ecce","observation_id":"67c50ec6-a683-4cec-82d1-e7701c31d11e","resolution":{"observed_at":"2026-08-07T00:42:00.539849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04725","last_updated":"2024-02-08T18:08:57Z","snapshot_observed_at":"2026-07-06T15:52:13.602170Z","submitted_at":"2023-07-10T17:34:16Z","title":"AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models without Specific Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.04725","snapshot_observed_at":"2026-08-07T00:42:00.591297Z","title":"Animatediff: Animate your personalized text-to-image diffusion models without specific tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12853","last_updated":"2025-08-17T15:50:47Z","snapshot_observed_at":"2026-08-09T19:18:45.424161Z","submitted_at":"2025-06-15T13:59:57Z","title":"EraserDiT: Fast Video Inpainting with Diffusion Transformer Model","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:00.591297Z"},"links":{"cited_paper":"/paper/2307.04725","citing_paper":"/paper/2506.12853"},"observation_digest":"sha256:37bf4bb7b60e84f59867c179f46498caf90a9814cdff46a4f184aa05f7cf02a4","observation_id":"3e7f663e-c012-4bf3-9005-89fe071663b0","resolution":{"observed_at":"2026-08-07T00:42:00.591297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00103","last_updated":"2024-12-30T19:00:25Z","snapshot_observed_at":"2026-07-06T20:14:54.297131Z","submitted_at":"2024-12-30T19:00:25Z","title":"LTX-Video: Realtime Video Latent Diffusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00103","snapshot_observed_at":"2026-08-07T00:42:00.641831Z","title":"Ltx-video: Realtime video latent diffusion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12853","last_updated":"2025-08-17T15:50:47Z","snapshot_observed_at":"2026-08-09T19:18:45.424161Z","submitted_at":"2025-06-15T13:59:57Z","title":"EraserDiT: Fast Video Inpainting with Diffusion Transformer Model","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:00.641831Z"},"links":{"cited_paper":"/paper/2501.00103","citing_paper":"/paper/2506.12853"},"observation_digest":"sha256:7a4cfa31490c3abf8996878d7d50a515d2de9544ae342faab54652e2ee7273bf","observation_id":"ee97c058-2ea8-454b-a0ba-4012299d007b","resolution":{"observed_at":"2026-08-07T00:42:00.641831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-07T00:42:00.695623Z","title":"Hunyuanvideo: A systematic framework for large video generative models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12853","last_updated":"2025-08-17T15:50:47Z","snapshot_observed_at":"2026-08-09T19:18:45.424161Z","submitted_at":"2025-06-15T13:59:57Z","title":"EraserDiT: Fast Video Inpainting with Diffusion Transformer Model","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:00.695623Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2506.12853"},"observation_digest":"sha256:4cb206bea8ed531f6cd323c6a5a30c6968379138b877fe7556f78290869cdc8d","observation_id":"8caa6034-e3c3-437b-b8fb-59371aa0ed6b","resolution":{"observed_at":"2026-08-07T00:42:00.695623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.10018","last_updated":"2025-01-17T08:03:02Z","snapshot_observed_at":"2026-08-09T19:18:26.031571Z","submitted_at":"2025-01-17T08:03:02Z","title":"DiffuEraser: A Diffusion Model for Video Inpainting","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.10018","snapshot_observed_at":"2026-08-07T00:42:00.744948Z","title":"Diffueraser: A diffusion model for video inpainting","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.12853","last_updated":"2025-08-17T15:50:47Z","snapshot_observed_at":"2026-08-09T19:18:45.424161Z","submitted_at":"2025-06-15T13:59:57Z","title":"EraserDiT: Fast Video Inpainting with Diffusion Transformer Model","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:00.744948Z"},"links":{"cited_paper":"/paper/2501.10018","citing_paper":"/paper/2506.12853"},"observation_digest":"sha256:2ed4f5730c08bad3ac39b50f94064b77eaae1a0a4fae15e73b64e0b9d2b2189e","observation_id":"caec44e0-8720-4554-94b9-469e9107e8b2","resolution":{"observed_at":"2026-08-07T00:42:00.744948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-02T18:24:58.914589Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-07T00:42:00.808194Z","title":"Flow matching for generative modeling","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.12853","last_updated":"2025-08-17T15:50:47Z","snapshot_observed_at":"2026-08-09T19:18:45.424161Z","submitted_at":"2025-06-15T13:59:57Z","title":"EraserDiT: Fast Video Inpainting with Diffusion Transformer Model","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:00.808194Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2506.12853"},"observation_digest":"sha256:db3b9718ade2ee6974d693a42741bea6163e2f2f33290577715998e329d0c1d5","observation_id":"bb869301-bdcf-47b5-bf86-f559623a30b7","resolution":{"observed_at":"2026-08-07T00:42:00.808194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:42:02.790309Z","title":"Fuseformer: Fusing fine-grained information in transformers for video inpainting","venue":null,"work_id":"0f6e9b36-0bcf-402f-ba08-ff529236ed76","year":2021},"citing_paper":{"arxiv_id":"2506.12853","last_updated":"2025-08-17T15:50:47Z","snapshot_observed_at":"2026-08-09T19:18:45.424161Z","submitted_at":"2025-06-15T13:59:57Z","title":"EraserDiT: Fast Video Inpainting with Diffusion Transformer Model","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:00.901619Z"},"links":{"citing_paper":"/paper/2506.12853"},"observation_digest":"sha256:c020a1b4fa7db0a160a1d96ebc0037b3075e2a79e22ebafff68a967804064f4d","observation_id":"e518d056-4dfd-4cd7-adaa-13d0761ebfff","resolution":{"observed_at":"2026-08-07T00:42:02.904955Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:42:00.948590Z","title":"A benchmark dataset and evaluation methodology for video object segmentation","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.12853","last_updated":"2025-08-17T15:50:47Z","snapshot_observed_at":"2026-08-09T19:18:45.424161Z","submitted_at":"2025-06-15T13:59:57Z","title":"EraserDiT: Fast Video Inpainting with Diffusion Transformer Model","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:00.948590Z"},"links":{"citing_paper":"/paper/2506.12853"},"observation_digest":"sha256:ca21012bce9d23c8a8538fd62b1aacd3ed350837356c692e4ce863e46a375572","observation_id":"54dc4eef-3242-4a4a-bc00-e7799952ecbd","resolution":{"observed_at":"2026-08-07T00:42:00.948590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:42:01.013801Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.12853","last_updated":"2025-08-17T15:50:47Z","snapshot_observed_at":"2026-08-09T19:18:45.424161Z","submitted_at":"2025-06-15T13:59:57Z","title":"EraserDiT: Fast Video Inpainting with Diffusion Transformer Model","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:01.013801Z"},"links":{"citing_paper":"/paper/2506.12853"},"observation_digest":"sha256:0461c34ea8db14d15796725b4440c5e4f99b158834cfd65144d6407a98d96908","observation_id":"91ae787f-d58e-4b4f-b9fe-9062b07118ce","resolution":{"observed_at":"2026-08-07T00:42:01.013801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:42:01.099668Z","title":"Sam 2: Segment anything in images and videos, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12853","last_updated":"2025-08-17T15:50:47Z","snapshot_observed_at":"2026-08-09T19:18:45.424161Z","submitted_at":"2025-06-15T13:59:57Z","title":"EraserDiT: Fast Video Inpainting with Diffusion Transformer Model","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:01.099668Z"},"links":{"citing_paper":"/paper/2506.12853"},"observation_digest":"sha256:a4430a0ec8e02857a536dbe6e68198e185f680049e6ac92019b99fb92fe0678f","observation_id":"5d89be9f-e883-4ec5-82b5-ac9fe4c4b544","resolution":{"observed_at":"2026-08-07T00:42:01.099668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14159","last_updated":"2024-01-25T13:12:09Z","snapshot_observed_at":"2026-07-06T17:20:25.138890Z","submitted_at":"2024-01-25T13:12:09Z","title":"Grounded SAM: Assembling Open-World Models for Diverse Visual Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.14159","snapshot_observed_at":"2026-08-07T00:42:01.243679Z","title":"Grounded sam: Assembling open-world models for diverse visual tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12853","last_updated":"2025-08-17T15:50:47Z","snapshot_observed_at":"2026-08-09T19:18:45.424161Z","submitted_at":"2025-06-15T13:59:57Z","title":"EraserDiT: Fast Video Inpainting with Diffusion Transformer Model","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:01.243679Z"},"links":{"cited_paper":"/paper/2401.14159","citing_paper":"/paper/2506.12853"},"observation_digest":"sha256:419e3181077cab5ab6176c19f54da6549e9e1f64a525c8a9ea1e3043ccccb1a6","observation_id":"75211975-9bbd-4e64-b978-3649f0ec11d7","resolution":{"observed_at":"2026-08-07T00:42:01.243679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-07T00:42:01.340005Z","title":"Cogvideox: Text-to-video diffusion models with an expert transformer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12853","last_updated":"2025-08-17T15:50:47Z","snapshot_observed_at":"2026-08-09T19:18:45.424161Z","submitted_at":"2025-06-15T13:59:57Z","title":"EraserDiT: Fast Video Inpainting with Diffusion Transformer Model","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:01.340005Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2506.12853"},"observation_digest":"sha256:6b8b546d723e814c4e5cbee658ec525583de860357f0ab2809d4db304e9d1185","observation_id":"109b83bc-d7bc-42a0-a6de-a15e43cc009d","resolution":{"observed_at":"2026-08-07T00:42:01.340005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-07T00:42:01.390837Z","title":"Minicpm-v: A gpt-4v level mllm on your phone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12853","last_updated":"2025-08-17T15:50:47Z","snapshot_observed_at":"2026-08-09T19:18:45.424161Z","submitted_at":"2025-06-15T13:59:57Z","title":"EraserDiT: Fast Video Inpainting with Diffusion Transformer Model","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:01.390837Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2506.12853"},"observation_digest":"sha256:8a7e85b17ba66b704e965bedb7b6ae314dea796f705d3359fe9088e15c769ff3","observation_id":"2fef8977-4eda-493b-9afd-2474a34a432e","resolution":{"observed_at":"2026-08-07T00:42:01.390837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:42:02.364097Z","title":"Learning joint spatial-temporal transformations for video inpainting","venue":null,"work_id":"714d17ba-31b5-4575-a995-d887502bb006","year":2020},"citing_paper":{"arxiv_id":"2506.12853","last_updated":"2025-08-17T15:50:47Z","snapshot_observed_at":"2026-08-09T19:18:45.424161Z","submitted_at":"2025-06-15T13:59:57Z","title":"EraserDiT: Fast Video Inpainting with Diffusion Transformer Model","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:01.526322Z"},"links":{"citing_paper":"/paper/2506.12853"},"observation_digest":"sha256:a2dd503e41cae4969d76b2b400b2b3d8e2caf6cd28daeda12519d4b8cb97a809","observation_id":"a2dd6f99-90b5-4012-99ed-15d4a0f124de","resolution":{"observed_at":"2026-08-07T00:42:02.553991Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:42:02.122875Z","title":"Propainter: Improving propagation and transformer for video inpainting","venue":null,"work_id":"a820c6f9-6e75-4041-8dbf-fef575049c30","year":2023},"citing_paper":{"arxiv_id":"2506.12853","last_updated":"2025-08-17T15:50:47Z","snapshot_observed_at":"2026-08-09T19:18:45.424161Z","submitted_at":"2025-06-15T13:59:57Z","title":"EraserDiT: Fast Video Inpainting with Diffusion Transformer Model","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:01.742085Z"},"links":{"citing_paper":"/paper/2506.12853"},"observation_digest":"sha256:5eb496d6c5c516099e608593ab22c5363b5b3789dfc76996c601935a4788222d","observation_id":"b668a2d2-770f-4aa4-8e00-51b4780f253c","resolution":{"observed_at":"2026-08-07T00:42:02.238566Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.12853","last_updated":"2025-08-17T15:50:47Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T19:18:45.424161Z","submitted_at":"2025-06-15T13:59:57Z","title":"EraserDiT: Fast Video Inpainting with Diffusion Transformer Model"},"reference_resolution":{"displayed":17,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":14,"verified_exact":0,"verified_fuzzy":3},"total_outbound_references":17},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 17 of 17 outbound references and 2 inbound Pith citation observations for arXiv:2506.12853."}