{"as_of":"2026-08-20T16:42:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a5a86f7cc7e6fdd33408f0252eef6b7b24f09feeb2866a8fc15e986735604e64","coverage":[{"denominator":75,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":75,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T21:56:17.729124Z","state":"measured"},{"denominator":75,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":75,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2501.03173/citation-record","integrity":"/paper/2501.03173/integrity","json":"/paper/2501.03173/citation-record.json","paper":"/paper/2501.03173"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:17.349440Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-17T10:49:42.091433Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.349440Z"},"links":{"citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:ecc12a0123993559d43b5ceed5ca260391eb3d6bc3de3805be28b0717bb6eee3","observation_id":"1ceea53d-45f1-43e7-9547-1a34f25c7fa8","resolution":{"observed_at":"2026-08-10T21:56:17.349440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:18.948867Z","title":"Dynamiccity: Large-scale lidar gener- ation from dynamic scenes, 2024","venue":null,"work_id":"26cbdb83-8c6d-417a-80d0-4660a75ebdf7","year":2024},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-17T10:49:42.091433Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.354943Z"},"links":{"citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:90bca77fabf975aac2f26a4f65c2c2cd803c0e8d86cb3322dbcbbe6e5808d8fd","observation_id":"f4abcf9c-9d23-4c5b-b5c3-5d1c2a1a0c9f","resolution":{"observed_at":"2026-08-10T21:56:18.954128Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:18.931644Z","title":"nuscenes: A multi- modal dataset for autonomous driving","venue":null,"work_id":"5d5ca38a-fe49-4db9-ac16-d8e834afc9a6","year":2020},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-17T10:49:42.091433Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.360917Z"},"links":{"citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:e6d20c57d53edb54a7b09419f043b3d82b2f90f548adde0d1c8785dc1aa381f0","observation_id":"fb35b2a9-aae3-4e8b-800a-a074fb36f1a1","resolution":{"observed_at":"2026-08-10T21:56:18.937266Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11573","last_updated":"2024-03-20T01:13:48Z","snapshot_observed_at":"2026-08-17T15:10:50.100815Z","submitted_at":"2024-03-18T08:50:04Z","title":"Just Add $100 More: Augmenting NeRF-based Pseudo-LiDAR Point Cloud for Resolving Class-imbalance Problem","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.11573","snapshot_observed_at":"2026-08-10T21:56:17.366229Z","title":"Just add $100 more: Augmenting nerf-based pseudo-lidar point cloud for resolving class-imbalance problem","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-17T10:49:42.091433Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.366229Z"},"links":{"cited_paper":"/paper/2403.11573","citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:fbfc9df6426ea270bc5aa513faed6e219bcec4110fba44f5278c3bd203921b0a","observation_id":"3ec9a4be-7981-4aed-aa8c-fd2c93cab1de","resolution":{"observed_at":"2026-08-10T21:56:17.366229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09481","last_updated":"2024-05-08T03:21:34Z","snapshot_observed_at":"2026-08-16T15:15:13.894611Z","submitted_at":"2023-07-18T17:59:02Z","title":"AnyDoor: Zero-shot Object-level Image Customization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09481","snapshot_observed_at":"2026-08-10T21:56:17.372452Z","title":"Anydoor: Zero-shot object-level im- age customization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-17T10:49:42.091433Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.372452Z"},"links":{"cited_paper":"/paper/2307.09481","citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:f147386640ce77cad85e89f86fc60eb4b08824d977be9a0bc651e537399d86ab","observation_id":"31a25eec-0050-4a4e-9db4-e487a5f2f5de","resolution":{"observed_at":"2026-08-10T21:56:17.372452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:18.915662Z","title":"Geosim: Realistic video sim- ulation via geometry-aware composition for self-driving","venue":null,"work_id":"b71b22f9-be55-4d20-98af-5ef2ccf48fbe","year":2021},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-17T10:49:42.091433Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.378087Z"},"links":{"citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:c2d1c7c6c9c2be614841bab6dd3555637360e5c871d03f57016caab0ed28496c","observation_id":"e201e549-1cf1-4e75-b3f0-fe1a1fdbd46c","resolution":{"observed_at":"2026-08-10T21:56:18.920739Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16392","last_updated":"2024-07-12T18:19:19Z","snapshot_observed_at":"2026-08-19T21:20:37.233310Z","submitted_at":"2024-02-26T08:32:41Z","title":"Placing Objects in Context via Inpainting for Out-of-distribution Segmentation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16392","snapshot_observed_at":"2026-08-10T21:56:17.383508Z","title":"Placing objects in context via in- painting for out-of-distribution segmentation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-17T10:49:42.091433Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.383508Z"},"links":{"cited_paper":"/paper/2402.16392","citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:7b8f7a77772799a91b1eeca522097b0a0242e409e12013cd66f9c6177ec42919","observation_id":"8ad4d6d2-fcae-4603-a6b5-7852b415057d","resolution":{"observed_at":"2026-08-10T21:56:17.383508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:18.899392Z","title":"Cut, paste and learn: Surprisingly easy synthesis for instance de- tection","venue":null,"work_id":"d5d1faeb-36d7-4be8-b73c-8bbdbe75e0b2","year":2017},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-17T10:49:42.091433Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.389496Z"},"links":{"citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:0ed181276844211202d9d68febb6aa4b99f1982d751704f06394f63fabe79bf1","observation_id":"8f35d35b-3f7f-490e-ae88-b43183191bf1","resolution":{"observed_at":"2026-08-10T21:56:18.904477Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:17.394991Z","title":"Taming transformers for high-resolution image synthesis","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-17T10:49:42.091433Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.394991Z"},"links":{"citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:ed0a63bc107555d86b72c099a90b49437d7dc6e6ee821b5a7e4a8dfbd6238eba","observation_id":"ec0dc077-5d3e-4b17-9400-1b2ac12adfd2","resolution":{"observed_at":"2026-08-10T21:56:17.394991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02601","last_updated":"2024-05-03T04:50:27Z","snapshot_observed_at":"2026-08-17T10:41:51.380790Z","submitted_at":"2023-10-04T06:14:06Z","title":"MagicDrive: Street View Generation with Diverse 3D Geometry Control","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02601","snapshot_observed_at":"2026-08-10T21:56:17.400022Z","title":"Magicdrive: Street view generation with diverse 3d geometry control","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-17T10:49:42.091433Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.400022Z"},"links":{"cited_paper":"/paper/2310.02601","citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:79d6f214c24a4a38d2a33c638325c6c8d942825376f4abb00f637d3b9127344d","observation_id":"4a2d0f31-e302-4ae8-9474-f05098c7a7d3","resolution":{"observed_at":"2026-08-10T21:56:17.400022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:18.873343Z","title":"Multitest: Physical-aware object insertion for testing multi-sensor fusion perception systems","venue":null,"work_id":"a10748a7-c012-4b8b-b00b-8bc01710cda6","year":2024},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-17T10:49:42.091433Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.405681Z"},"links":{"citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:8b33202e13177ae6f92d6a4955fd74235b1bd1a88dacc0abb19e18980e16e3be","observation_id":"30eb62cf-3d8e-4c71-a58c-5b2e5a22511e","resolution":{"observed_at":"2026-08-10T21:56:18.878466Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1702.07836","last_updated":"2017-09-08T00:29:55Z","snapshot_observed_at":"2026-08-14T21:14:50.142211Z","submitted_at":"2017-02-25T06:04:42Z","title":"Synthesizing Training Data for Object Detection in Indoor Scenes","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1702.07836","snapshot_observed_at":"2026-08-10T21:56:17.410637Z","title":"Synthesizing training data for object de- tection in indoor scenes","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-17T10:49:42.091433Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.410637Z"},"links":{"cited_paper":"/paper/1702.07836","citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:81554da7abe9976343f22e7b993f63ee9db5457b6c34fa84b5840aee81780926","observation_id":"92d1b274-6a43-4751-ade1-031c7dccfe12","resolution":{"observed_at":"2026-08-10T21:56:17.410637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:18.856786Z","title":"Sim- ple copy-paste is a strong data augmentation method for in- stance segmentation","venue":null,"work_id":"e818ad74-62de-4781-90a7-defc50ebb382","year":2021},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-17T10:49:42.091433Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.415762Z"},"links":{"citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:c94b8ca3e26d4551ff995d18dc3c1d76a01c34a4772ff14d52c41d2bc12f66d2","observation_id":"8c3a3708-31af-4e60-805a-ccac02f07346","resolution":{"observed_at":"2026-08-10T21:56:18.862232Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:17.420544Z","title":"Generative adversarial nets","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-17T10:49:42.091433Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.420544Z"},"links":{"citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:28ddb596825311fe86e91ef0b22ca04d1c24a67c2f29adbe6c16a0dc32ef3957","observation_id":"d65d071e-b193-48e9-ae1e-737705f845f8","resolution":{"observed_at":"2026-08-10T21:56:17.420544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:18.830850Z","title":"Lift-attend-splat: Bird’s-eye-view camera-lidar fusion using transformers, 2024","venue":null,"work_id":"2270f521-d444-4d65-beb9-51eb988a25fb","year":2024},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-17T10:49:42.091433Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.425270Z"},"links":{"citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:020ec61eb9a88099445cb13bf09afcbaed07d58afe8803b323830226aa31466d","observation_id":"3ad0f58f-248b-490b-94a0-b992e527141e","resolution":{"observed_at":"2026-08-10T21:56:18.836102Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:17.430058Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilib- rium","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-17T10:49:42.091433Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.430058Z"},"links":{"citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:cde9d812a70c5ff415941d2c70345ddcfecc20a0eab965258f9c913b64d1167e","observation_id":"ea9c71a9-1651-4e93-a135-1f6b7c18751e","resolution":{"observed_at":"2026-08-10T21:56:17.430058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-08-14T06:37:15.299690Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-08-10T21:56:17.434893Z","title":"Classifier-free diffusion guidance","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-17T10:49:42.091433Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.434893Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:d01795cb609fa98ed1f4a1bbf69f279b0654a5609e69c09c96f629d3d8438685","observation_id":"983f6922-7551-43d9-9ae9-d78abcdf0186","resolution":{"observed_at":"2026-08-10T21:56:17.434893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:17.440318Z","title":"Denoising dif- fusion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-17T10:49:42.091433Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.440318Z"},"links":{"citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:290407c3ba9b32eb16dad0499fa077997e9faf9bb2016b56fb4d9daae1faa0ad","observation_id":"37b2e307-75ba-444d-8961-ed5250f7f0c7","resolution":{"observed_at":"2026-08-10T21:56:17.440318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:18.794677Z","title":"Rangeldm: Fast realistic lidar point cloud generation, 2024","venue":null,"work_id":"acdd7a47-9c25-427f-bca3-d075923c8ff8","year":2024},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-17T10:49:42.091433Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.447599Z"},"links":{"citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:4515fc0edf9d1a40931e9fa273bfbf65e8a9c5d1c1d4322dfa12a9ce0242fcc7","observation_id":"436074c9-675a-4c56-b87e-7b7892636228","resolution":{"observed_at":"2026-08-10T21:56:18.799535Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:18.778978Z","title":"Subjectdrive: Scaling generative data in autonomous driving via subject control, 2024","venue":null,"work_id":"e09a81f0-3825-43f1-9517-d3b81b905840","year":2024},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-17T10:49:42.091433Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.453739Z"},"links":{"citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:6b895e79d7148117bd9fc19e59bca93a19ddb816c839c6e8651618ec72580718","observation_id":"ed158624-8ff3-4fef-9e97-029e44d57853","resolution":{"observed_at":"2026-08-10T21:56:18.783984Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6114","last_updated":"2022-12-10T21:04:00Z","snapshot_observed_at":"2026-08-14T23:50:45.029465Z","submitted_at":"2013-12-20T20:58:10Z","title":"Auto-Encoding Variational Bayes","version":11},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6114","snapshot_observed_at":"2026-08-10T21:56:17.459541Z","title":"Auto-encoding vari- ational bayes","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-17T10:49:42.091433Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.459541Z"},"links":{"cited_paper":"/paper/1312.6114","citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:0988b5ab282dbe855a389253a8e9871769e7c5b35a0d1bd741b9a9f0a9ca4ce1","observation_id":"b3bb0344-3905-4d37-9ecb-04d4dc72dd0a","resolution":{"observed_at":"2026-08-10T21:56:17.459541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2412.07385","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:18.086290Z","title":"Logen: Toward lidar object generation by point dif- fusion","venue":null,"work_id":"ee28fb19-3e4e-4c86-9844-f78d9349ede0","year":2024},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-17T10:49:42.091433Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.464824Z"},"links":{"citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:1631bd7595cc4c04d59987c05464332cd330233f6c05b7c035ba9019c2178382","observation_id":"6d0a0da8-d37c-49eb-b21e-6953b82b0639","resolution":{"observed_at":"2026-08-10T21:56:18.096220Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.02643","last_updated":"2023-04-05T17:59:46Z","snapshot_observed_at":"2026-08-08T05:14:59.435033Z","submitted_at":"2023-04-05T17:59:46Z","title":"Segment Anything","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.02643","snapshot_observed_at":"2026-08-10T21:56:17.469966Z","title":"Segment any- thing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-17T10:49:42.091433Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.469966Z"},"links":{"cited_paper":"/paper/2304.02643","citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:b4ec0fb6aabb6a6fc02cc10759df9a4c77ace62836f2906ba3f92e6fb45f469f","observation_id":"469240ef-56a3-4c90-a5d3-0b3fc5e762ac","resolution":{"observed_at":"2026-08-10T21:56:17.469966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:18.761871Z","title":"Challenges in au- tonomous vehicle testing and validation","venue":null,"work_id":"1e0e7c61-4253-4957-b90c-50ed8d4cc958","year":2016},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-17T10:49:42.091433Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.475360Z"},"links":{"citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:70f84b9cfe63125fb50ffa56b6071545200f162a20ffe2b1eeb8b5ddfe12765c","observation_id":"ce39912a-5252-4f2b-8467-5745d75a6a81","resolution":{"observed_at":"2026-08-10T21:56:18.767748Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:18.744883Z","title":"Efros, and Krishna Kumar Singh","venue":null,"work_id":"caa3db26-c0c5-4b8f-ac1c-69b126690b8c","year":2023},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-17T10:49:42.091433Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.480316Z"},"links":{"citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:d566c1191cf7afcaf46134da0e7d597a5599c1a2c1767f34b951b05824b9563b","observation_id":"57ba7a44-af7f-4f18-864f-492a9073bcfb","resolution":{"observed_at":"2026-08-10T21:56:18.750128Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:18.728923Z","title":"Lift3d: Synthesize 3d training data by lift- ing 2d gan to 3d generative radiance field","venue":null,"work_id":"5bdc75b5-e441-4942-b38b-e6ee2088dbe3","year":2023},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-17T10:49:42.091433Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.485834Z"},"links":{"citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:51ee27449f496cab2e28bc7f37eb678ad633bb672422575c1dff3576075576f5","observation_id":"305a4560-28a1-47e8-9f8d-6fd3348fcea6","resolution":{"observed_at":"2026-08-10T21:56:18.734014Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07771","last_updated":"2023-10-11T18:00:08Z","snapshot_observed_at":"2026-08-20T07:30:15.087243Z","submitted_at":"2023-10-11T18:00:08Z","title":"DrivingDiffusion: Layout-Guided multi-view driving scene video generation with latent diffusion model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.07771","snapshot_observed_at":"2026-08-10T21:56:17.492015Z","title":"Drivingdif- fusion: Layout-guided multi-view driving scene video generation with latent diffusion model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-17T10:49:42.091433Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.492015Z"},"links":{"cited_paper":"/paper/2310.07771","citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:ceacfa3a8b69c61d5a96d25a3123aedfdc8e1a774427764b3d5a92dc38272497","observation_id":"0c6e2faf-b88d-48fc-85af-79861b4d160e","resolution":{"observed_at":"2026-08-10T21:56:17.492015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:18.713813Z","title":"Exploring geometric consistency for monocular 3d object detection","venue":null,"work_id":"ca155435-910d-4f29-b235-a308ba582ed4","year":2022},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-17T10:49:42.091433Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.497164Z"},"links":{"citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:7596ed0752dbc354dc2ba14e3c0d22bcd10cfb4a80fd832728405a995ab6f6c1","observation_id":"1b1ec102-21be-4c96-8731-f664d3ade34e","resolution":{"observed_at":"2026-08-10T21:56:18.718662Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:18.697972Z","title":"Bevfusion: A simple and robust lidar-camera fusion framework, 2022","venue":null,"work_id":"cca3e3b0-c9cd-4cad-816f-dd49c387d652","year":2022},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-17T10:49:42.091433Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.501798Z"},"links":{"citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:f717a2c83587441db48c19b5256a71d35d38b8b9c18b7cb24b527beb428e0bfb","observation_id":"8cba1310-bb21-4f93-96b8-83092fb11df3","resolution":{"observed_at":"2026-08-10T21:56:18.703286Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14494","last_updated":"2024-12-19T03:39:13Z","snapshot_observed_at":"2026-08-18T19:21:53.731487Z","submitted_at":"2024-12-19T03:39:13Z","title":"Drive-1-to-3: Enriching Diffusion Priors for Novel View Synthesis of Real Vehicles","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14494","snapshot_observed_at":"2026-08-10T21:56:17.506321Z","title":"Drive-1-to-3: En- riching diffusion priors for novel view synthesis of real vehi- cles","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-17T10:49:42.091433Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.506321Z"},"links":{"cited_paper":"/paper/2412.14494","citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:439f688deb7589172a0ec1366693a4270156cc702d8c468690cef97654824feb","observation_id":"bd5ac471-f523-4d4e-a305-bd178c5025ca","resolution":{"observed_at":"2026-08-10T21:56:17.506321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:18.682692Z","title":"St-gan: Spatial transformer generative adversarial networks for image compositing","venue":null,"work_id":"84c016c6-c681-46ee-8446-9663f574ff11","year":2018},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-17T10:49:42.091433Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.511348Z"},"links":{"citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:8481f8f5566385b04850a5253e301417eeef09d106a8d5ec1585319c0eb919c8","observation_id":"4534147c-cd8d-4643-ae89-6b68568a61f3","resolution":{"observed_at":"2026-08-10T21:56:18.687570Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.09778","last_updated":"2022-10-31T09:05:25Z","snapshot_observed_at":"2026-08-16T17:20:02.890207Z","submitted_at":"2022-02-20T10:37:52Z","title":"Pseudo Numerical Methods for Diffusion Models on Manifolds","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.09778","snapshot_observed_at":"2026-08-10T21:56:17.515918Z","title":"Pseudo numerical methods for diffusion models on manifolds.arXiv preprint arXiv:2202.09778, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-17T10:49:42.091433Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.515918Z"},"links":{"cited_paper":"/paper/2202.09778","citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:ce5f93524d1cfc3625d8a2f91b46d08daa9610ec66fe8575b3fa10bc3814b948","observation_id":"c4a100ad-469f-47bd-8c4d-59c2b2b75c05","resolution":{"observed_at":"2026-08-10T21:56:17.515918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:17.520841Z","title":"Swin transformer: Hierarchical vision transformer using shifted windows","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-17T10:49:42.091433Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.520841Z"},"links":{"citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:e3ba1a9d6a330aadb03815cb5c22e5980a4c2638c61529eeb535febc1a84c588","observation_id":"5cc4de9a-98f5-477b-9760-a1dbc497e3e0","resolution":{"observed_at":"2026-08-10T21:56:17.520841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:18.655023Z","title":"Bevfusion: Multi- task multi-sensor fusion with unified bird’s-eye view repre- sentation","venue":null,"work_id":"28a754be-f7b9-4e5c-b8f1-d2b72e647f21","year":2023},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-17T10:49:42.091433Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.526282Z"},"links":{"citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:738049072896195a3cf1b5d4b19315b2d0e46f29acd41debcc52c657699f71d0","observation_id":"947cbaf7-2362-426e-be74-cc04beb84f60","resolution":{"observed_at":"2026-08-10T21:56:18.660617Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:18.637849Z","title":"Wovogen: World volume-aware diffusion for con- trollable multi-camera driving scene generation","venue":null,"work_id":"266f119e-ddab-4004-adec-27e270b0f55b","year":2025},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-17T10:49:42.091433Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.531152Z"},"links":{"citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:2e2e4a3b515149d67297651cd1ef9d6063fa518f58897cd84a15fc0f00f9397d","observation_id":"eb6f9c65-cd49-431c-93d1-e6f4b1af338f","resolution":{"observed_at":"2026-08-10T21:56:18.643099Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:18.622403Z","title":"Object 3dit: Language-guided 3d-aware image editing","venue":null,"work_id":"6a54c179-ac60-4992-95aa-173cfc5f08b5","year":2024},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-17T10:49:42.091433Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.535766Z"},"links":{"citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:10debb05196021aa5c7d39903016188b9becdc1eb8080d06fb03da3120646a05","observation_id":"330b05a6-59ac-4f91-bc63-8efbfdb0bec9","resolution":{"observed_at":"2026-08-10T21:56:18.627260Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:18.605828Z","title":"Simple open-vocabulary object detection","venue":null,"work_id":"8a437e7e-13c1-4879-a963-210f507ac0a9","year":2022},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-17T10:49:42.091433Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.540178Z"},"links":{"citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:53cd67f42e2dee456740b02de19cd99c3709b32a25e2ac932acf02723e12240b","observation_id":"fafdc0b9-2a18-4561-a9e1-f6b40e99318d","resolution":{"observed_at":"2026-08-10T21:56:18.611089Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:18.589884Z","title":"Lidar data synthe- sis with denoising diffusion probabilistic models","venue":null,"work_id":"5fa09abf-c100-430b-8400-b2358680473f","year":2024},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-17T10:49:42.091433Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.544722Z"},"links":{"citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:e58846941a001892459b25e54a6098d473e5c6ba88d56d60316fbcd9d735a1ce","observation_id":"53f19588-67f1-4955-ac9b-25a2b6aeee54","resolution":{"observed_at":"2026-08-10T21:56:18.594970Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-17T13:03:40.359628Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-10T21:56:17.549185Z","title":"Dinov2: Learning robust visual features without supervision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-17T10:49:42.091433Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.549185Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:d463812972e5b74e54ba4a4317e46ae53dfcf85e3f71d7bd4765d3d0ca75009c","observation_id":"c97af81a-6df5-44d2-8414-c288a6e09f4b","resolution":{"observed_at":"2026-08-10T21:56:17.549185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:18.573586Z","title":"Diffusion handles enabling 3d edits for diffusion models by lifting ac- tivations to 3d","venue":null,"work_id":"0008c4af-4d97-409d-8b7a-985172c3ac56","year":2024},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-17T10:49:42.091433Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.554266Z"},"links":{"citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:e407b44248636413ac00d16fff13b5705bfac662b1fff8d392d98071578043de","observation_id":"f3004938-7190-4940-b9f2-aa7548a7cfea","resolution":{"observed_at":"2026-08-10T21:56:18.579070Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:17.559048Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-17T10:49:42.091433Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.559048Z"},"links":{"citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:c61651cb4353963083de1ebb70bcc223625eb28f548970e90a30bd6812da3f85","observation_id":"2a8a809b-dd46-4af4-bcec-c7e84c6a3953","resolution":{"observed_at":"2026-08-10T21:56:17.559048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:18.546788Z","title":"Towards realistic scene generation with lidar diffusion models, 2024","venue":null,"work_id":"619cc760-5624-401f-aaa9-4d963d282ace","year":2024},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-17T10:49:42.091433Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.563815Z"},"links":{"citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:845dfab80ee4026cada3a53895c8634723ad42c17298394606a3b56f7b42dd0e","observation_id":"d7455579-c92b-463d-b441-42ff75dd0ba9","resolution":{"observed_at":"2026-08-10T21:56:18.552088Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:17.568755Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-17T10:49:42.091433Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.568755Z"},"links":{"citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:40fe028d65b5270b579040c5e9a6fdbe42f8a2eec4c691dd133e5e34f8308218","observation_id":"beecb48a-36d5-4b79-a2f4-c45bb384afcf","resolution":{"observed_at":"2026-08-10T21:56:17.568755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:18.517593Z","title":"U- net: Convolutional networks for biomedical image segmen- tation","venue":null,"work_id":"63ca0aef-a627-4d69-aaaa-764f1ebfd7fb","year":2015},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-17T10:49:42.091433Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.573468Z"},"links":{"citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:d5a8f4bd565e380ec047baa34cf6150023fbc59ee9299de135cd8b05a2ce2213","observation_id":"90dabf68-a43d-4733-a263-333de67b95c9","resolution":{"observed_at":"2026-08-10T21:56:18.523057Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:17.578145Z","title":"Dreambooth: Fine tuning text-to-image diffusion models for subject-driven generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-17T10:49:42.091433Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.578145Z"},"links":{"citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:a14a74d23ab3d47965dbcd4fe1a0c3128ad65ccfdde21f22e9c75fa02fb17e0f","observation_id":"222f795f-7ebd-4a5f-8140-c38329b3e780","resolution":{"observed_at":"2026-08-10T21:56:17.578145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:18.491869Z","title":"Jacobs, and Shlomi Fruchter","venue":null,"work_id":"68b72e93-27fd-43f1-a329-cebae65c51ae","year":2024},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-17T10:49:42.091433Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.582708Z"},"links":{"citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:662f23c51845ecac9de1ab0a7c78ad56f5350a238d46257a0a0e205773478b0b","observation_id":"7b9346af-f29a-4326-9a0c-1e3cf40e6e7f","resolution":{"observed_at":"2026-08-10T21:56:18.496931Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10722","last_updated":"2024-06-15T19:29:01Z","snapshot_observed_at":"2026-08-16T13:42:40.267238Z","submitted_at":"2024-06-15T19:29:01Z","title":"GenMM: Geometrically and Temporally Consistent Multimodal Data Generation for Video and LiDAR","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10722","snapshot_observed_at":"2026-08-10T21:56:17.587143Z","title":"Genmm: Geometrically and temporally consistent multi- modal data generation for video and lidar","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-17T10:49:42.091433Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.587143Z"},"links":{"cited_paper":"/paper/2406.10722","citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:278e5234c50801f49455b2228ec47a805f52695348b28be3dc1fc106641f8b8a","observation_id":"37a1e6ee-553c-432b-8264-148279880619","resolution":{"observed_at":"2026-08-10T21:56:17.587143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:17.592439Z","title":"Deep unsupervised learning using nonequilibrium thermodynamics","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-17T10:49:42.091433Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.592439Z"},"links":{"citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:d38713bcd966df8b6193cda11ea61c2f27887cc242b25506febb23bcb31e211b","observation_id":"7ef3ab6c-4993-4be2-98bd-f9fdd66848c1","resolution":{"observed_at":"2026-08-10T21:56:17.592439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:18.465341Z","title":"Object- stitch: Object compositing with diffusion model","venue":null,"work_id":"f6d92d16-9488-4988-918b-a9e381655e1b","year":2023},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-17T10:49:42.091433Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.597296Z"},"links":{"citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:18823cdeabab142bb8fc59337c804d36a964f5c6e173b0ca24a3ad378fa46e5a","observation_id":"568ec495-6ffc-4b02-af33-562f1e8a35c5","resolution":{"observed_at":"2026-08-10T21:56:18.470970Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04504","last_updated":"2024-02-07T01:18:49Z","snapshot_observed_at":"2026-08-16T14:20:47.419886Z","submitted_at":"2024-02-07T01:18:49Z","title":"Text2Street: Controllable Text-to-image Generation for Street Views","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04504","snapshot_observed_at":"2026-08-10T21:56:17.602604Z","title":"Text2street: Controllable text-to-image gen- eration for street views","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-17T10:49:42.091433Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.602604Z"},"links":{"cited_paper":"/paper/2402.04504","citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:9c4624f8fe64fe5f1665c727ddd1e5fa1592876023db4dab2265f6ac2052c486","observation_id":"a0e115f2-baca-4447-ae38-1fe82fbac054","resolution":{"observed_at":"2026-08-10T21:56:17.602604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:18.449607Z","title":"Neurad: Neural rendering for autonomous driving","venue":null,"work_id":"013d4a16-1b5f-4a58-9f6d-b3711e0201e6","year":2024},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-17T10:49:42.091433Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.608291Z"},"links":{"citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:dbc3044f22fd36a61bae693bd753c5fc3c77f790d084d102e519fc6405c89de1","observation_id":"b7f0b73f-2569-4807-a59f-ad57ab385ce9","resolution":{"observed_at":"2026-08-10T21:56:18.454725Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:18.434306Z","title":"Pointaugmenting: Cross-modal augmentation for 3d object 10 detection","venue":null,"work_id":"dd63e0b1-01a3-401b-842d-d6650bd74ca6","year":2021},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-17T10:49:42.091433Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.613252Z"},"links":{"citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:8cc1e3020f8669ffc89ce7732c232b54a10009cc7fe747360c657eb274565dfb","observation_id":"599c6803-bec8-40f5-b11f-b33c0c77a246","resolution":{"observed_at":"2026-08-10T21:56:18.439052Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01447","last_updated":"2023-11-02T17:56:59Z","snapshot_observed_at":"2026-08-16T14:46:26.421099Z","submitted_at":"2023-11-02T17:56:59Z","title":"CADSim: Robust and Scalable in-the-wild 3D Reconstruction for Controllable Sensor Simulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01447","snapshot_observed_at":"2026-08-10T21:56:17.618547Z","title":"Cadsim: Robust and scalable in-the- wild 3d reconstruction for controllable sensor simulation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-17T10:49:42.091433Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.618547Z"},"links":{"cited_paper":"/paper/2311.01447","citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:e6cf4b004e9b89eb6d07fc0ca3f05dd7676cfbc71c82ea9d1b1495847c2d9786","observation_id":"115f6f95-5471-4827-bfa8-a5ddae4f70af","resolution":{"observed_at":"2026-08-10T21:56:17.618547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:18.419105Z","title":"Diffusion models are geometry critics: Single image 3d editing using pre-trained diffusion priors","venue":null,"work_id":"2df5aaf0-0818-407c-ae99-c70037c7d97d","year":null},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-17T10:49:42.091433Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.623800Z"},"links":{"citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:5de1ec9d105698677f136497a4e9ce265a6f05c1afca2e7356b0be3d12c3eadd","observation_id":"0c073766-6195-4621-9bdf-8778ccfbd337","resolution":{"observed_at":"2026-08-10T21:56:18.423916Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:18.404458Z","title":null,"venue":null,"work_id":"cc28037d-8ef4-499c-afad-1294713b3a34","year":2024},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-17T10:49:42.091433Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.629079Z"},"links":{"citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:dc7ad1db71323fc741a924246da0c59d17cf61ae2fa6a21109731608893a47a0","observation_id":"999e3ac6-500f-405f-9d76-745c245996f3","resolution":{"observed_at":"2026-08-10T21:56:18.409145Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:18.388078Z","title":"Editable scene simulation for autonomous driving via collaborative llm-agents","venue":null,"work_id":"20d5b606-4e20-46d7-aa91-bb3ed9e455d9","year":2024},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-17T10:49:42.091433Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.633886Z"},"links":{"citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:fb1cfafba481c8a4b473aa9cf6410a6addd181f82f41b595f3703536fe52f2ca","observation_id":"485b0ec7-a3d4-465a-ac3b-ef7c8ae90c12","resolution":{"observed_at":"2026-08-10T21:56:18.393597Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16813","last_updated":"2023-11-28T14:22:24Z","snapshot_observed_at":"2026-08-16T14:39:38.266816Z","submitted_at":"2023-11-28T14:22:24Z","title":"Panacea: Panoramic and Controllable Video Generation for Autonomous Driving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16813","snapshot_observed_at":"2026-08-10T21:56:17.638566Z","title":"Panacea: Panoramic and controllable video generation for autonomous driving","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-17T10:49:42.091433Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.638566Z"},"links":{"cited_paper":"/paper/2311.16813","citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:1c71bda63ecefe99bd363f91d1af2a5e61b557b6623ce4a983de7ee1c2ada165","observation_id":"717efe7c-fe03-4adf-a795-f1a0ec67116b","resolution":{"observed_at":"2026-08-10T21:56:17.638566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:18.370945Z","title":"Objectdrop: Bootstrap- ping counterfactuals for photorealistic object removal and in- sertion, 2024","venue":null,"work_id":"df304c29-3477-4596-a380-da8b31bc6186","year":2024},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-17T10:49:42.091433Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.643562Z"},"links":{"citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:ec906858b31c8223d733ff891a1513148caebb20f3ccd7e8db5c385ceae73e40","observation_id":"34474a9c-4138-4a52-96e3-3dcda596dad1","resolution":{"observed_at":"2026-08-10T21:56:18.376127Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:18.353323Z","title":"Drivescape: To- wards high-resolution controllable multi-view driving video generation, 2024","venue":null,"work_id":"c1ab40b1-af05-4eb9-994b-da677a796cfc","year":2024},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-17T10:49:42.091433Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.648768Z"},"links":{"citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:849519f84270681887b345fc2adcc537847cd6569d5f142d8e4eeb90a22ad9e6","observation_id":"be6f34f1-6593-483f-ab7a-ef1d941dd7d6","resolution":{"observed_at":"2026-08-10T21:56:18.358909Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09292","last_updated":"2024-10-28T23:42:11Z","snapshot_observed_at":"2026-08-16T13:43:16.046812Z","submitted_at":"2024-06-13T16:29:18Z","title":"Neural Assets: 3D-Aware Multi-Object Scene Synthesis with Image Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09292","snapshot_observed_at":"2026-08-10T21:56:17.654761Z","title":"Neural assets: 3d-aware multi-object scene synthesis with image diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-17T10:49:42.091433Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.654761Z"},"links":{"cited_paper":"/paper/2406.09292","citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:997d44a8858b17f64fb229222aacc1631e2aa55e04a2d81e5e7e9bb819720c99","observation_id":"49e66a03-0e25-4810-a4aa-ed2458aeffa1","resolution":{"observed_at":"2026-08-10T21:56:17.654761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:18.336103Z","title":"Synthetic lidar point cloud generation using deep gen- erative models for improved driving scene object recogni- tion","venue":null,"work_id":"0b17e37e-7e15-40eb-8143-99a351d61d86","year":2024},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-17T10:49:42.091433Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.660051Z"},"links":{"citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:2a13c500256901568c6d237e48b17ddb21d55f9d01606001674acd53e313c078","observation_id":"03fbc3cc-656a-4eb3-8746-be76fdde7f8c","resolution":{"observed_at":"2026-08-10T21:56:18.341392Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01123","last_updated":"2024-11-02T03:52:12Z","snapshot_observed_at":"2026-08-20T06:08:50.122318Z","submitted_at":"2024-11-02T03:52:12Z","title":"X-Drive: Cross-modality consistent multi-sensor data synthesis for driving scenarios","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.01123","snapshot_observed_at":"2026-08-10T21:56:17.665000Z","title":"X-drive: Cross-modality consis- tent multi-sensor data synthesis for driving scenarios","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-17T10:49:42.091433Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.665000Z"},"links":{"cited_paper":"/paper/2411.01123","citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:696a81fb408d8c0afc5ac07f4140f88f91a5f33473c4fc55b502e77a8b6d9a1e","observation_id":"c5a06afd-1698-42a5-8614-2d27e2250f53","resolution":{"observed_at":"2026-08-10T21:56:17.665000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:18.320632Z","title":"Ultralidar: Learning compact representations for lidar completion and generation, 2023","venue":null,"work_id":"f6fd3865-54ff-4bb0-a7b4-731d124ab3a8","year":2023},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-17T10:49:42.091433Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.670311Z"},"links":{"citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:7a0c1553379c693aa8eccdc12a0b11c6bb73275cfca7ea00ed43dac6dcba158f","observation_id":"288e9a4c-977f-4364-ba3f-b1a77c14b761","resolution":{"observed_at":"2026-08-10T21:56:18.325513Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:18.304591Z","title":"Second: Sparsely embed- ded convolutional detection","venue":null,"work_id":"1641b3ae-d093-4058-a9b2-5f8277157544","year":2018},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-17T10:49:42.091433Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.675148Z"},"links":{"citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:28111c1e26a0d1e7f3b1579a11b363d452c27fa48fdcda9e3e543036bec7a43e","observation_id":"b831dfac-4cf9-4b0a-85b1-23889abe4ff3","resolution":{"observed_at":"2026-08-10T21:56:18.309824Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:17.680003Z","title":"Paint by example: Exemplar-based image editing with diffusion mod- els","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-17T10:49:42.091433Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.680003Z"},"links":{"citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:a01f917789731cd6ba00f54ac349c32913869011d4f37e12ecb597c130ee644f","observation_id":"213ebdca-53de-46ac-8a36-3dc3c9b00eb3","resolution":{"observed_at":"2026-08-10T21:56:17.680003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01661","last_updated":"2023-09-23T06:59:18Z","snapshot_observed_at":"2026-08-16T15:11:06.034826Z","submitted_at":"2023-08-03T09:56:31Z","title":"BEVControl: Accurately Controlling Street-view Elements with Multi-perspective Consistency via BEV Sketch Layout","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01661","snapshot_observed_at":"2026-08-10T21:56:17.685225Z","title":"Bevcontrol: Accurately controlling street- view elements with multi-perspective consistency via bev sketch layout","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-17T10:49:42.091433Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.685225Z"},"links":{"cited_paper":"/paper/2308.01661","citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:36fac32c672e4096f0be9868aca1efa53e3f11765b4c9f1f401ce7a433c79f48","observation_id":"4859d704-e15c-442a-9548-35b8abd91afb","resolution":{"observed_at":"2026-08-10T21:56:17.685225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:17.690608Z","title":"Unisim: A neural closed-loop sensor simulator","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-17T10:49:42.091433Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.690608Z"},"links":{"citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:e8476cc32714a3797659fdf38b87dacc6cf788a7ad051ff2c8100896122e7553","observation_id":"50ea3ab9-1c21-4998-80da-c29459aa7a8e","resolution":{"observed_at":"2026-08-10T21:56:17.690608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:17.695789Z","title":"Image sculpting: Precise ob- ject editing with 3d geometry control","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-17T10:49:42.091433Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.695789Z"},"links":{"citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:1dfdd0f0e23694f8a46f8e9547e8a018027770a4c4597213bd16ad4e66e23f25","observation_id":"8a159840-ff0e-4713-a2d8-732730d85113","resolution":{"observed_at":"2026-08-10T21:56:17.695789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19784","last_updated":"2023-12-07T15:22:07Z","snapshot_observed_at":"2026-08-16T14:47:31.937225Z","submitted_at":"2023-10-30T17:50:14Z","title":"CustomNet: Zero-shot Object Customization with Variable-Viewpoints in Text-to-Image Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.19784","snapshot_observed_at":"2026-08-10T21:56:17.700708Z","title":"Customnet: Zero-shot object customization with variable-viewpoints in text-to-image dif- fusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-17T10:49:42.091433Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.700708Z"},"links":{"cited_paper":"/paper/2310.19784","citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:7ba5cd7d39117f5356ef9070f66185d585b7c6030793a7fde82f49189d013e43","observation_id":"71297ca1-1fc4-4c5e-aa62-82bc5664404c","resolution":{"observed_at":"2026-08-10T21:56:17.700708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:17.705609Z","title":"Cutmix: Regu- larization strategy to train strong classifiers with localizable features","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-17T10:49:42.091433Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.705609Z"},"links":{"citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:75697c9835de4e99e106eb52098523c075a025af1a24fd31fe1239a5e0d4afa3","observation_id":"dd182fbb-1323-4358-8e89-a5c0f121f271","resolution":{"observed_at":"2026-08-10T21:56:17.705609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:18.246786Z","title":"Adding conditional control to text-to-image diffusion models","venue":null,"work_id":"7c2dfc7e-a20e-4947-bc57-d93240d50e81","year":2023},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-17T10:49:42.091433Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.710394Z"},"links":{"citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:8bf37d769fceb33c87d4db66f0fbf549691dbdf7c9295ea8428b6cc5313cc9ed","observation_id":"d401580e-7a4f-49cf-8029-b6641e72d82a","resolution":{"observed_at":"2026-08-10T21:56:18.252192Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:17.714885Z","title":"The unreasonable effectiveness of deep features as a perceptual metric","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-17T10:49:42.091433Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.714885Z"},"links":{"citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:7baa4d2b38055aef53a8a76405dcd32621c3089b383d45890b3fd2da4cbd2013","observation_id":"5948a2db-566b-478e-9d15-69a47fb94106","resolution":{"observed_at":"2026-08-10T21:56:17.714885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2012.12741","last_updated":"2021-04-21T16:23:20Z","snapshot_observed_at":"2026-08-16T18:56:23.800610Z","submitted_at":"2020-12-23T15:23:16Z","title":"Exploring Data Augmentation for Multi-Modality 3D Object Detection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.12741","snapshot_observed_at":"2026-08-10T21:56:17.719381Z","title":"Explor- ing data augmentation for multi-modality 3d object detec- tion","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-17T10:49:42.091433Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.719381Z"},"links":{"cited_paper":"/paper/2012.12741","citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:c6a8844c0f1fb0f7be674928075232dcb67049c1fce661d30e569a0e2a140be5","observation_id":"87f578b1-96b1-48c8-a829-cbbe8dd1c479","resolution":{"observed_at":"2026-08-10T21:56:17.719381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.12419","last_updated":"2025-05-01T12:58:23Z","snapshot_observed_at":"2026-08-17T08:41:06.267795Z","submitted_at":"2023-12-19T18:50:33Z","title":"Scene-Conditional 3D Object Stylization and Composition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.12419","snapshot_observed_at":"2026-08-10T21:56:17.724151Z","title":"Scene-conditional 3d object stylization and compo- sition","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-17T10:49:42.091433Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.724151Z"},"links":{"cited_paper":"/paper/2312.12419","citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:72be9677e64f16d1c8dc78e273832cc3ab20be9aac5c9d9e57ce77f48a54c649","observation_id":"91af7488-f78d-4083-b10b-2e4b0d54dfd9","resolution":{"observed_at":"2026-08-10T21:56:17.724151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:56:18.220598Z","title":"Learning to generate realistic lidar point clouds, 2022","venue":null,"work_id":"dd6e3655-f680-49ec-93fb-4c4c76544f67","year":2022},"citing_paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","snapshot_observed_at":"2026-08-17T10:49:42.091433Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:17.729124Z"},"links":{"citing_paper":"/paper/2501.03173"},"observation_digest":"sha256:72c37f109c9db6ee61bb0f949515f9653f6470bb929dfbdac1b0c8c6a557fe99","observation_id":"773076ce-60f6-4c5b-b9f5-e615be42e263","resolution":{"observed_at":"2026-08-10T21:56:18.225686Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.03173","last_updated":"2025-04-22T11:09:48Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-17T10:49:42.091433Z","submitted_at":"2025-01-06T17:43:26Z","title":"MObI: Multimodal Object Inpainting Using Diffusion Models"},"reference_resolution":{"displayed":75,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":38,"verified_exact":1,"verified_fuzzy":35},"total_outbound_references":75},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 75 of 75 outbound references and 0 inbound Pith citation observations for arXiv:2501.03173."}