{"as_of":"2026-08-09T10:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7f94bc445dd54cec4c7c5b76a1ed717c2718eba1fa31682a73a77c869fa08e85","coverage":[{"denominator":120,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T02:31:06.246205Z","state":"measured"},{"denominator":101,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":101,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-20T20:46:28.368416Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-20T20:49:00.847278Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2604.01207","last_updated":"2026-07-31T06:47:55Z","snapshot_observed_at":"2026-08-08T14:14:42.520398Z","submitted_at":"2026-04-01T17:51:00Z","title":"TRACE: High-Fidelity 3D Scene Editing via Tangible Reconstruction and Geometry-Aligned Contextual Video Masking","version":2},"cited_work":{"arxiv_id":"2604.01207","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2604.01207","snapshot_observed_at":"2026-08-03T02:16:17.363610Z","title":"Trace: High-fidelity 3d scene editing via tangible reconstruction and geometry-aligned contextual video masking.arXiv preprint arXiv:2604.01207","venue":null,"work_id":"717783f5-7c89-4914-acca-b8d21ba0e965","year":null},"citing_paper":{"arxiv_id":"2605.15186","last_updated":"2026-05-19T03:07:48Z","snapshot_observed_at":"2026-07-06T23:26:32.979566Z","submitted_at":"2026-05-14T17:59:04Z","title":"VGGT-Edit: Feed-forward Native 3D Scene Editing with Residual Field Prediction","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-20T20:46:28.368416Z"},"links":{"cited_paper":"/paper/2604.01207","citing_paper":"/paper/2605.15186"},"observation_digest":"sha256:56dcd9c4b9510aecf5154fa1ce96f5a583f613def02f4a658c7f8ba7b953588a","observation_id":"4a84d54a-4024-4b61-bf94-a52ca820935b","resolution":{"observed_at":"2026-08-03T02:16:17.363610Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2604.01207/citation-record","integrity":"/paper/2604.01207/integrity","json":"/paper/2604.01207/citation-record.json","paper":"/paper/2604.01207"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:30:55.522444Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.01207","last_updated":"2026-07-31T06:47:55Z","snapshot_observed_at":"2026-08-08T14:14:42.520398Z","submitted_at":"2026-04-01T17:51:00Z","title":"TRACE: High-Fidelity 3D Scene Editing via Tangible Reconstruction and Geometry-Aligned Contextual Video Masking","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T02:30:55.522444Z"},"links":{"citing_paper":"/paper/2604.01207"},"observation_digest":"sha256:b1be9bd6551922a9601de79064a9731aff9a24d31d8c7540b91e77f69a74fecd","observation_id":"c39ebb2a-4959-4acf-b1ae-b1486b1d790f","resolution":{"observed_at":"2026-08-03T02:30:55.522444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:30:55.592643Z","title":"In: Avidan, S., Brostow, G., Cissé, M., Farinella, G.M., Hassner, T","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2604.01207","last_updated":"2026-07-31T06:47:55Z","snapshot_observed_at":"2026-08-08T14:14:42.520398Z","submitted_at":"2026-04-01T17:51:00Z","title":"TRACE: High-Fidelity 3D Scene Editing via Tangible Reconstruction and Geometry-Aligned Contextual Video Masking","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T02:30:55.592643Z"},"links":{"citing_paper":"/paper/2604.01207"},"observation_digest":"sha256:b48525c6e80dc74e109a2d89d35438e70f39da6d29f2e64f8607d23a4acbe121","observation_id":"e6186b94-fe36-49d0-b7eb-071835705074","resolution":{"observed_at":"2026-08-03T02:30:55.592643Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:30:55.681753Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.01207","last_updated":"2026-07-31T06:47:55Z","snapshot_observed_at":"2026-08-08T14:14:42.520398Z","submitted_at":"2026-04-01T17:51:00Z","title":"TRACE: High-Fidelity 3D Scene Editing via Tangible Reconstruction and Geometry-Aligned Contextual Video Masking","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T02:30:55.681753Z"},"links":{"citing_paper":"/paper/2604.01207"},"observation_digest":"sha256:dea028d3645e124695da6b40be533353d62f9b3e50272d969dfa432732023688","observation_id":"fcc91cc6-e181-42cd-bf10-746ef8cd953c","resolution":{"observed_at":"2026-08-03T02:30:55.681753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:30:55.785072Z","title":"In: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2604.01207","last_updated":"2026-07-31T06:47:55Z","snapshot_observed_at":"2026-08-08T14:14:42.520398Z","submitted_at":"2026-04-01T17:51:00Z","title":"TRACE: High-Fidelity 3D Scene Editing via Tangible Reconstruction and Geometry-Aligned Contextual Video Masking","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T02:30:55.785072Z"},"links":{"citing_paper":"/paper/2604.01207"},"observation_digest":"sha256:a1797abe2df393d980b50ecce026ac13fc7180e5e3db1d7268d02079e839742f","observation_id":"e151a6fb-da9b-423e-86df-f7b30e9a9c0f","resolution":{"observed_at":"2026-08-03T02:30:55.785072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-03T02:30:55.922542Z","title":"arXiv preprint arXiv:2311.15127 (2023) 4","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2604.01207","last_updated":"2026-07-31T06:47:55Z","snapshot_observed_at":"2026-08-08T14:14:42.520398Z","submitted_at":"2026-04-01T17:51:00Z","title":"TRACE: High-Fidelity 3D Scene Editing via Tangible Reconstruction and Geometry-Aligned Contextual Video Masking","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T02:30:55.922542Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2604.01207"},"observation_digest":"sha256:d29f2876d33e4035e1a54ff4b104cf3cc311e368fc950c7ece88f4bd0f649b27","observation_id":"28fe742b-7deb-4665-b052-029b27a7ddfa","resolution":{"observed_at":"2026-08-03T02:30:55.922542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:30:55.999039Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.01207","last_updated":"2026-07-31T06:47:55Z","snapshot_observed_at":"2026-08-08T14:14:42.520398Z","submitted_at":"2026-04-01T17:51:00Z","title":"TRACE: High-Fidelity 3D Scene Editing via Tangible Reconstruction and Geometry-Aligned Contextual Video Masking","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T02:30:55.999039Z"},"links":{"citing_paper":"/paper/2604.01207"},"observation_digest":"sha256:fb6551c9656514f6de77486537a5e3261db9d6500b6361c9c52b3dc93d9f99c8","observation_id":"ce81560c-219e-4a34-8558-134aeb25ee51","resolution":{"observed_at":"2026-08-03T02:30:55.999039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:30:56.079756Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2604.01207","last_updated":"2026-07-31T06:47:55Z","snapshot_observed_at":"2026-08-08T14:14:42.520398Z","submitted_at":"2026-04-01T17:51:00Z","title":"TRACE: High-Fidelity 3D Scene Editing via Tangible Reconstruction and Geometry-Aligned Contextual Video Masking","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T02:30:56.079756Z"},"links":{"citing_paper":"/paper/2604.01207"},"observation_digest":"sha256:e4790544c70ffccd8206477626a757f31b949ac80d34e71338225c210c28d59f","observation_id":"6f375ef6-2502-4512-8dc7-9b7173b97d99","resolution":{"observed_at":"2026-08-03T02:30:56.079756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:30:56.180188Z","title":"Blog Post (2024) 4","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.01207","last_updated":"2026-07-31T06:47:55Z","snapshot_observed_at":"2026-08-08T14:14:42.520398Z","submitted_at":"2026-04-01T17:51:00Z","title":"TRACE: High-Fidelity 3D Scene Editing via Tangible Reconstruction and Geometry-Aligned Contextual Video Masking","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T02:30:56.180188Z"},"links":{"citing_paper":"/paper/2604.01207"},"observation_digest":"sha256:48d65653f19d1b0bd8dafa40891bf7141c65827b0ac300f8c8738a98a6a2fb2d","observation_id":"555893b1-38fa-4aa1-b7b5-f77010b6bc49","resolution":{"observed_at":"2026-08-03T02:30:56.180188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22705","last_updated":"2025-05-28T17:59:15Z","snapshot_observed_at":"2026-07-30T00:45:52.058972Z","submitted_at":"2025-05-28T17:59:15Z","title":"HiDream-I1: A High-Efficient Image Generative Foundation Model with Sparse Diffusion Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22705","snapshot_observed_at":"2026-08-03T02:30:56.326028Z","title":"arXiv preprint arXiv:2505.22705 (2025).https://doi.org/10.48550/arXiv.2505.227054","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.01207","last_updated":"2026-07-31T06:47:55Z","snapshot_observed_at":"2026-08-08T14:14:42.520398Z","submitted_at":"2026-04-01T17:51:00Z","title":"TRACE: High-Fidelity 3D Scene Editing via Tangible Reconstruction and Geometry-Aligned Contextual Video Masking","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T02:30:56.326028Z"},"links":{"cited_paper":"/paper/2505.22705","citing_paper":"/paper/2604.01207"},"observation_digest":"sha256:c67e968f8e30cac7137f9c7da2debfd50a89e6a49538f24334d327b2d568b7ae","observation_id":"213ec001-3e93-438d-bbac-aa49dce66fe4","resolution":{"observed_at":"2026-08-03T02:30:56.326028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:30:56.436733Z","title":"arXiv preprint arXiv:2510.23306 (2025) 5","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.01207","last_updated":"2026-07-31T06:47:55Z","snapshot_observed_at":"2026-08-08T14:14:42.520398Z","submitted_at":"2026-04-01T17:51:00Z","title":"TRACE: High-Fidelity 3D Scene Editing via Tangible Reconstruction and Geometry-Aligned Contextual Video Masking","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T02:30:56.436733Z"},"links":{"citing_paper":"/paper/2604.01207"},"observation_digest":"sha256:be6ae4c8ace82ffc0fffe8e1439be6ec07e27400c80e33add46ff084701bfc06","observation_id":"4504e810-db18-4e91-aeae-e672024893d8","resolution":{"observed_at":"2026-08-03T02:30:56.436733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:30:56.546989Z","title":"arXiv preprint arXiv:2510.15857 (2025) 4","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.01207","last_updated":"2026-07-31T06:47:55Z","snapshot_observed_at":"2026-08-08T14:14:42.520398Z","submitted_at":"2026-04-01T17:51:00Z","title":"TRACE: High-Fidelity 3D Scene Editing via Tangible Reconstruction and Geometry-Aligned Contextual Video Masking","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T02:30:56.546989Z"},"links":{"citing_paper":"/paper/2604.01207"},"observation_digest":"sha256:0c83afde61224dfd0bc3a3db4f537e6b4cd30257701942ca4684754fee58d8b8","observation_id":"241d1a04-88eb-4701-aa94-6a0c702f2366","resolution":{"observed_at":"2026-08-03T02:30:56.546989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:30:56.664645Z","title":"arXiv preprint arXiv:2511.23172 (2025) 2, 11, 12","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.01207","last_updated":"2026-07-31T06:47:55Z","snapshot_observed_at":"2026-08-08T14:14:42.520398Z","submitted_at":"2026-04-01T17:51:00Z","title":"TRACE: High-Fidelity 3D Scene Editing via Tangible Reconstruction and Geometry-Aligned Contextual Video Masking","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T02:30:56.664645Z"},"links":{"citing_paper":"/paper/2604.01207"},"observation_digest":"sha256:4253efe4cb2a18a9a67a1839f77d1c794a15e305a66a2f37de32606052e5c19d","observation_id":"62de7527-6e85-45e4-8443-dfc1c6c4067a","resolution":{"observed_at":"2026-08-03T02:30:56.664645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:30:56.789056Z","title":"In: European Conference on Computer Vision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.01207","last_updated":"2026-07-31T06:47:55Z","snapshot_observed_at":"2026-08-08T14:14:42.520398Z","submitted_at":"2026-04-01T17:51:00Z","title":"TRACE: High-Fidelity 3D Scene Editing via Tangible Reconstruction and Geometry-Aligned Contextual Video Masking","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T02:30:56.789056Z"},"links":{"citing_paper":"/paper/2604.01207"},"observation_digest":"sha256:995c7c30be990891ff4f1d0340115c4430c3a980af07920bb09a8943dac4c1d0","observation_id":"ad3afc36-649f-4207-a349-070674d3a31e","resolution":{"observed_at":"2026-08-03T02:30:56.789056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:30:56.887925Z","title":"In: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.01207","last_updated":"2026-07-31T06:47:55Z","snapshot_observed_at":"2026-08-08T14:14:42.520398Z","submitted_at":"2026-04-01T17:51:00Z","title":"TRACE: High-Fidelity 3D Scene Editing via Tangible Reconstruction and Geometry-Aligned Contextual Video Masking","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T02:30:56.887925Z"},"links":{"citing_paper":"/paper/2604.01207"},"observation_digest":"sha256:fc6631dd098fc14826761fe61936f2933f5bfa1aa8ec6400afd1964f618c5fbd","observation_id":"fbcace2b-15bb-4b2b-8ed2-0256641f82b0","resolution":{"observed_at":"2026-08-03T02:30:56.887925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.14521","last_updated":"2023-12-20T14:35:27Z","snapshot_observed_at":"2026-08-04T20:17:29.087115Z","submitted_at":"2023-11-24T14:46:59Z","title":"GaussianEditor: Swift and Controllable 3D Editing with Gaussian Splatting","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.14521","snapshot_observed_at":"2026-08-03T02:30:57.012361Z","title":"arXiv preprint arXiv:2311.14521 (2023) 2, 5, 11, 12","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2604.01207","last_updated":"2026-07-31T06:47:55Z","snapshot_observed_at":"2026-08-08T14:14:42.520398Z","submitted_at":"2026-04-01T17:51:00Z","title":"TRACE: High-Fidelity 3D Scene Editing via Tangible Reconstruction and Geometry-Aligned Contextual Video Masking","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T02:30:57.012361Z"},"links":{"cited_paper":"/paper/2311.14521","citing_paper":"/paper/2604.01207"},"observation_digest":"sha256:5a0853ee910b6fd61457338a6ad3634572ca22824c9b43a20d4b1ee27cb951c3","observation_id":"85c5e5b3-a097-4c1f-a442-b65d9623bdd0","resolution":{"observed_at":"2026-08-03T02:30:57.012361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:30:57.138450Z","title":"In: The Eleventh International Con- ference on Learning Representations (2023) 4","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2604.01207","last_updated":"2026-07-31T06:47:55Z","snapshot_observed_at":"2026-08-08T14:14:42.520398Z","submitted_at":"2026-04-01T17:51:00Z","title":"TRACE: High-Fidelity 3D Scene Editing via Tangible Reconstruction and Geometry-Aligned Contextual Video Masking","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T02:30:57.138450Z"},"links":{"citing_paper":"/paper/2604.01207"},"observation_digest":"sha256:b715aead94ccdfb0ab5addbc06b9a549c3f319476ca0ecf28a934305611ab728","observation_id":"2dff033e-c7e8-461e-9c75-eb84578ca4db","resolution":{"observed_at":"2026-08-03T02:30:57.138450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-07T15:13:13.622286Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.26583","snapshot_observed_at":"2026-08-03T02:30:57.284292Z","title":"arXiv preprint arXiv:2510.26583 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.01207","last_updated":"2026-07-31T06:47:55Z","snapshot_observed_at":"2026-08-08T14:14:42.520398Z","submitted_at":"2026-04-01T17:51:00Z","title":"TRACE: High-Fidelity 3D Scene Editing via Tangible Reconstruction and Geometry-Aligned Contextual Video Masking","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T02:30:57.284292Z"},"links":{"cited_paper":"/paper/2510.26583","citing_paper":"/paper/2604.01207"},"observation_digest":"sha256:0dd811c167ab01a6bc718308a4cc2bfb6e3745cbd12031c94d567430f96438b5","observation_id":"900bf7e2-3b1b-486b-aa15-3b9281c21bf4","resolution":{"observed_at":"2026-08-03T02:30:57.284292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:30:57.400960Z","title":"In: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.01207","last_updated":"2026-07-31T06:47:55Z","snapshot_observed_at":"2026-08-08T14:14:42.520398Z","submitted_at":"2026-04-01T17:51:00Z","title":"TRACE: High-Fidelity 3D Scene Editing via Tangible Reconstruction and Geometry-Aligned Contextual Video Masking","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T02:30:57.400960Z"},"links":{"citing_paper":"/paper/2604.01207"},"observation_digest":"sha256:0eb90a1eec0e2393cf53781d8a72974fe376819a4089851b84554165ddffcd39","observation_id":"f4bcf300-5e74-42d7-ac67-2d71373c2618","resolution":{"observed_at":"2026-08-03T02:30:57.400960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.05663","last_updated":"2023-07-11T17:57:40Z","snapshot_observed_at":"2026-07-06T15:52:52.180267Z","submitted_at":"2023-07-11T17:57:40Z","title":"Objaverse-XL: A Universe of 10M+ 3D Objects","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.05663","snapshot_observed_at":"2026-08-03T02:30:57.544279Z","title":"arXiv preprint arXiv:2307.05663 (2023) 6","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2604.01207","last_updated":"2026-07-31T06:47:55Z","snapshot_observed_at":"2026-08-08T14:14:42.520398Z","submitted_at":"2026-04-01T17:51:00Z","title":"TRACE: High-Fidelity 3D Scene Editing via Tangible Reconstruction and Geometry-Aligned Contextual Video Masking","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T02:30:57.544279Z"},"links":{"cited_paper":"/paper/2307.05663","citing_paper":"/paper/2604.01207"},"observation_digest":"sha256:c5241fbdbd638e0582f477e76900cb066af0e2d6bb53e257617a122d77d2538b","observation_id":"f7c28c8a-79b6-4e5d-b20a-4ed49b8c98c2","resolution":{"observed_at":"2026-08-03T02:30:57.544279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14683","last_updated":"2025-07-27T11:45:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-20T17:59:30Z","title":"Emerging Properties in Unified Multimodal Pretraining","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14683","snapshot_observed_at":"2026-08-03T02:30:57.664490Z","title":"arXiv preprint arXiv:2505.14683 (2025).https://doi.org/10.48550/ arXiv.2505.146834","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.01207","last_updated":"2026-07-31T06:47:55Z","snapshot_observed_at":"2026-08-08T14:14:42.520398Z","submitted_at":"2026-04-01T17:51:00Z","title":"TRACE: High-Fidelity 3D Scene Editing via Tangible Reconstruction and Geometry-Aligned Contextual Video Masking","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T02:30:57.664490Z"},"links":{"cited_paper":"/paper/2505.14683","citing_paper":"/paper/2604.01207"},"observation_digest":"sha256:8e1ff3b239f7e7adc77c86955e3e39b316af5df3a5f71cea1da7d0219bcd8b1f","observation_id":"324a443b-3d92-4c3e-8749-612e3092b68d","resolution":{"observed_at":"2026-08-03T02:30:57.664490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:30:57.777234Z","title":"arXiv preprint arXiv:2509.24979 (2025).https: //doi.org/10.48550/arXiv.2509.249794","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.01207","last_updated":"2026-07-31T06:47:55Z","snapshot_observed_at":"2026-08-08T14:14:42.520398Z","submitted_at":"2026-04-01T17:51:00Z","title":"TRACE: High-Fidelity 3D Scene Editing via Tangible Reconstruction and Geometry-Aligned Contextual Video Masking","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T02:30:57.777234Z"},"links":{"citing_paper":"/paper/2604.01207"},"observation_digest":"sha256:6e00d305d2890c5a5f342b747d8dc9cb3c09d61db63dda1c5526b979707c113b","observation_id":"611223b6-6282-4e21-86fb-bdaebd551a30","resolution":{"observed_at":"2026-08-03T02:30:57.777234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:30:57.897029Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.01207","last_updated":"2026-07-31T06:47:55Z","snapshot_observed_at":"2026-08-08T14:14:42.520398Z","submitted_at":"2026-04-01T17:51:00Z","title":"TRACE: High-Fidelity 3D Scene Editing via Tangible Reconstruction and Geometry-Aligned Contextual Video Masking","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T02:30:57.897029Z"},"links":{"citing_paper":"/paper/2604.01207"},"observation_digest":"sha256:849ddc572b53aac241f2921814d1a16d7dd756864c24396d85999c10d869136d","observation_id":"21b65fd4-20d4-4754-a0e1-b18320588d19","resolution":{"observed_at":"2026-08-03T02:30:57.897029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:30:58.051399Z","title":"In: Forty-First International Conference on Machine Learning (2024) 4","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.01207","last_updated":"2026-07-31T06:47:55Z","snapshot_observed_at":"2026-08-08T14:14:42.520398Z","submitted_at":"2026-04-01T17:51:00Z","title":"TRACE: High-Fidelity 3D Scene Editing via Tangible Reconstruction and Geometry-Aligned Contextual Video Masking","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T02:30:58.051399Z"},"links":{"citing_paper":"/paper/2604.01207"},"observation_digest":"sha256:120c3b78baf552026867a5b0f51424fa8c57795d2a51a8df6f9776bfd26ef7ad","observation_id":"f3df5315-5855-4bc3-b093-7d1c8dfcd76f","resolution":{"observed_at":"2026-08-03T02:30:58.051399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:30:58.227152Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.01207","last_updated":"2026-07-31T06:47:55Z","snapshot_observed_at":"2026-08-08T14:14:42.520398Z","submitted_at":"2026-04-01T17:51:00Z","title":"TRACE: High-Fidelity 3D Scene Editing via Tangible Reconstruction and Geometry-Aligned Contextual Video Masking","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T02:30:58.227152Z"},"links":{"citing_paper":"/paper/2604.01207"},"observation_digest":"sha256:a966f2d78026c5cf3493a7ceaba60922aec85590d74df852f444896f2e248af7","observation_id":"a8e12737-1f1c-44eb-973b-29907e987988","resolution":{"observed_at":"2026-08-03T02:30:58.227152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:30:58.347818Z","title":"In: SIGGRAPH Asia 2024 Conference Papers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.01207","last_updated":"2026-07-31T06:47:55Z","snapshot_observed_at":"2026-08-08T14:14:42.520398Z","submitted_at":"2026-04-01T17:51:00Z","title":"TRACE: High-Fidelity 3D Scene Editing via Tangible Reconstruction and Geometry-Aligned Contextual Video Masking","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-03T02:30:58.347818Z"},"links":{"citing_paper":"/paper/2604.01207"},"observation_digest":"sha256:62a496f8324c933a1a7627da19348d43eed9dcb809ad938028d93a183f416fd6","observation_id":"c8ede35c-9d47-4d6c-996a-8e0347757301","resolution":{"observed_at":"2026-08-03T02:30:58.347818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.10373","last_updated":"2023-11-20T10:54:09Z","snapshot_observed_at":"2026-08-06T08:12:35.134201Z","submitted_at":"2023-07-19T18:00:03Z","title":"TokenFlow: Consistent Diffusion Features for Consistent Video Editing","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.10373","snapshot_observed_at":"2026-08-03T02:30:58.463436Z","title":"arXiv preprint arxiv:2307.10373 (2023) 4","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2604.01207","last_updated":"2026-07-31T06:47:55Z","snapshot_observed_at":"2026-08-08T14:14:42.520398Z","submitted_at":"2026-04-01T17:51:00Z","title":"TRACE: High-Fidelity 3D Scene Editing via Tangible Reconstruction and Geometry-Aligned Contextual Video Masking","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-03T02:30:58.463436Z"},"links":{"cited_paper":"/paper/2307.10373","citing_paper":"/paper/2604.01207"},"observation_digest":"sha256:48b62dbca61e27d134277b28b2db55ff8c600c59372a88f6739d5abe448342a0","observation_id":"80ae0602-d23e-47ed-b3b8-fb51c8c6efb6","resolution":{"observed_at":"2026-08-03T02:30:58.463436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.07984","last_updated":"2024-12-10T23:57:18Z","snapshot_observed_at":"2026-07-06T20:04:57.037551Z","submitted_at":"2024-12-10T23:57:18Z","title":"Diffusion-Based Attention Warping for Consistent 3D Scene Editing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.07984","snapshot_observed_at":"2026-08-03T02:30:58.575560Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.01207","last_updated":"2026-07-31T06:47:55Z","snapshot_observed_at":"2026-08-08T14:14:42.520398Z","submitted_at":"2026-04-01T17:51:00Z","title":"TRACE: High-Fidelity 3D Scene Editing via Tangible Reconstruction and Geometry-Aligned Contextual Video Masking","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-03T02:30:58.575560Z"},"links":{"cited_paper":"/paper/2412.07984","citing_paper":"/paper/2604.01207"},"observation_digest":"sha256:44684213556a54b0a32f426929196df416b1e026f73f77b452b9f4df7bdcfe59","observation_id":"34446735-df6f-40b1-abf3-39839801d6dd","resolution":{"observed_at":"2026-08-03T02:30:58.575560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:30:58.653310Z","title":"Blog Post (2024) 4","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.01207","last_updated":"2026-07-31T06:47:55Z","snapshot_observed_at":"2026-08-08T14:14:42.520398Z","submitted_at":"2026-04-01T17:51:00Z","title":"TRACE: High-Fidelity 3D Scene Editing via Tangible Reconstruction and Geometry-Aligned Contextual Video Masking","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-03T02:30:58.653310Z"},"links":{"citing_paper":"/paper/2604.01207"},"observation_digest":"sha256:110c140725296fe43c237c339dd61e684a80d1f30a53f3c0be14ef750978d18d","observation_id":"32035334-0cb5-4e86-a76d-070c37bb05cc","resolution":{"observed_at":"2026-08-03T02:30:58.653310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:30:58.753365Z","title":"Blog Post (2024) 4","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.01207","last_updated":"2026-07-31T06:47:55Z","snapshot_observed_at":"2026-08-08T14:14:42.520398Z","submitted_at":"2026-04-01T17:51:00Z","title":"TRACE: High-Fidelity 3D Scene Editing via Tangible Reconstruction and Geometry-Aligned Contextual Video Masking","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-03T02:30:58.753365Z"},"links":{"citing_paper":"/paper/2604.01207"},"observation_digest":"sha256:21e3b10c5afc929e0565bc6bc908c3fbb14908895ca29d5cb2c320e8c5e67324","observation_id":"1d78e47d-2ef8-4350-b3af-b9f3a688e809","resolution":{"observed_at":"2026-08-03T02:30:58.753365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:30:58.835493Z","title":"Blog Post (2025) 4 TRACE 17","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.01207","last_updated":"2026-07-31T06:47:55Z","snapshot_observed_at":"2026-08-08T14:14:42.520398Z","submitted_at":"2026-04-01T17:51:00Z","title":"TRACE: High-Fidelity 3D Scene Editing via Tangible Reconstruction and Geometry-Aligned Contextual Video Masking","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-03T02:30:58.835493Z"},"links":{"citing_paper":"/paper/2604.01207"},"observation_digest":"sha256:56d4f63ae0812bee0265dab804dde662353b0ba02b3a8004da3ff0a59a4b481c","observation_id":"a477cc80-662f-4632-9bfa-820dc3ef80de","resolution":{"observed_at":"2026-08-03T02:30:58.835493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02087","last_updated":"2023-12-05T17:14:25Z","snapshot_observed_at":"2026-07-06T16:56:42.232555Z","submitted_at":"2023-12-04T17:58:06Z","title":"VideoSwap: Customized Video Subject Swapping with Interactive Semantic Point Correspondence","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.02087","snapshot_observed_at":"2026-08-03T02:30:58.902091Z","title":"arXiv preprint arXiv:2312.02087 (2023) 4","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2604.01207","last_updated":"2026-07-31T06:47:55Z","snapshot_observed_at":"2026-08-08T14:14:42.520398Z","submitted_at":"2026-04-01T17:51:00Z","title":"TRACE: High-Fidelity 3D Scene Editing via Tangible Reconstruction and Geometry-Aligned Contextual Video Masking","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-03T02:30:58.902091Z"},"links":{"cited_paper":"/paper/2312.02087","citing_paper":"/paper/2604.01207"},"observation_digest":"sha256:133857cf77aa578b644e12a706688f9d4b5cebffacf9fb23a3dfb5ad10ba0c68","observation_id":"8ff8f528-69d1-4da2-9b60-a38856edb48f","resolution":{"observed_at":"2026-08-03T02:30:58.902091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01430","last_updated":"2024-12-02T12:10:04Z","snapshot_observed_at":"2026-08-09T07:24:10.400011Z","submitted_at":"2024-12-02T12:10:04Z","title":"MVImgNet2.0: A Larger-scale Dataset of Multi-view Images","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.01430","snapshot_observed_at":"2026-08-03T02:30:58.978930Z","title":"0: A larger-scale dataset of multi-view images","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.01207","last_updated":"2026-07-31T06:47:55Z","snapshot_observed_at":"2026-08-08T14:14:42.520398Z","submitted_at":"2026-04-01T17:51:00Z","title":"TRACE: High-Fidelity 3D Scene Editing via Tangible Reconstruction and Geometry-Aligned Contextual Video Masking","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-03T02:30:58.978930Z"},"links":{"cited_paper":"/paper/2412.01430","citing_paper":"/paper/2604.01207"},"observation_digest":"sha256:f4e4c58b1cb5fa8dbf067e73d85f07f538278200861c386531cd834b7f531f8a","observation_id":"be0eb9a0-f2f4-4ce3-85b0-26a7a548619b","resolution":{"observed_at":"2026-08-03T02:30:58.978930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:30:59.132616Z","title":"In: Proceedings of the IEEE/CVF Interna- tional Conference on Computer Vision (2023) 5, 10","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2604.01207","last_updated":"2026-07-31T06:47:55Z","snapshot_observed_at":"2026-08-08T14:14:42.520398Z","submitted_at":"2026-04-01T17:51:00Z","title":"TRACE: High-Fidelity 3D Scene Editing via Tangible Reconstruction and Geometry-Aligned Contextual Video Masking","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-03T02:30:59.132616Z"},"links":{"citing_paper":"/paper/2604.01207"},"observation_digest":"sha256:6bf1a25b9a37850e9bfa127a6db01cfd3400dc245ca6024aa6d48aed64ede7e3","observation_id":"d7e58a81-00ad-4b53-be6c-714e86477eaa","resolution":{"observed_at":"2026-08-03T02:30:59.132616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:30:59.287084Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2604.01207","last_updated":"2026-07-31T06:47:55Z","snapshot_observed_at":"2026-08-08T14:14:42.520398Z","submitted_at":"2026-04-01T17:51:00Z","title":"TRACE: High-Fidelity 3D Scene Editing via Tangible Reconstruction and Geometry-Aligned Contextual Video Masking","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-03T02:30:59.287084Z"},"links":{"citing_paper":"/paper/2604.01207"},"observation_digest":"sha256:68d5c316ccb474976f0193cdddeee6e1cb7380c2261fe64a59c4d0b55a48e431","observation_id":"bed3df26-8d7c-4cfd-a0b6-7d230bb94156","resolution":{"observed_at":"2026-08-03T02:30:59.287084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-07T07:43:16.294957Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-03T02:30:59.404144Z","title":"arXiv preprint arXiv:2106.09685 (2021) 4","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2604.01207","last_updated":"2026-07-31T06:47:55Z","snapshot_observed_at":"2026-08-08T14:14:42.520398Z","submitted_at":"2026-04-01T17:51:00Z","title":"TRACE: High-Fidelity 3D Scene Editing via Tangible Reconstruction and Geometry-Aligned Contextual Video Masking","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-03T02:30:59.404144Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2604.01207"},"observation_digest":"sha256:dd03ff968c90b38f88deb7eba6d4febbad33e64ef1b871253adbd8807a22d852","observation_id":"d68cbf2b-9237-4c8d-9006-066b8c48d53e","resolution":{"observed_at":"2026-08-03T02:30:59.404144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:30:59.517723Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.01207","last_updated":"2026-07-31T06:47:55Z","snapshot_observed_at":"2026-08-08T14:14:42.520398Z","submitted_at":"2026-04-01T17:51:00Z","title":"TRACE: High-Fidelity 3D Scene Editing via Tangible Reconstruction and Geometry-Aligned Contextual Video Masking","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-03T02:30:59.517723Z"},"links":{"citing_paper":"/paper/2604.01207"},"observation_digest":"sha256:f6a670c6d0d12fee8c891d15b2f45324254e86fed906833fffdb15b130861a84","observation_id":"4a7c986e-aeaa-4ca6-a9e2-28e9123943ff","resolution":{"observed_at":"2026-08-03T02:30:59.517723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:30:59.632491Z","title":"In: Proceedings of the IEEE/CVF International Conference on Computer Vision (ICCV) (2025) 2, 4","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.01207","last_updated":"2026-07-31T06:47:55Z","snapshot_observed_at":"2026-08-08T14:14:42.520398Z","submitted_at":"2026-04-01T17:51:00Z","title":"TRACE: High-Fidelity 3D Scene Editing via Tangible Reconstruction and Geometry-Aligned Contextual Video Masking","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-03T02:30:59.632491Z"},"links":{"citing_paper":"/paper/2604.01207"},"observation_digest":"sha256:edd142d7ac3464269da34413190f0c273f9fe0b55143c89e341c9114cbb39440","observation_id":"78a3da73-82cb-44d8-886d-512968933d7c","resolution":{"observed_at":"2026-08-03T02:30:59.632491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:30:59.779343Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.01207","last_updated":"2026-07-31T06:47:55Z","snapshot_observed_at":"2026-08-08T14:14:42.520398Z","submitted_at":"2026-04-01T17:51:00Z","title":"TRACE: High-Fidelity 3D Scene Editing via Tangible Reconstruction and Geometry-Aligned Contextual Video Masking","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-03T02:30:59.779343Z"},"links":{"citing_paper":"/paper/2604.01207"},"observation_digest":"sha256:22b6b2da0572727d8e9e862d43e2dcf0926d797a3818ead593b723e65ececb39","observation_id":"5f48c9bf-9afe-4299-9666-343bfd14b66f","resolution":{"observed_at":"2026-08-03T02:30:59.779343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:30:59.917894Z","title":"In: ICLR (2024) 4","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.01207","last_updated":"2026-07-31T06:47:55Z","snapshot_observed_at":"2026-08-08T14:14:42.520398Z","submitted_at":"2026-04-01T17:51:00Z","title":"TRACE: High-Fidelity 3D Scene Editing via Tangible Reconstruction and Geometry-Aligned Contextual Video Masking","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-03T02:30:59.917894Z"},"links":{"citing_paper":"/paper/2604.01207"},"observation_digest":"sha256:3c75bae16c4b39805964b7a2c3f173bd8bc2ca31c3cca6bd3699611e6841c4c4","observation_id":"9a3c8bd9-2b16-4004-956e-4b1cf816830b","resolution":{"observed_at":"2026-08-03T02:30:59.917894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:30:59.997001Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2604.01207","last_updated":"2026-07-31T06:47:55Z","snapshot_observed_at":"2026-08-08T14:14:42.520398Z","submitted_at":"2026-04-01T17:51:00Z","title":"TRACE: High-Fidelity 3D Scene Editing via Tangible Reconstruction and Geometry-Aligned Contextual Video Masking","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-03T02:30:59.997001Z"},"links":{"citing_paper":"/paper/2604.01207"},"observation_digest":"sha256:b0eef51f50b214117b3d508021e67e381ad9621bdae3d5bd847c909ee1c43afc","observation_id":"05b84713-818a-4272-b4ca-3fa09e357fef","resolution":{"observed_at":"2026-08-03T02:30:59.997001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:31:00.084772Z","title":"ACM Transactions on Graphics42(4) (July 2023),https://repo-sam.inria.fr/fungraph/3d-gaussian-splatting/2","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2604.01207","last_updated":"2026-07-31T06:47:55Z","snapshot_observed_at":"2026-08-08T14:14:42.520398Z","submitted_at":"2026-04-01T17:51:00Z","title":"TRACE: High-Fidelity 3D Scene Editing via Tangible Reconstruction and Geometry-Aligned Contextual Video Masking","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-03T02:31:00.084772Z"},"links":{"citing_paper":"/paper/2604.01207"},"observation_digest":"sha256:0d1adef892460a498b9e262da4f91c29643b22eaed39d672bf2e3a7e2f4336b0","observation_id":"6fee3b62-7a14-47b6-9612-a51624326225","resolution":{"observed_at":"2026-08-03T02:31:00.084772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:31:00.206487Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.01207","last_updated":"2026-07-31T06:47:55Z","snapshot_observed_at":"2026-08-08T14:14:42.520398Z","submitted_at":"2026-04-01T17:51:00Z","title":"TRACE: High-Fidelity 3D Scene Editing via Tangible Reconstruction and Geometry-Aligned Contextual Video Masking","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-03T02:31:00.206487Z"},"links":{"citing_paper":"/paper/2604.01207"},"observation_digest":"sha256:83d405e162c786f5bd7c99c0ae5e59897ec05d423637b20780b75146de319cfc","observation_id":"e7b91f58-97cb-4ee1-a18f-c041b46e1830","resolution":{"observed_at":"2026-08-03T02:31:00.206487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.11394","last_updated":"2025-02-11T07:34:37Z","snapshot_observed_at":"2026-08-07T10:00:07.093412Z","submitted_at":"2024-07-16T05:26:14Z","title":"DreamCatalyst: Fast and High-Quality 3D Editing via Controlling Editability and Identity Preservation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.11394","snapshot_observed_at":"2026-08-03T02:31:00.354063Z","title":"arXiv preprint arXiv:2407.11394 (2024) 5","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.01207","last_updated":"2026-07-31T06:47:55Z","snapshot_observed_at":"2026-08-08T14:14:42.520398Z","submitted_at":"2026-04-01T17:51:00Z","title":"TRACE: High-Fidelity 3D Scene Editing via Tangible Reconstruction and Geometry-Aligned Contextual Video Masking","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-03T02:31:00.354063Z"},"links":{"cited_paper":"/paper/2407.11394","citing_paper":"/paper/2604.01207"},"observation_digest":"sha256:d9041a2a81ba035862c7ec73e9e740a803dd013e37fe8a039e3c700c1a09625a","observation_id":"aefde075-fcb4-4903-8a1f-c1bc04ae7ec5","resolution":{"observed_at":"2026-08-03T02:31:00.354063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-03T02:31:00.482575Z","title":"arXiv preprint arXiv:2412.03603 (2025).https://doi.org/10.48550/arXiv.2412.036034","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.01207","last_updated":"2026-07-31T06:47:55Z","snapshot_observed_at":"2026-08-08T14:14:42.520398Z","submitted_at":"2026-04-01T17:51:00Z","title":"TRACE: High-Fidelity 3D Scene Editing via Tangible Reconstruction and Geometry-Aligned Contextual Video Masking","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-03T02:31:00.482575Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2604.01207"},"observation_digest":"sha256:68f1e0a150a659339f9d7a7ec1cc0d8a3c32907e3cbba8ef505e222446aa12fd","observation_id":"4757e92e-aeb3-4aa7-8687-4d3c662175a1","resolution":{"observed_at":"2026-08-03T02:31:00.482575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14468","last_updated":"2024-11-03T21:16:54Z","snapshot_observed_at":"2026-07-06T17:48:24.076444Z","submitted_at":"2024-03-21T15:15:00Z","title":"AnyV2V: A Tuning-Free Framework For Any Video-to-Video Editing Tasks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.14468","snapshot_observed_at":"2026-08-03T02:31:00.643190Z","title":"arXiv preprint arXiv:2403.14468 (2024) 4 18 J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.01207","last_updated":"2026-07-31T06:47:55Z","snapshot_observed_at":"2026-08-08T14:14:42.520398Z","submitted_at":"2026-04-01T17:51:00Z","title":"TRACE: High-Fidelity 3D Scene Editing via Tangible Reconstruction and Geometry-Aligned Contextual Video Masking","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-03T02:31:00.643190Z"},"links":{"cited_paper":"/paper/2403.14468","citing_paper":"/paper/2604.01207"},"observation_digest":"sha256:42cb9be19a2d5de44a08c270b4774f914b28abfaf9ea98c0be437e79d59cde39","observation_id":"34034540-a539-49e0-85b5-ee87b7fcb580","resolution":{"observed_at":"2026-08-03T02:31:00.643190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:31:00.807191Z","title":"Blog Post (2024) 12","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.01207","last_updated":"2026-07-31T06:47:55Z","snapshot_observed_at":"2026-08-08T14:14:42.520398Z","submitted_at":"2026-04-01T17:51:00Z","title":"TRACE: High-Fidelity 3D Scene Editing via Tangible Reconstruction and Geometry-Aligned Contextual Video Masking","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-03T02:31:00.807191Z"},"links":{"citing_paper":"/paper/2604.01207"},"observation_digest":"sha256:bdc9e304399a481b758c5cba5090f7278b917b3a3a36f4269112606fc97a1520","observation_id":"bfe77925-0ea9-4d05-8272-dc9ba2b61e2b","resolution":{"observed_at":"2026-08-03T02:31:00.807191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:31:00.930126Z","title":"In: Proceed- ings of the IEEE/CVF International Conference on Computer Vision","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.01207","last_updated":"2026-07-31T06:47:55Z","snapshot_observed_at":"2026-08-08T14:14:42.520398Z","submitted_at":"2026-04-01T17:51:00Z","title":"TRACE: High-Fidelity 3D Scene Editing via Tangible Reconstruction and Geometry-Aligned Contextual Video Masking","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-03T02:31:00.930126Z"},"links":{"citing_paper":"/paper/2604.01207"},"observation_digest":"sha256:930995fde8a0abfafe902960cb91b998fe5b166f7c38d773cd9751f9a39923de","observation_id":"5b145a54-a5eb-4c08-97ed-e36ae18de43e","resolution":{"observed_at":"2026-08-03T02:31:00.930126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:31:01.008111Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.01207","last_updated":"2026-07-31T06:47:55Z","snapshot_observed_at":"2026-08-08T14:14:42.520398Z","submitted_at":"2026-04-01T17:51:00Z","title":"TRACE: High-Fidelity 3D Scene Editing via Tangible Reconstruction and Geometry-Aligned Contextual Video Masking","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-03T02:31:01.008111Z"},"links":{"citing_paper":"/paper/2604.01207"},"observation_digest":"sha256:c2251705fc85ef86d42efa089e0d21752548e2a4968f20d3cae9a5db32c518e8","observation_id":"28b2b3d2-63fa-4a01-b6f9-6887b15e22f5","resolution":{"observed_at":"2026-08-03T02:31:01.008111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:31:01.079480Z","title":"Blog Post (2024) 4","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.01207","last_updated":"2026-07-31T06:47:55Z","snapshot_observed_at":"2026-08-08T14:14:42.520398Z","submitted_at":"2026-04-01T17:51:00Z","title":"TRACE: High-Fidelity 3D Scene Editing via Tangible Reconstruction and Geometry-Aligned Contextual Video Masking","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-03T02:31:01.079480Z"},"links":{"citing_paper":"/paper/2604.01207"},"observation_digest":"sha256:42aef546441eed856a93739b89b6d8e88a48a512047c32bbcc4fd9e4520a398a","observation_id":"63040101-1209-4fe5-9744-416584e10868","resolution":{"observed_at":"2026-08-03T02:31:01.079480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.15742","last_updated":"2025-06-24T05:31:03Z","snapshot_observed_at":"2026-07-06T21:44:22.901650Z","submitted_at":"2025-06-17T20:18:23Z","title":"FLUX.1 Kontext: Flow Matching for In-Context Image Generation and Editing in Latent Space","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.15742","snapshot_observed_at":"2026-08-03T02:31:01.151257Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.01207","last_updated":"2026-07-31T06:47:55Z","snapshot_observed_at":"2026-08-08T14:14:42.520398Z","submitted_at":"2026-04-01T17:51:00Z","title":"TRACE: High-Fidelity 3D Scene Editing via Tangible Reconstruction and Geometry-Aligned Contextual Video Masking","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-03T02:31:01.151257Z"},"links":{"cited_paper":"/paper/2506.15742","citing_paper":"/paper/2604.01207"},"observation_digest":"sha256:15d351f1b3d672daf483714bf9ec837d3f3b94487d103935b8c82ff7dda3df12","observation_id":"4b8667f1-2367-42fd-aca1-e46c3ac32a7b","resolution":{"observed_at":"2026-08-03T02:31:01.151257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:31:01.255440Z","title":"In: Proceedings of the Computer Vision and Pattern Recognition Conference","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.01207","last_updated":"2026-07-31T06:47:55Z","snapshot_observed_at":"2026-08-08T14:14:42.520398Z","submitted_at":"2026-04-01T17:51:00Z","title":"TRACE: High-Fidelity 3D Scene Editing via Tangible Reconstruction and Geometry-Aligned Contextual Video Masking","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-03T02:31:01.255440Z"},"links":{"citing_paper":"/paper/2604.01207"},"observation_digest":"sha256:172035fc1157a7dad12dafc8482ce31de48b11b6b3913bd29bce94a0260fe53d","observation_id":"57432c9d-60d7-4357-a6c8-484dfaa36343","resolution":{"observed_at":"2026-08-03T02:31:01.255440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:31:01.327368Z","title":"arXiv preprint arXiv:2505.01322 (2025) 2, 5","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.01207","last_updated":"2026-07-31T06:47:55Z","snapshot_observed_at":"2026-08-08T14:14:42.520398Z","submitted_at":"2026-04-01T17:51:00Z","title":"TRACE: High-Fidelity 3D Scene Editing via Tangible Reconstruction and Geometry-Aligned Contextual Video Masking","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-03T02:31:01.327368Z"},"links":{"citing_paper":"/paper/2604.01207"},"observation_digest":"sha256:4a1c6001b80311a82949b8ac8f68c2da6c5ac275ace5e19fbd62806d1dc9f363","observation_id":"f634cc60-f998-42eb-b07d-a3837c636de6","resolution":{"observed_at":"2026-08-03T02:31:01.327368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.16888","last_updated":"2025-11-04T13:15:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-19T15:38:06Z","title":"Uniworld-V2: Reinforce Image Editing with Diffusion Negative-aware Finetuning and MLLM Implicit Feedback","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.16888","snapshot_observed_at":"2026-08-03T02:31:01.408885Z","title":"arXiv preprint arXiv:2510.16888 (2025) 4","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.01207","last_updated":"2026-07-31T06:47:55Z","snapshot_observed_at":"2026-08-08T14:14:42.520398Z","submitted_at":"2026-04-01T17:51:00Z","title":"TRACE: High-Fidelity 3D Scene Editing via Tangible Reconstruction and Geometry-Aligned Contextual Video Masking","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-03T02:31:01.408885Z"},"links":{"cited_paper":"/paper/2510.16888","citing_paper":"/paper/2604.01207"},"observation_digest":"sha256:24ff266ec9d7b7308552961ce6cf8d568feda775abdcc1be1b42b1af74285ade","observation_id":"2167e73c-9bbc-460a-a063-d955ed86fe0c","resolution":{"observed_at":"2026-08-03T02:31:01.408885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03147","last_updated":"2025-06-18T18:00:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-03T17:59:33Z","title":"UniWorld-V1: High-Resolution Semantic Encoders for Unified Visual Understanding and Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03147","snapshot_observed_at":"2026-08-03T02:31:01.484478Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.01207","last_updated":"2026-07-31T06:47:55Z","snapshot_observed_at":"2026-08-08T14:14:42.520398Z","submitted_at":"2026-04-01T17:51:00Z","title":"TRACE: High-Fidelity 3D Scene Editing via Tangible Reconstruction and Geometry-Aligned Contextual Video Masking","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-03T02:31:01.484478Z"},"links":{"cited_paper":"/paper/2506.03147","citing_paper":"/paper/2604.01207"},"observation_digest":"sha256:6c89dddc7d23c3f4f326428a418f87bf225252e88f1fdd2ec60e136303da4633","observation_id":"a181c1a4-1e89-4013-bfd3-7edee726ddc5","resolution":{"observed_at":"2026-08-03T02:31:01.484478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.10647","last_updated":"2025-11-13T18:59:53Z","snapshot_observed_at":"2026-07-06T22:35:46.018050Z","submitted_at":"2025-11-13T18:59:53Z","title":"Depth Anything 3: Recovering the Visual Space from Any Views","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.10647","snapshot_observed_at":"2026-08-03T02:31:01.553366Z","title":"arXiv preprint arXiv:2511.10647 (2025) 9","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.01207","last_updated":"2026-07-31T06:47:55Z","snapshot_observed_at":"2026-08-08T14:14:42.520398Z","submitted_at":"2026-04-01T17:51:00Z","title":"TRACE: High-Fidelity 3D Scene Editing via Tangible Reconstruction and Geometry-Aligned Contextual Video Masking","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-03T02:31:01.553366Z"},"links":{"cited_paper":"/paper/2511.10647","citing_paper":"/paper/2604.01207"},"observation_digest":"sha256:ff13b391a1db6ae35c4537f61f429b0bfdb1321283132413b5574882af6eb202","observation_id":"fe281a92-57e1-4e0c-ab10-ef1d55794059","resolution":{"observed_at":"2026-08-03T02:31:01.553366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.17761","last_updated":"2025-07-31T05:05:45Z","snapshot_observed_at":"2026-07-06T21:14:24.007428Z","submitted_at":"2025-04-24T17:25:12Z","title":"Step1X-Edit: A Practical Framework for General Image Editing","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.17761","snapshot_observed_at":"2026-08-03T02:31:01.626155Z","title":"arXiv preprint arXiv:2504.17761 (2025) 4","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.01207","last_updated":"2026-07-31T06:47:55Z","snapshot_observed_at":"2026-08-08T14:14:42.520398Z","submitted_at":"2026-04-01T17:51:00Z","title":"TRACE: High-Fidelity 3D Scene Editing via Tangible Reconstruction and Geometry-Aligned Contextual Video Masking","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-03T02:31:01.626155Z"},"links":{"cited_paper":"/paper/2504.17761","citing_paper":"/paper/2604.01207"},"observation_digest":"sha256:82df0d31e36181aa16895d9f3eac78e6532c420bf86814f7ec3bf335a07e0993","observation_id":"f248d3e0-78f1-418e-93da-468bcc5615aa","resolution":{"observed_at":"2026-08-03T02:31:01.626155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:31:01.708515Z","title":"In: ICASSP 2025 - 2025 IEEE In- ternational Conference on Acoustics, Speech and Signal Processing (ICASSP)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.01207","last_updated":"2026-07-31T06:47:55Z","snapshot_observed_at":"2026-08-08T14:14:42.520398Z","submitted_at":"2026-04-01T17:51:00Z","title":"TRACE: High-Fidelity 3D Scene Editing via Tangible Reconstruction and Geometry-Aligned Contextual Video Masking","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-03T02:31:01.708515Z"},"links":{"citing_paper":"/paper/2604.01207"},"observation_digest":"sha256:f468e06f02226259e7c68e4d5f80c0e4b6c0c07cb1b677fc42bfc6c0ceac10a8","observation_id":"cd829b05-bc77-49eb-bbce-f54492c557d7","resolution":{"observed_at":"2026-08-03T02:31:01.708515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:31:01.782401Z","title":"In: International Conference on Learning Representations (2022) 4","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2604.01207","last_updated":"2026-07-31T06:47:55Z","snapshot_observed_at":"2026-08-08T14:14:42.520398Z","submitted_at":"2026-04-01T17:51:00Z","title":"TRACE: High-Fidelity 3D Scene Editing via Tangible Reconstruction and Geometry-Aligned Contextual Video Masking","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-03T02:31:01.782401Z"},"links":{"citing_paper":"/paper/2604.01207"},"observation_digest":"sha256:dd3419ecfe6326535a88c9e85e23dfcaa7851d9b304e9389a9a8285af8368350","observation_id":"e32081fe-bab6-47ea-b431-5053fa0cad91","resolution":{"observed_at":"2026-08-03T02:31:01.782401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:31:01.857730Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.01207","last_updated":"2026-07-31T06:47:55Z","snapshot_observed_at":"2026-08-08T14:14:42.520398Z","submitted_at":"2026-04-01T17:51:00Z","title":"TRACE: High-Fidelity 3D Scene Editing via Tangible Reconstruction and Geometry-Aligned Contextual Video Masking","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-03T02:31:01.857730Z"},"links":{"citing_paper":"/paper/2604.01207"},"observation_digest":"sha256:bb962d9ccd0cbf66b365fc4c1fa798473b365b6b77fb03cba6e206e2b799c792","observation_id":"80413268-bfc1-4855-a06f-56ca130bbcf6","resolution":{"observed_at":"2026-08-03T02:31:01.857730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:31:01.932966Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2604.01207","last_updated":"2026-07-31T06:47:55Z","snapshot_observed_at":"2026-08-08T14:14:42.520398Z","submitted_at":"2026-04-01T17:51:00Z","title":"TRACE: High-Fidelity 3D Scene Editing via Tangible Reconstruction and Geometry-Aligned Contextual Video Masking","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-03T02:31:01.932966Z"},"links":{"citing_paper":"/paper/2604.01207"},"observation_digest":"sha256:943805cea79765008ad9d006b25e30df5c1f525125a8b15b6e3e560ddbd7f2ba","observation_id":"06c4e506-45a4-4d68-8051-6f3340b5c47f","resolution":{"observed_at":"2026-08-03T02:31:01.932966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-03T02:31:02.007136Z","title":"arXiv preprint arXiv:2511.00062 (2025) 4 TRACE 19","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.01207","last_updated":"2026-07-31T06:47:55Z","snapshot_observed_at":"2026-08-08T14:14:42.520398Z","submitted_at":"2026-04-01T17:51:00Z","title":"TRACE: High-Fidelity 3D Scene Editing via Tangible Reconstruction and Geometry-Aligned Contextual Video Masking","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-03T02:31:02.007136Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2604.01207"},"observation_digest":"sha256:e08f0bd31e6a32681a650a2b57d085c3e7eb4806bbe81f6646df04460bdc74cc","observation_id":"a553edc2-0934-4d58-81eb-de4ec5248f1e","resolution":{"observed_at":"2026-08-03T02:31:02.007136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:31:02.107136Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2604.01207","last_updated":"2026-07-31T06:47:55Z","snapshot_observed_at":"2026-08-08T14:14:42.520398Z","submitted_at":"2026-04-01T17:51:00Z","title":"TRACE: High-Fidelity 3D Scene Editing via Tangible Reconstruction and Geometry-Aligned Contextual Video Masking","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-03T02:31:02.107136Z"},"links":{"citing_paper":"/paper/2604.01207"},"observation_digest":"sha256:bba1580416265563df558e4d5044fbc57e0ee6060be91272b04fec025f4d4a73","observation_id":"bf06bc8b-28da-4ade-b801-720057e65c0a","resolution":{"observed_at":"2026-08-03T02:31:02.107136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:31:02.165622Z","title":"In: ACM SIGGRAPH 2023 Conference Proceedings","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2604.01207","last_updated":"2026-07-31T06:47:55Z","snapshot_observed_at":"2026-08-08T14:14:42.520398Z","submitted_at":"2026-04-01T17:51:00Z","title":"TRACE: High-Fidelity 3D Scene Editing via Tangible Reconstruction and Geometry-Aligned Contextual Video Masking","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-03T02:31:02.165622Z"},"links":{"citing_paper":"/paper/2604.01207"},"observation_digest":"sha256:6e5ee85d6d81bba238e851aa72ab2a349f383b6d8aba591caac38469aa14ddf6","observation_id":"405ee443-35a2-4f51-9e9c-ea273b70078c","resolution":{"observed_at":"2026-08-03T02:31:02.165622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09642","last_updated":"2026-03-02T11:31:23Z","snapshot_observed_at":"2026-08-02T11:33:41.662779Z","submitted_at":"2025-03-12T05:00:07Z","title":"Open-Sora 2.0: Training a Commercial-Level Video Generation Model in $200k","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09642","snapshot_observed_at":"2026-08-03T02:31:02.214524Z","title":"arXiv preprint arXiv:2503.09642 (2025).https://doi.org/10.48550/arXiv.2503.096424","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.01207","last_updated":"2026-07-31T06:47:55Z","snapshot_observed_at":"2026-08-08T14:14:42.520398Z","submitted_at":"2026-04-01T17:51:00Z","title":"TRACE: High-Fidelity 3D Scene Editing via Tangible Reconstruction and Geometry-Aligned Contextual Video Masking","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-03T02:31:02.214524Z"},"links":{"cited_paper":"/paper/2503.09642","citing_paper":"/paper/2604.01207"},"observation_digest":"sha256:e928edc78721394c5ae097bd677d433edb9e5e0e72231bc011f47c3a9f2482a0","observation_id":"0aa3c1e2-e35c-4899-9bbd-f2546e30f5bc","resolution":{"observed_at":"2026-08-03T02:31:02.214524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14988","last_updated":"2022-09-29T17:50:40Z","snapshot_observed_at":"2026-07-06T13:57:54.539656Z","submitted_at":"2022-09-29T17:50:40Z","title":"DreamFusion: Text-to-3D using 2D Diffusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14988","snapshot_observed_at":"2026-08-03T02:31:02.272314Z","title":"arXiv preprint arXiv:2209.14988 (2022) 2","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2604.01207","last_updated":"2026-07-31T06:47:55Z","snapshot_observed_at":"2026-08-08T14:14:42.520398Z","submitted_at":"2026-04-01T17:51:00Z","title":"TRACE: High-Fidelity 3D Scene Editing via Tangible Reconstruction and Geometry-Aligned Contextual Video Masking","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-03T02:31:02.272314Z"},"links":{"cited_paper":"/paper/2209.14988","citing_paper":"/paper/2604.01207"},"observation_digest":"sha256:edeeb1df99311febc40ccafc4c0e8e0efd9b6afc02234cb3485ee9a7e0d695fd","observation_id":"ab81f842-2e40-4546-8d0c-2e3589609d44","resolution":{"observed_at":"2026-08-03T02:31:02.272314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.09535","last_updated":"2023-10-11T17:46:21Z","snapshot_observed_at":"2026-07-06T15:04:23.117620Z","submitted_at":"2023-03-16T17:51:13Z","title":"FateZero: Fusing Attentions for Zero-shot Text-based Video Editing","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.09535","snapshot_observed_at":"2026-08-03T02:31:02.343422Z","title":"arXiv:2303.09535 (2023) 4","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2604.01207","last_updated":"2026-07-31T06:47:55Z","snapshot_observed_at":"2026-08-08T14:14:42.520398Z","submitted_at":"2026-04-01T17:51:00Z","title":"TRACE: High-Fidelity 3D Scene Editing via Tangible Reconstruction and Geometry-Aligned Contextual Video Masking","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-03T02:31:02.343422Z"},"links":{"cited_paper":"/paper/2303.09535","citing_paper":"/paper/2604.01207"},"observation_digest":"sha256:0a2ce39a318baa797b2370bfb52cb19d73a550a2d6edb1ea07153e2c9ff468eb","observation_id":"a6c6c9c6-1ff8-4b29-9b8c-82c3f6aa491a","resolution":{"observed_at":"2026-08-03T02:31:02.343422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:31:02.467063Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2604.01207","last_updated":"2026-07-31T06:47:55Z","snapshot_observed_at":"2026-08-08T14:14:42.520398Z","submitted_at":"2026-04-01T17:51:00Z","title":"TRACE: High-Fidelity 3D Scene Editing via Tangible Reconstruction and Geometry-Aligned Contextual Video Masking","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-03T02:31:02.467063Z"},"links":{"citing_paper":"/paper/2604.01207"},"observation_digest":"sha256:a1e35dc5a6653b54783214888dd324b5e2fd927ee8e2cac5b08c0e1bdc8e28cb","observation_id":"60b34615-c293-4f79-afae-c5d35495bb53","resolution":{"observed_at":"2026-08-03T02:31:02.467063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:31:02.581166Z","title":"In: International conference on machine learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2604.01207","last_updated":"2026-07-31T06:47:55Z","snapshot_observed_at":"2026-08-08T14:14:42.520398Z","submitted_at":"2026-04-01T17:51:00Z","title":"TRACE: High-Fidelity 3D Scene Editing via Tangible Reconstruction and Geometry-Aligned Contextual Video Masking","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-03T02:31:02.581166Z"},"links":{"citing_paper":"/paper/2604.01207"},"observation_digest":"sha256:2eae6a8383c2200d9bbcbd5300badd6b943635054438356d86ed6585126d0401","observation_id":"6fb056cb-6a27-4e23-a1b0-61c6517a6248","resolution":{"observed_at":"2026-08-03T02:31:02.581166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:31:02.741406Z","title":"In: The Thirteenth International Conference on Learning Representations (2025) 4","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.01207","last_updated":"2026-07-31T06:47:55Z","snapshot_observed_at":"2026-08-08T14:14:42.520398Z","submitted_at":"2026-04-01T17:51:00Z","title":"TRACE: High-Fidelity 3D Scene Editing via Tangible Reconstruction and Geometry-Aligned Contextual Video Masking","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-03T02:31:02.741406Z"},"links":{"citing_paper":"/paper/2604.01207"},"observation_digest":"sha256:353b9fdadfeae3aa74a9f5d3a746b65314fb39c7ea7ebfa5b66fd7ee6377c554","observation_id":"6dd812bf-eeb1-498d-acec-36202e9f4c01","resolution":{"observed_at":"2026-08-03T02:31:02.741406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:31:02.848314Z","title":"Blog Post (2023) 4","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2604.01207","last_updated":"2026-07-31T06:47:55Z","snapshot_observed_at":"2026-08-08T14:14:42.520398Z","submitted_at":"2026-04-01T17:51:00Z","title":"TRACE: High-Fidelity 3D Scene Editing via Tangible Reconstruction and Geometry-Aligned Contextual Video Masking","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-03T02:31:02.848314Z"},"links":{"citing_paper":"/paper/2604.01207"},"observation_digest":"sha256:1c0ff79b303e69faa6cad84001663d31c7a503cd03a55460c1f0baf088595c35","observation_id":"f6194dc0-6de3-4f8c-b377-07faf48b3c09","resolution":{"observed_at":"2026-08-03T02:31:02.848314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:31:02.959200Z","title":"Blog Post (2024) 4","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.01207","last_updated":"2026-07-31T06:47:55Z","snapshot_observed_at":"2026-08-08T14:14:42.520398Z","submitted_at":"2026-04-01T17:51:00Z","title":"TRACE: High-Fidelity 3D Scene Editing via Tangible Reconstruction and Geometry-Aligned Contextual Video Masking","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-03T02:31:02.959200Z"},"links":{"citing_paper":"/paper/2604.01207"},"observation_digest":"sha256:d51da200f046ce91391c2fdac2c5de9c86f13a074dfbffe977421fc9fea8845a","observation_id":"ce63d240-e2eb-4fb7-8beb-ad9370f95a4d","resolution":{"observed_at":"2026-08-03T02:31:02.959200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.16624","last_updated":"2025-11-20T18:31:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-20T18:31:46Z","title":"SAM 3D: 3Dfy Anything in Images","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.16624","snapshot_observed_at":"2026-08-03T02:31:03.068851Z","title":"arXiv preprint arXiv:2511.16624 (2025) 5","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.01207","last_updated":"2026-07-31T06:47:55Z","snapshot_observed_at":"2026-08-08T14:14:42.520398Z","submitted_at":"2026-04-01T17:51:00Z","title":"TRACE: High-Fidelity 3D Scene Editing via Tangible Reconstruction and Geometry-Aligned Contextual Video Masking","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-03T02:31:03.068851Z"},"links":{"cited_paper":"/paper/2511.16624","citing_paper":"/paper/2604.01207"},"observation_digest":"sha256:d42a6cebe8d5a9ade88f0473d7c58577919d8cf7c9f011b9107744bb7f14515d","observation_id":"05847f3a-67fc-41df-a91a-e23dad53b599","resolution":{"observed_at":"2026-08-03T02:31:03.068851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.08402","last_updated":"2022-10-16T00:08:18Z","snapshot_observed_at":"2026-07-29T21:51:47.064287Z","submitted_at":"2022-10-16T00:08:18Z","title":"LAION-5B: An open large-scale dataset for training next generation image-text models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.08402","snapshot_observed_at":"2026-08-03T02:31:03.143146Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2604.01207","last_updated":"2026-07-31T06:47:55Z","snapshot_observed_at":"2026-08-08T14:14:42.520398Z","submitted_at":"2026-04-01T17:51:00Z","title":"TRACE: High-Fidelity 3D Scene Editing via Tangible Reconstruction and Geometry-Aligned Contextual Video Masking","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-03T02:31:03.143146Z"},"links":{"cited_paper":"/paper/2210.08402","citing_paper":"/paper/2604.01207"},"observation_digest":"sha256:478613fb5dffad9871d780e6c64236debad3b33f78b1ca4ea955f916d1c5ad71","observation_id":"f4ee9eda-5667-41e5-b314-ccefd3b21734","resolution":{"observed_at":"2026-08-03T02:31:03.143146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:31:03.240801Z","title":"In: Proceedings of the IEEE/CVF international conference on computer vision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2604.01207","last_updated":"2026-07-31T06:47:55Z","snapshot_observed_at":"2026-08-08T14:14:42.520398Z","submitted_at":"2026-04-01T17:51:00Z","title":"TRACE: High-Fidelity 3D Scene Editing via Tangible Reconstruction and Geometry-Aligned Contextual Video Masking","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-03T02:31:03.240801Z"},"links":{"citing_paper":"/paper/2604.01207"},"observation_digest":"sha256:3cdfd879dc003ac9925ba54798037092cdc8391f6aa1fb232047da9348adb81b","observation_id":"05e0a4e0-55b7-492f-a368-33f07640ee52","resolution":{"observed_at":"2026-08-03T02:31:03.240801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:31:03.340313Z","title":"SIGGRAPH 2024 (2024) 4","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.01207","last_updated":"2026-07-31T06:47:55Z","snapshot_observed_at":"2026-08-08T14:14:42.520398Z","submitted_at":"2026-04-01T17:51:00Z","title":"TRACE: High-Fidelity 3D Scene Editing via Tangible Reconstruction and Geometry-Aligned Contextual Video Masking","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-03T02:31:03.340313Z"},"links":{"citing_paper":"/paper/2604.01207"},"observation_digest":"sha256:ff58a4f256497984e1305a7d18e16f9d79e5ddfe33d2f346474c0b097fa101bd","observation_id":"ee5da347-f828-4106-b818-47b187edc843","resolution":{"observed_at":"2026-08-03T02:31:03.340313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:31:03.440984Z","title":"In: Interna- tional Conference on Learning Representations (2021) 4","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2604.01207","last_updated":"2026-07-31T06:47:55Z","snapshot_observed_at":"2026-08-08T14:14:42.520398Z","submitted_at":"2026-04-01T17:51:00Z","title":"TRACE: High-Fidelity 3D Scene Editing via Tangible Reconstruction and Geometry-Aligned Contextual Video Masking","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-03T02:31:03.440984Z"},"links":{"citing_paper":"/paper/2604.01207"},"observation_digest":"sha256:d0af6284c39dc7c8c2c87ed17b869d66326cfbfe5a47c70b3043ff8c9a9782b8","observation_id":"fdefcd43-9bdf-4287-a865-24c4bccb50b3","resolution":{"observed_at":"2026-08-03T02:31:03.440984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:31:03.493467Z","title":"In: Proceedings of the AAAI Con- ference on Artificial Intelligence","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2604.01207","last_updated":"2026-07-31T06:47:55Z","snapshot_observed_at":"2026-08-08T14:14:42.520398Z","submitted_at":"2026-04-01T17:51:00Z","title":"TRACE: High-Fidelity 3D Scene Editing via Tangible Reconstruction and Geometry-Aligned Contextual Video Masking","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-03T02:31:03.493467Z"},"links":{"citing_paper":"/paper/2604.01207"},"observation_digest":"sha256:50d9ce62a51637d497bfb2e5671f7326b848c875318f5ae5dc522fbbfa1781c2","observation_id":"cabb2e0a-3036-4449-aee6-7039752029c5","resolution":{"observed_at":"2026-08-03T02:31:03.493467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:31:03.628395Z","title":"Computer Graph- ics Forum43(2024),https://api.semanticscholar.org/CorpusID:273824919 2, 5","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.01207","last_updated":"2026-07-31T06:47:55Z","snapshot_observed_at":"2026-08-08T14:14:42.520398Z","submitted_at":"2026-04-01T17:51:00Z","title":"TRACE: High-Fidelity 3D Scene Editing via Tangible Reconstruction and Geometry-Aligned Contextual Video Masking","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-03T02:31:03.628395Z"},"links":{"citing_paper":"/paper/2604.01207"},"observation_digest":"sha256:eb887609633907fca2f73cce07e6f08934d2ffa90d8562ce7dde1fa39973f248","observation_id":"c6f94a82-5e9b-4b82-8dcb-980fbab689a7","resolution":{"observed_at":"2026-08-03T02:31:03.628395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:31:03.747874Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.01207","last_updated":"2026-07-31T06:47:55Z","snapshot_observed_at":"2026-08-08T14:14:42.520398Z","submitted_at":"2026-04-01T17:51:00Z","title":"TRACE: High-Fidelity 3D Scene Editing via Tangible Reconstruction and Geometry-Aligned Contextual Video Masking","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-03T02:31:03.747874Z"},"links":{"citing_paper":"/paper/2604.01207"},"observation_digest":"sha256:09de82288ae5c8c39bbcba048a416beef02dea7a8c108db03eef1728ee7e38c6","observation_id":"4f70b42c-1e2a-4d1a-940a-838723d723a0","resolution":{"observed_at":"2026-08-03T02:31:03.747874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:31:03.845447Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.01207","last_updated":"2026-07-31T06:47:55Z","snapshot_observed_at":"2026-08-08T14:14:42.520398Z","submitted_at":"2026-04-01T17:51:00Z","title":"TRACE: High-Fidelity 3D Scene Editing via Tangible Reconstruction and Geometry-Aligned Contextual Video Masking","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-03T02:31:03.845447Z"},"links":{"citing_paper":"/paper/2604.01207"},"observation_digest":"sha256:830c993fa50d2179c06c99df50ca8b30bda31173bae4fd09480dcf0ebc69ecdd","observation_id":"8f69c914-d2bc-4efb-8dc3-48dd8d002a9e","resolution":{"observed_at":"2026-08-03T02:31:03.845447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-03T02:31:03.958242Z","title":"arXiv preprint arXiv:2503.20314 (2025) 4","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.01207","last_updated":"2026-07-31T06:47:55Z","snapshot_observed_at":"2026-08-08T14:14:42.520398Z","submitted_at":"2026-04-01T17:51:00Z","title":"TRACE: High-Fidelity 3D Scene Editing via Tangible Reconstruction and Geometry-Aligned Contextual Video Masking","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-03T02:31:03.958242Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2604.01207"},"observation_digest":"sha256:363ceec33cbedcfa1e2fc9cc4764306f5ab338cc82d2f2fdfbdd7572d172ce48","observation_id":"ec4d0697-b412-4295-8760-8deca62f5894","resolution":{"observed_at":"2026-08-03T02:31:03.958242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23044","last_updated":"2025-07-01T09:33:23Z","snapshot_observed_at":"2026-08-06T21:49:22.757971Z","submitted_at":"2025-06-29T00:40:17Z","title":"Ovis-U1 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.23044","snapshot_observed_at":"2026-08-03T02:31:04.075503Z","title":"arXiv preprint arXiv:2506.23044 (2025) 4","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.01207","last_updated":"2026-07-31T06:47:55Z","snapshot_observed_at":"2026-08-08T14:14:42.520398Z","submitted_at":"2026-04-01T17:51:00Z","title":"TRACE: High-Fidelity 3D Scene Editing via Tangible Reconstruction and Geometry-Aligned Contextual Video Masking","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-03T02:31:04.075503Z"},"links":{"cited_paper":"/paper/2506.23044","citing_paper":"/paper/2604.01207"},"observation_digest":"sha256:4e6832f1abffb0564226f7770d27243360fa01179d82c17bb6782a26b840773d","observation_id":"f735d185-2c74-49ba-98d9-a19ea1605fe2","resolution":{"observed_at":"2026-08-03T02:31:04.075503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:31:04.186145Z","title":"In: Proceedings of the IEEE/CVF Con- ference on Computer Vision and Pattern Recognition (CVPR) (2025) 9","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.01207","last_updated":"2026-07-31T06:47:55Z","snapshot_observed_at":"2026-08-08T14:14:42.520398Z","submitted_at":"2026-04-01T17:51:00Z","title":"TRACE: High-Fidelity 3D Scene Editing via Tangible Reconstruction and Geometry-Aligned Contextual Video Masking","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-03T02:31:04.186145Z"},"links":{"citing_paper":"/paper/2604.01207"},"observation_digest":"sha256:b7f8189690546a37aa23652d139b4b1a45a5d8e88d7614fd5733960f160133ae","observation_id":"be49c8b5-a324-4bd4-b319-d6a6e983cd5b","resolution":{"observed_at":"2026-08-03T02:31:04.186145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:31:04.324124Z","title":"In: International Conference on Machine Learning (ICML) (2025) 4","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.01207","last_updated":"2026-07-31T06:47:55Z","snapshot_observed_at":"2026-08-08T14:14:42.520398Z","submitted_at":"2026-04-01T17:51:00Z","title":"TRACE: High-Fidelity 3D Scene Editing via Tangible Reconstruction and Geometry-Aligned Contextual Video Masking","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-03T02:31:04.324124Z"},"links":{"citing_paper":"/paper/2604.01207"},"observation_digest":"sha256:0558054cae21d1bcf1f960a53afe8872b4f20fa59d8f445f93fd4f653edba464","observation_id":"875ea724-951a-4bb7-b687-c705f591584f","resolution":{"observed_at":"2026-08-03T02:31:04.324124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:31:04.457719Z","title":"In: European Conference on Computer Vision","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.01207","last_updated":"2026-07-31T06:47:55Z","snapshot_observed_at":"2026-08-08T14:14:42.520398Z","submitted_at":"2026-04-01T17:51:00Z","title":"TRACE: High-Fidelity 3D Scene Editing via Tangible Reconstruction and Geometry-Aligned Contextual Video Masking","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-03T02:31:04.457719Z"},"links":{"citing_paper":"/paper/2604.01207"},"observation_digest":"sha256:a12a910647aaa8e071e9d9f38e3a0188d023f4693df53f3c831be6ce5432879f","observation_id":"3196e087-c0d6-4fa1-a074-33202543c478","resolution":{"observed_at":"2026-08-03T02:31:04.457719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:31:04.591657Z","title":"arXiv preprint arXiv:2505.14537 (2025) 2, 5","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.01207","last_updated":"2026-07-31T06:47:55Z","snapshot_observed_at":"2026-08-08T14:14:42.520398Z","submitted_at":"2026-04-01T17:51:00Z","title":"TRACE: High-Fidelity 3D Scene Editing via Tangible Reconstruction and Geometry-Aligned Contextual Video Masking","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-03T02:31:04.591657Z"},"links":{"citing_paper":"/paper/2604.01207"},"observation_digest":"sha256:fed9740de5a659902197bb08275354ea3f0248704cd104fedc5f083584353393","observation_id":"02d4d95c-4a04-4970-b678-f4016717c509","resolution":{"observed_at":"2026-08-03T02:31:04.591657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.04961","last_updated":"2025-07-07T13:04:26Z","snapshot_observed_at":"2026-08-06T19:32:47.764188Z","submitted_at":"2025-07-07T13:04:26Z","title":"InterGSEdit: Interactive 3D Gaussian Splatting Editing with 3D Geometry-Consistent Attention Prior","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.04961","snapshot_observed_at":"2026-08-03T02:31:04.656153Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.01207","last_updated":"2026-07-31T06:47:55Z","snapshot_observed_at":"2026-08-08T14:14:42.520398Z","submitted_at":"2026-04-01T17:51:00Z","title":"TRACE: High-Fidelity 3D Scene Editing via Tangible Reconstruction and Geometry-Aligned Contextual Video Masking","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-03T02:31:04.656153Z"},"links":{"cited_paper":"/paper/2507.04961","citing_paper":"/paper/2604.01207"},"observation_digest":"sha256:be4a538a31f5f318dc7c9f5e1f324ec165f7f90c4922e36bff4e290beae64378","observation_id":"c157d516-a2ab-497d-a684-b7141b09e880","resolution":{"observed_at":"2026-08-03T02:31:04.656153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.02324","last_updated":"2025-08-04T11:49:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-04T11:49:20Z","title":"Qwen-Image Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.02324","snapshot_observed_at":"2026-08-03T02:31:04.906843Z","title":"arXiv preprint arXiv:2508.02324 (2025) 4","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.01207","last_updated":"2026-07-31T06:47:55Z","snapshot_observed_at":"2026-08-08T14:14:42.520398Z","submitted_at":"2026-04-01T17:51:00Z","title":"TRACE: High-Fidelity 3D Scene Editing via Tangible Reconstruction and Geometry-Aligned Contextual Video Masking","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-03T02:31:04.906843Z"},"links":{"cited_paper":"/paper/2508.02324","citing_paper":"/paper/2604.01207"},"observation_digest":"sha256:d7c9556cab831e66e02f3bc6e2d06dd9d1281e93cfb94380ad9d219925e4144d","observation_id":"615fc47f-57bc-409d-94c9-af64b158babd","resolution":{"observed_at":"2026-08-03T02:31:04.906843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.18871","snapshot_observed_at":"2026-08-03T02:31:04.995834Z","title":"arXiv preprint arXiv:2506.18871 (2025) 4","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.01207","last_updated":"2026-07-31T06:47:55Z","snapshot_observed_at":"2026-08-08T14:14:42.520398Z","submitted_at":"2026-04-01T17:51:00Z","title":"TRACE: High-Fidelity 3D Scene Editing via Tangible Reconstruction and Geometry-Aligned Contextual Video Masking","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-03T02:31:04.995834Z"},"links":{"cited_paper":"/paper/2506.18871","citing_paper":"/paper/2604.01207"},"observation_digest":"sha256:db266467e465ab4795ee5bec723be0d9c3aa0fa7fc603d87105a31a5418b2b25","observation_id":"1ba346ef-4557-4dbc-ac8e-74b445b4a9fd","resolution":{"observed_at":"2026-08-03T02:31:04.995834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:31:05.129759Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.01207","last_updated":"2026-07-31T06:47:55Z","snapshot_observed_at":"2026-08-08T14:14:42.520398Z","submitted_at":"2026-04-01T17:51:00Z","title":"TRACE: High-Fidelity 3D Scene Editing via Tangible Reconstruction and Geometry-Aligned Contextual Video Masking","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-03T02:31:05.129759Z"},"links":{"citing_paper":"/paper/2604.01207"},"observation_digest":"sha256:5a7303540eb3421a53e44708ec73ffc62f93e17d03cda6d962bb46120311efb3","observation_id":"36a2e1c8-6520-42e5-b698-d6861d9d96c0","resolution":{"observed_at":"2026-08-03T02:31:05.129759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:31:05.273818Z","title":"In: Proceedings of the IEEE/CVF International Conference on Computer Vision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2604.01207","last_updated":"2026-07-31T06:47:55Z","snapshot_observed_at":"2026-08-08T14:14:42.520398Z","submitted_at":"2026-04-01T17:51:00Z","title":"TRACE: High-Fidelity 3D Scene Editing via Tangible Reconstruction and Geometry-Aligned Contextual Video Masking","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-03T02:31:05.273818Z"},"links":{"citing_paper":"/paper/2604.01207"},"observation_digest":"sha256:af1bd49b1b64743514f4e8fc6450dbfcc4af763ba2f6cb095f99cba0fd056269","observation_id":"0acf3fcc-e03e-4367-a375-6f959a18227c","resolution":{"observed_at":"2026-08-03T02:31:05.273818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:31:05.405148Z","title":"ECCV (2024) 12 TRACE 21","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.01207","last_updated":"2026-07-31T06:47:55Z","snapshot_observed_at":"2026-08-08T14:14:42.520398Z","submitted_at":"2026-04-01T17:51:00Z","title":"TRACE: High-Fidelity 3D Scene Editing via Tangible Reconstruction and Geometry-Aligned Contextual Video Masking","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-03T02:31:05.405148Z"},"links":{"citing_paper":"/paper/2604.01207"},"observation_digest":"sha256:16bb6b578e7dd912e4d571f04d510c4f41b6fd42b7e74803f8441323dbf79c4a","observation_id":"acc12390-548c-4b11-9098-0ac7f6a476d0","resolution":{"observed_at":"2026-08-03T02:31:05.405148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:31:05.520091Z","title":"In: Proceedings of the Computer Vision and Pattern Recognition Conference","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.01207","last_updated":"2026-07-31T06:47:55Z","snapshot_observed_at":"2026-08-08T14:14:42.520398Z","submitted_at":"2026-04-01T17:51:00Z","title":"TRACE: High-Fidelity 3D Scene Editing via Tangible Reconstruction and Geometry-Aligned Contextual Video Masking","version":2},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-03T02:31:05.520091Z"},"links":{"citing_paper":"/paper/2604.01207"},"observation_digest":"sha256:b60285a96529090bd95908c9d9033baa2add5c4e557deaf7c10ee9fa5b5cc765","observation_id":"63cc5470-dcdc-4aca-ae34-810b8ca22544","resolution":{"observed_at":"2026-08-03T02:31:05.520091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:31:05.690739Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.01207","last_updated":"2026-07-31T06:47:55Z","snapshot_observed_at":"2026-08-08T14:14:42.520398Z","submitted_at":"2026-04-01T17:51:00Z","title":"TRACE: High-Fidelity 3D Scene Editing via Tangible Reconstruction and Geometry-Aligned Contextual Video Masking","version":2},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-03T02:31:05.690739Z"},"links":{"citing_paper":"/paper/2604.01207"},"observation_digest":"sha256:2c9b17e4facc238dffceebb7771f1c3954cf53642ab8dd1b36d11d226732bd58","observation_id":"bdfe63f7-8a7b-49f9-bb52-2bf557a36276","resolution":{"observed_at":"2026-08-03T02:31:05.690739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:31:05.810249Z","title":"arXiv preprint arXiv:2510.11000 (2025) 4","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.01207","last_updated":"2026-07-31T06:47:55Z","snapshot_observed_at":"2026-08-08T14:14:42.520398Z","submitted_at":"2026-04-01T17:51:00Z","title":"TRACE: High-Fidelity 3D Scene Editing via Tangible Reconstruction and Geometry-Aligned Contextual Video Masking","version":2},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-03T02:31:05.810249Z"},"links":{"citing_paper":"/paper/2604.01207"},"observation_digest":"sha256:4e42bf0edb236e3ee84ce6db87d4863649a56828611eee49392eedfac5ad8294","observation_id":"27ec2dc0-7b91-4ae6-8d44-e74f74465131","resolution":{"observed_at":"2026-08-03T02:31:05.810249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:31:05.889769Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.01207","last_updated":"2026-07-31T06:47:55Z","snapshot_observed_at":"2026-08-08T14:14:42.520398Z","submitted_at":"2026-04-01T17:51:00Z","title":"TRACE: High-Fidelity 3D Scene Editing via Tangible Reconstruction and Geometry-Aligned Contextual Video Masking","version":2},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-03T02:31:05.889769Z"},"links":{"citing_paper":"/paper/2604.01207"},"observation_digest":"sha256:b18f4a752d9424d73235622885a80a316e75f02fdc584eeb96a3a87ffec1c577","observation_id":"a6d65e39-ee68-44bc-9acf-33861243ce79","resolution":{"observed_at":"2026-08-03T02:31:05.889769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:31:05.957862Z","title":"arXiv preprint arXiv:2412.01583 (2024) 5","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.01207","last_updated":"2026-07-31T06:47:55Z","snapshot_observed_at":"2026-08-08T14:14:42.520398Z","submitted_at":"2026-04-01T17:51:00Z","title":"TRACE: High-Fidelity 3D Scene Editing via Tangible Reconstruction and Geometry-Aligned Contextual Video Masking","version":2},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-03T02:31:05.957862Z"},"links":{"citing_paper":"/paper/2604.01207"},"observation_digest":"sha256:176fe510adc8d222885a7fe163e68fd1dee30ead30d4edec948032bed9b7a384","observation_id":"8c9d802d-e7ca-44b5-86f7-afdeba4fdd0f","resolution":{"observed_at":"2026-08-03T02:31:05.957862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:31:06.061068Z","title":"In: The Thirteenth International Conference on Learning Representations (2025) 4","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.01207","last_updated":"2026-07-31T06:47:55Z","snapshot_observed_at":"2026-08-08T14:14:42.520398Z","submitted_at":"2026-04-01T17:51:00Z","title":"TRACE: High-Fidelity 3D Scene Editing via Tangible Reconstruction and Geometry-Aligned Contextual Video Masking","version":2},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-03T02:31:06.061068Z"},"links":{"citing_paper":"/paper/2604.01207"},"observation_digest":"sha256:07f4571473d82c993fb64a179d6f4a35fa47d068303e652c523c2fe4a411a70a","observation_id":"6cd06305-50be-4bf5-ba34-e478fa6e3e37","resolution":{"observed_at":"2026-08-03T02:31:06.061068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:31:06.181074Z","title":"In: International Conference on Machine Learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.01207","last_updated":"2026-07-31T06:47:55Z","snapshot_observed_at":"2026-08-08T14:14:42.520398Z","submitted_at":"2026-04-01T17:51:00Z","title":"TRACE: High-Fidelity 3D Scene Editing via Tangible Reconstruction and Geometry-Aligned Contextual Video Masking","version":2},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-08-03T02:31:06.181074Z"},"links":{"citing_paper":"/paper/2604.01207"},"observation_digest":"sha256:1480015310e4290236bc5e46d86656d95f7cbe2bc348456621d9bf52e27e0124","observation_id":"fa9aad02-010f-4abf-a455-6a26b6f94816","resolution":{"observed_at":"2026-08-03T02:31:06.181074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:31:06.246205Z","title":"In: Proceed- ings of the IEEE/CVF conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2604.01207","last_updated":"2026-07-31T06:47:55Z","snapshot_observed_at":"2026-08-08T14:14:42.520398Z","submitted_at":"2026-04-01T17:51:00Z","title":"TRACE: High-Fidelity 3D Scene Editing via Tangible Reconstruction and Geometry-Aligned Contextual Video Masking","version":2},"reference_index":102,"source":"pdf_text","source_observed_at":"2026-08-03T02:31:06.246205Z"},"links":{"citing_paper":"/paper/2604.01207"},"observation_digest":"sha256:7d694606c5eac14cf9dfbfb08aab14715cacf685e4cd523833227e9d1f7d3474","observation_id":"2436ea60-2b8d-4aff-bf47-cd7e874577af","resolution":{"observed_at":"2026-08-03T02:31:06.246205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2604.01207","last_updated":"2026-07-31T06:47:55Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T14:14:42.520398Z","submitted_at":"2026-04-01T17:51:00Z","title":"TRACE: High-Fidelity 3D Scene Editing via Tangible Reconstruction and Geometry-Aligned Contextual Video Masking"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":99,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":120},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 100 of 120 outbound references and 1 inbound Pith citation observation for arXiv:2604.01207."}