{"as_of":"2026-08-10T11:34:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5fde40e5bb1bae9bd0e7637072ccca700eba799a88d58c938c46f1a453c7205a","coverage":[{"denominator":50,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":50,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T14:53:38.496401Z","state":"measured"},{"denominator":52,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":52,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-01T00:17:39.409452Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-01T00:25:09.923270Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.17462","last_updated":"2025-07-23T12:41:11Z","snapshot_observed_at":"2026-08-07T17:22:22.826442Z","submitted_at":"2025-07-23T12:41:11Z","title":"ERMV: Editing 4D Robotic Multi-view images to enhance embodied agents","version":1},"cited_work":{"arxiv_id":"2507.17462","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.17462","snapshot_observed_at":"2026-07-01T00:25:09.923270Z","title":"arXiv preprint arXiv:2507.17462 (2025)","venue":null,"work_id":"68c46e37-61a8-4cbe-8f81-1375c47342f3","year":2025},"citing_paper":{"arxiv_id":"2605.01799","last_updated":"2026-06-06T07:05:08Z","snapshot_observed_at":"2026-08-03T01:13:04.956310Z","submitted_at":"2026-05-03T09:39:44Z","title":"Embody4D: A Generalist Data Engine for Embodied 4D World Modeling","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-08T19:16:50.004359Z"},"links":{"cited_paper":"/paper/2507.17462","citing_paper":"/paper/2605.01799"},"observation_digest":"sha256:0bb425e9bb7e517bf07fb44164e6bdc32407268152231179be77386d3ee3bcc9","observation_id":"6fb304ea-b10f-4f1d-8fde-8c04a951d874","resolution":{"observed_at":"2026-05-09T05:55:32.152811Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.17462","last_updated":"2025-07-23T12:41:11Z","snapshot_observed_at":"2026-08-07T17:22:22.826442Z","submitted_at":"2025-07-23T12:41:11Z","title":"ERMV: Editing 4D Robotic Multi-view images to enhance embodied agents","version":1},"cited_work":{"arxiv_id":"2507.17462","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.17462","snapshot_observed_at":"2026-07-01T00:25:09.923270Z","title":"arXiv preprint arXiv:2507.17462 (2025)","venue":null,"work_id":"68c46e37-61a8-4cbe-8f81-1375c47342f3","year":2025},"citing_paper":{"arxiv_id":"2605.01799","last_updated":"2026-06-06T07:05:08Z","snapshot_observed_at":"2026-08-03T01:13:04.956310Z","submitted_at":"2026-05-03T09:39:44Z","title":"Embody4D: A Generalist Data Engine for Embodied 4D World Modeling","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-01T00:17:39.409452Z"},"links":{"cited_paper":"/paper/2507.17462","citing_paper":"/paper/2605.01799"},"observation_digest":"sha256:2046442cb4bcf466a682cc4126f5e1d8a8851546068434a0c23bebd4f483da78","observation_id":"23da8182-92d7-4d43-a694-e877fb20b4a1","resolution":{"observed_at":"2026-07-01T00:25:09.924677Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.17462/citation-record","integrity":"/paper/2507.17462/integrity","json":"/paper/2507.17462/citation-record.json","paper":"/paper/2507.17462"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2212.05711","last_updated":"2023-02-16T16:23:31Z","snapshot_observed_at":"2026-07-06T14:29:20.607029Z","submitted_at":"2022-12-12T05:30:08Z","title":"CACTI: A Framework for Scalable Multi-Task Multi-Scene Visual Imitation Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.05711","snapshot_observed_at":"2026-08-06T14:53:31.294528Z","title":"Cacti: A framework for scalable multi-task multi-scene visual imitation learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.17462","last_updated":"2025-07-23T12:41:11Z","snapshot_observed_at":"2026-08-07T17:22:22.826442Z","submitted_at":"2025-07-23T12:41:11Z","title":"ERMV: Editing 4D Robotic Multi-view images to enhance embodied agents","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:31.294528Z"},"links":{"cited_paper":"/paper/2212.05711","citing_paper":"/paper/2507.17462"},"observation_digest":"sha256:674ebe1b4c29106b8532dc48fff9164b4a28f0de36568ef3642843447be0b427","observation_id":"9ca5a907-6541-4edd-be98-86e26c94919c","resolution":{"observed_at":"2026-08-06T14:53:31.294528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:53:46.611938Z","title":"Scaling Robot Learning with Semantically Imagined Experience,","venue":null,"work_id":"a7244b07-81fb-4729-ab24-20a31f8c96ee","year":2023},"citing_paper":{"arxiv_id":"2507.17462","last_updated":"2025-07-23T12:41:11Z","snapshot_observed_at":"2026-08-07T17:22:22.826442Z","submitted_at":"2025-07-23T12:41:11Z","title":"ERMV: Editing 4D Robotic Multi-view images to enhance embodied agents","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:31.361436Z"},"links":{"citing_paper":"/paper/2507.17462"},"observation_digest":"sha256:393893056bd6e5585e2c75b43767bc39d5e8fe6b5fb4135388569de2766a95cb","observation_id":"f0a1a531-f8d7-473f-a58b-97a808b6eff5","resolution":{"observed_at":"2026-08-06T14:53:46.735035Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07864","last_updated":"2025-03-01T08:57:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-10T12:33:46Z","title":"RDT-1B: a Diffusion Foundation Model for Bimanual Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07864","snapshot_observed_at":"2026-08-06T14:53:31.519794Z","title":"Rdt-1b: a diffusion foundation model for bimanual manipula- tion,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.17462","last_updated":"2025-07-23T12:41:11Z","snapshot_observed_at":"2026-08-07T17:22:22.826442Z","submitted_at":"2025-07-23T12:41:11Z","title":"ERMV: Editing 4D Robotic Multi-view images to enhance embodied agents","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:31.519794Z"},"links":{"cited_paper":"/paper/2410.07864","citing_paper":"/paper/2507.17462"},"observation_digest":"sha256:5e29435374612b8f171cb0be09237c7c79e7765efc1c6de196dd829d7e502106","observation_id":"8baeeaea-cb0f-4687-bc98-7a2727894b97","resolution":{"observed_at":"2026-08-06T14:53:31.519794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-06T14:53:31.611898Z","title":"Openvla: An open- source vision-language-action model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.17462","last_updated":"2025-07-23T12:41:11Z","snapshot_observed_at":"2026-08-07T17:22:22.826442Z","submitted_at":"2025-07-23T12:41:11Z","title":"ERMV: Editing 4D Robotic Multi-view images to enhance embodied agents","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:31.611898Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2507.17462"},"observation_digest":"sha256:f7c3428a0f7476fe04e578c48c01ea773ff38c61c0353f59cc3fcab450f98242","observation_id":"4be03cb1-ac15-4dd4-bb8c-6a463f158267","resolution":{"observed_at":"2026-08-06T14:53:31.611898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:53:46.379674Z","title":"MagicDrive: Street view generation with diverse 3d geometry control,","venue":null,"work_id":"1ad26e99-472f-4821-bbc8-7410896b382c","year":2024},"citing_paper":{"arxiv_id":"2507.17462","last_updated":"2025-07-23T12:41:11Z","snapshot_observed_at":"2026-08-07T17:22:22.826442Z","submitted_at":"2025-07-23T12:41:11Z","title":"ERMV: Editing 4D Robotic Multi-view images to enhance embodied agents","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:31.715847Z"},"links":{"citing_paper":"/paper/2507.17462"},"observation_digest":"sha256:0e612c41095a64e882aab207f810e2a3230b1be558077e022f00bd48c0e2f388","observation_id":"04a71937-6bfb-4ee6-a0e0-869bd17dd796","resolution":{"observed_at":"2026-08-06T14:53:46.492290Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01661","last_updated":"2023-09-23T06:59:18Z","snapshot_observed_at":"2026-08-06T17:02:57.215189Z","submitted_at":"2023-08-03T09:56:31Z","title":"BEVControl: Accurately Controlling Street-view Elements with Multi-perspective Consistency via BEV Sketch Layout","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01661","snapshot_observed_at":"2026-08-06T14:53:31.818402Z","title":"Bevcontrol: Accurately controlling street-view elements with multi-perspective con- sistency via bev sketch layout,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.17462","last_updated":"2025-07-23T12:41:11Z","snapshot_observed_at":"2026-08-07T17:22:22.826442Z","submitted_at":"2025-07-23T12:41:11Z","title":"ERMV: Editing 4D Robotic Multi-view images to enhance embodied agents","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:31.818402Z"},"links":{"cited_paper":"/paper/2308.01661","citing_paper":"/paper/2507.17462"},"observation_digest":"sha256:eed9657f813417b68f893bcc6c190ebb26abfaca54cf41068318ddbea4a7cde4","observation_id":"ad4d3104-934c-424c-a9f3-e97ebffce656","resolution":{"observed_at":"2026-08-06T14:53:31.818402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:53:46.092524Z","title":"Street-view image generation from a bird’s-eye view layout,","venue":null,"work_id":"aa66e2cf-8b58-4a5f-ab9e-869b3a62ce7b","year":2024},"citing_paper":{"arxiv_id":"2507.17462","last_updated":"2025-07-23T12:41:11Z","snapshot_observed_at":"2026-08-07T17:22:22.826442Z","submitted_at":"2025-07-23T12:41:11Z","title":"ERMV: Editing 4D Robotic Multi-view images to enhance embodied agents","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:31.939060Z"},"links":{"citing_paper":"/paper/2507.17462"},"observation_digest":"sha256:3dd27f744ef16af621d9cfadbd7635bd9b9e6c6cf6e17410a16724fd2fa102ba","observation_id":"35592f22-efe7-47ff-92fd-c461a4bc71ed","resolution":{"observed_at":"2026-08-06T14:53:46.224327Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:53:45.809877Z","title":"Dragvideo: Interactive drag-style video editing,","venue":null,"work_id":"a4ea7f11-a026-47c3-872f-51572196ad26","year":2024},"citing_paper":{"arxiv_id":"2507.17462","last_updated":"2025-07-23T12:41:11Z","snapshot_observed_at":"2026-08-07T17:22:22.826442Z","submitted_at":"2025-07-23T12:41:11Z","title":"ERMV: Editing 4D Robotic Multi-view images to enhance embodied agents","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:32.047960Z"},"links":{"citing_paper":"/paper/2507.17462"},"observation_digest":"sha256:8f467f08989f9e01c70b06cd691891505b32298c1660b228042d4e95d1591239","observation_id":"5ab518d0-e587-4160-9616-96361742f5ca","resolution":{"observed_at":"2026-08-06T14:53:45.962585Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:53:45.550376Z","title":"Video-p2p: Video editing with cross-attention control,","venue":null,"work_id":"3d721b79-1d97-4a49-9a1f-1e86222fef9a","year":2024},"citing_paper":{"arxiv_id":"2507.17462","last_updated":"2025-07-23T12:41:11Z","snapshot_observed_at":"2026-08-07T17:22:22.826442Z","submitted_at":"2025-07-23T12:41:11Z","title":"ERMV: Editing 4D Robotic Multi-view images to enhance embodied agents","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:32.210605Z"},"links":{"citing_paper":"/paper/2507.17462"},"observation_digest":"sha256:36e0bb5c9c509340a64b910d8a82a3cf6c6e384780b6068bc7ec126d7f659d08","observation_id":"26ed3f74-1906-4583-8acb-be8ce7bf7b73","resolution":{"observed_at":"2026-08-06T14:53:45.700618Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:53:45.272848Z","title":"Visual commonsense-aware representation network for video captioning,","venue":null,"work_id":"a362e9e2-12b0-4737-8e2f-0eedd8c1a43c","year":2023},"citing_paper":{"arxiv_id":"2507.17462","last_updated":"2025-07-23T12:41:11Z","snapshot_observed_at":"2026-08-07T17:22:22.826442Z","submitted_at":"2025-07-23T12:41:11Z","title":"ERMV: Editing 4D Robotic Multi-view images to enhance embodied agents","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:32.355751Z"},"links":{"citing_paper":"/paper/2507.17462"},"observation_digest":"sha256:4db71303c2d643fa1ea787eb67e94f14fea1fb2659f6e02411f5e897fafecf08","observation_id":"6c75b870-d27c-432c-bd5f-a7f2bfce9af3","resolution":{"observed_at":"2026-08-06T14:53:45.383791Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:53:44.954104Z","title":"Diffusion model-based image editing: A survey,","venue":null,"work_id":"60a5ab5c-d493-4da7-9f01-1eaeaa1231f1","year":2025},"citing_paper":{"arxiv_id":"2507.17462","last_updated":"2025-07-23T12:41:11Z","snapshot_observed_at":"2026-08-07T17:22:22.826442Z","submitted_at":"2025-07-23T12:41:11Z","title":"ERMV: Editing 4D Robotic Multi-view images to enhance embodied agents","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:32.484985Z"},"links":{"citing_paper":"/paper/2507.17462"},"observation_digest":"sha256:90774f26e8f8b9486c062be2a387d8680525af2714291531476e5a5dcb9485a8","observation_id":"a17b54cc-3fe0-44e2-bea7-a313f0067b13","resolution":{"observed_at":"2026-08-06T14:53:45.135486Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:53:44.659394Z","title":"Feditnet++: Few- shot editing of latent semantics in gan spaces with correlated attribute disentanglement,","venue":null,"work_id":"2716a28a-f268-437e-9345-bc59068ca5e4","year":2024},"citing_paper":{"arxiv_id":"2507.17462","last_updated":"2025-07-23T12:41:11Z","snapshot_observed_at":"2026-08-07T17:22:22.826442Z","submitted_at":"2025-07-23T12:41:11Z","title":"ERMV: Editing 4D Robotic Multi-view images to enhance embodied agents","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:32.605859Z"},"links":{"citing_paper":"/paper/2507.17462"},"observation_digest":"sha256:80a305823b80fd0144ce23990a73f8cf80369ab757f63d5d8715625a98244af6","observation_id":"858904f2-5e64-41b3-bb0c-63489df87bf6","resolution":{"observed_at":"2026-08-06T14:53:44.811434Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:53:32.743292Z","title":"Gaussctrl: Multi-view consistent text-driven 3d gaussian splatting edit- ing,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.17462","last_updated":"2025-07-23T12:41:11Z","snapshot_observed_at":"2026-08-07T17:22:22.826442Z","submitted_at":"2025-07-23T12:41:11Z","title":"ERMV: Editing 4D Robotic Multi-view images to enhance embodied agents","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:32.743292Z"},"links":{"citing_paper":"/paper/2507.17462"},"observation_digest":"sha256:49b94043d380ff8411aaae3927db035fb022da3332fcbb2be96c417a0eeba714","observation_id":"de2cc8c5-818d-4812-82d7-c105f1d3360d","resolution":{"observed_at":"2026-08-06T14:53:32.743292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:53:44.316196Z","title":"Efficient dynamic scene editing via 4d gaussian-based static-dynamic separation,","venue":null,"work_id":"378d67d1-947a-4119-8fb1-4223be0a9013","year":2025},"citing_paper":{"arxiv_id":"2507.17462","last_updated":"2025-07-23T12:41:11Z","snapshot_observed_at":"2026-08-07T17:22:22.826442Z","submitted_at":"2025-07-23T12:41:11Z","title":"ERMV: Editing 4D Robotic Multi-view images to enhance embodied agents","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:32.872349Z"},"links":{"citing_paper":"/paper/2507.17462"},"observation_digest":"sha256:110737f1b0435c3bf41fb78c9d732a3b10fcf6db50e809fbc0c2bff8f3790016","observation_id":"f33ea19d-8b14-464f-98c4-669954140c4f","resolution":{"observed_at":"2026-08-06T14:53:44.429108Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:53:44.011697Z","title":"Generating long videos of dynamic scenes,","venue":null,"work_id":"9e88e373-cd75-41dd-9d55-9ea97e9d6af8","year":2022},"citing_paper":{"arxiv_id":"2507.17462","last_updated":"2025-07-23T12:41:11Z","snapshot_observed_at":"2026-08-07T17:22:22.826442Z","submitted_at":"2025-07-23T12:41:11Z","title":"ERMV: Editing 4D Robotic Multi-view images to enhance embodied agents","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:33.031861Z"},"links":{"citing_paper":"/paper/2507.17462"},"observation_digest":"sha256:64877a3ca2376828de82b733879e859223712ca92135540f1cd1c01fe466bf5a","observation_id":"240dac32-42fa-4a83-95bf-d3b4d47eab96","resolution":{"observed_at":"2026-08-06T14:53:44.173267Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:53:43.733284Z","title":"Storydiffusion: Consistent self-attention for long-range image and video generation,","venue":null,"work_id":"7e68db56-e2c9-4b3e-83d1-2a04f11529ee","year":2024},"citing_paper":{"arxiv_id":"2507.17462","last_updated":"2025-07-23T12:41:11Z","snapshot_observed_at":"2026-08-07T17:22:22.826442Z","submitted_at":"2025-07-23T12:41:11Z","title":"ERMV: Editing 4D Robotic Multi-view images to enhance embodied agents","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:33.186072Z"},"links":{"citing_paper":"/paper/2507.17462"},"observation_digest":"sha256:a09c424086de4fbf0ad0820ec0c6313237e2e151b349de2af8efb0dd0fc4e4f0","observation_id":"b2344980-f9e9-4149-aac0-0f5ced496595","resolution":{"observed_at":"2026-08-06T14:53:43.868743Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:53:43.475230Z","title":"Evalcrafter: Benchmarking and evaluating large video generation models,","venue":null,"work_id":"70ac2a30-183d-499f-8f83-f3f013d4c9e1","year":2024},"citing_paper":{"arxiv_id":"2507.17462","last_updated":"2025-07-23T12:41:11Z","snapshot_observed_at":"2026-08-07T17:22:22.826442Z","submitted_at":"2025-07-23T12:41:11Z","title":"ERMV: Editing 4D Robotic Multi-view images to enhance embodied agents","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:33.288535Z"},"links":{"citing_paper":"/paper/2507.17462"},"observation_digest":"sha256:7439e06554a7087e7bd8cd884dfab2785b002124bd832a928933437411d87419","observation_id":"fef81db5-5e53-49eb-85f1-025222e676f7","resolution":{"observed_at":"2026-08-06T14:53:43.588423Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:53:43.251101Z","title":"Towards long video understanding via fine-detailed video story generation,","venue":null,"work_id":"5dd5208c-542e-4415-abfd-0af6f39d5f33","year":2024},"citing_paper":{"arxiv_id":"2507.17462","last_updated":"2025-07-23T12:41:11Z","snapshot_observed_at":"2026-08-07T17:22:22.826442Z","submitted_at":"2025-07-23T12:41:11Z","title":"ERMV: Editing 4D Robotic Multi-view images to enhance embodied agents","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:33.414870Z"},"links":{"citing_paper":"/paper/2507.17462"},"observation_digest":"sha256:9f14ec4140c1ff41d931fdf989e911886148074cf4228d2da3319c2d810821ac","observation_id":"d6105e95-80cd-4038-9ef7-ce23d0e3fe6c","resolution":{"observed_at":"2026-08-06T14:53:43.394123Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:53:42.927687Z","title":"Maskgwm: A generalizable driving world model with video mask reconstruction,","venue":null,"work_id":"52a79c11-6583-439c-b061-c512861b5968","year":2025},"citing_paper":{"arxiv_id":"2507.17462","last_updated":"2025-07-23T12:41:11Z","snapshot_observed_at":"2026-08-07T17:22:22.826442Z","submitted_at":"2025-07-23T12:41:11Z","title":"ERMV: Editing 4D Robotic Multi-view images to enhance embodied agents","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:33.564446Z"},"links":{"citing_paper":"/paper/2507.17462"},"observation_digest":"sha256:deb39eb8de47a40bb37835528f00158d05819ea49bfd71918e3d9d2a33adeb58","observation_id":"b30c98a2-6965-4090-9e4b-9012ea9e36a0","resolution":{"observed_at":"2026-08-06T14:53:43.094305Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.16407","last_updated":"2024-03-25T03:47:53Z","snapshot_observed_at":"2026-07-06T17:49:52.751335Z","submitted_at":"2024-03-25T03:47:53Z","title":"A Survey on Long Video Generation: Challenges, Methods, and Prospects","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.16407","snapshot_observed_at":"2026-08-06T14:53:33.702516Z","title":"A survey on long video generation: Challenges, methods, and prospects,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.17462","last_updated":"2025-07-23T12:41:11Z","snapshot_observed_at":"2026-08-07T17:22:22.826442Z","submitted_at":"2025-07-23T12:41:11Z","title":"ERMV: Editing 4D Robotic Multi-view images to enhance embodied agents","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:33.702516Z"},"links":{"cited_paper":"/paper/2403.16407","citing_paper":"/paper/2507.17462"},"observation_digest":"sha256:5d38eb9d03c154feb2a53efb50e183bcfd20ceb0ff8e1fefe30464d1d24904ae","observation_id":"537a1492-6b2a-408f-880c-16d2b2a1bf8c","resolution":{"observed_at":"2026-08-06T14:53:33.702516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:53:42.614342Z","title":"Dall-e-bot: Introducing web- scale diffusion models to robotics,","venue":null,"work_id":"153afaf2-d344-4d43-bfeb-fa95024df081","year":2023},"citing_paper":{"arxiv_id":"2507.17462","last_updated":"2025-07-23T12:41:11Z","snapshot_observed_at":"2026-08-07T17:22:22.826442Z","submitted_at":"2025-07-23T12:41:11Z","title":"ERMV: Editing 4D Robotic Multi-view images to enhance embodied agents","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:33.900587Z"},"links":{"citing_paper":"/paper/2507.17462"},"observation_digest":"sha256:0cf0fe9dd762d4153641f20679ae2df091add77aaa463e23645d7ad6ae69bf13","observation_id":"64896346-6477-4c74-a9cf-a30b6a39df53","resolution":{"observed_at":"2026-08-06T14:53:42.734812Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10639","last_updated":"2023-10-16T17:57:23Z","snapshot_observed_at":"2026-08-08T13:35:58.479807Z","submitted_at":"2023-10-16T17:57:23Z","title":"Zero-Shot Robotic Manipulation with Pretrained Image-Editing Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.10639","snapshot_observed_at":"2026-08-06T14:53:34.065833Z","title":"Zero-shot robotic manipulation with pretrained image- editing diffusion models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.17462","last_updated":"2025-07-23T12:41:11Z","snapshot_observed_at":"2026-08-07T17:22:22.826442Z","submitted_at":"2025-07-23T12:41:11Z","title":"ERMV: Editing 4D Robotic Multi-view images to enhance embodied agents","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:34.065833Z"},"links":{"cited_paper":"/paper/2310.10639","citing_paper":"/paper/2507.17462"},"observation_digest":"sha256:79e3be87567ac9e2e6e9f20fbdf8a325b7fcd4a7c25078c81cf4ccb78f67d88b","observation_id":"ec05318f-4a89-4cac-a4b0-b51e7bc9083a","resolution":{"observed_at":"2026-08-06T14:53:34.065833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.06671","last_updated":"2023-02-22T19:18:28Z","snapshot_observed_at":"2026-07-06T14:51:26.249912Z","submitted_at":"2023-02-13T20:18:25Z","title":"GenAug: Retargeting behaviors to unseen situations via Generative Augmentation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.06671","snapshot_observed_at":"2026-08-06T14:53:34.194140Z","title":"Genaug: Retargeting behaviors to unseen situations via generative augmentation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.17462","last_updated":"2025-07-23T12:41:11Z","snapshot_observed_at":"2026-08-07T17:22:22.826442Z","submitted_at":"2025-07-23T12:41:11Z","title":"ERMV: Editing 4D Robotic Multi-view images to enhance embodied agents","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:34.194140Z"},"links":{"cited_paper":"/paper/2302.06671","citing_paper":"/paper/2507.17462"},"observation_digest":"sha256:5a7ded996fd6c7c8359df289180cbf596c3134c364d50eee6468bf3e42a35dff","observation_id":"7fe0b49a-3265-49fe-a6aa-54abf355c307","resolution":{"observed_at":"2026-08-06T14:53:34.194140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:53:34.333520Z","title":"Semantically controllable augmentations for generalizable robot learning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.17462","last_updated":"2025-07-23T12:41:11Z","snapshot_observed_at":"2026-08-07T17:22:22.826442Z","submitted_at":"2025-07-23T12:41:11Z","title":"ERMV: Editing 4D Robotic Multi-view images to enhance embodied agents","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:34.333520Z"},"links":{"citing_paper":"/paper/2507.17462"},"observation_digest":"sha256:aa81bf010e01c9bb4738698ed912b89b27b7f7dc0ee7a4ecf611241f751dd3fa","observation_id":"e7569c55-ebc9-4a05-9667-47468ebe9be1","resolution":{"observed_at":"2026-08-06T14:53:34.333520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:53:42.364968Z","title":"Roboagent: Generalization and efficiency in robot manipu- lation via semantic augmentations and action chunking,","venue":null,"work_id":"716ffaff-479f-4b73-afdc-5d2d5874d15f","year":2024},"citing_paper":{"arxiv_id":"2507.17462","last_updated":"2025-07-23T12:41:11Z","snapshot_observed_at":"2026-08-07T17:22:22.826442Z","submitted_at":"2025-07-23T12:41:11Z","title":"ERMV: Editing 4D Robotic Multi-view images to enhance embodied agents","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:34.459950Z"},"links":{"citing_paper":"/paper/2507.17462"},"observation_digest":"sha256:ebc80365a07087e33546e3466089619c21b97c06b046bead69275a7145b9a4d8","observation_id":"3f9cb659-3d2d-4a89-9357-d4a00e51e36a","resolution":{"observed_at":"2026-08-06T14:53:42.481792Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:53:34.586243Z","title":"Segment anything,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.17462","last_updated":"2025-07-23T12:41:11Z","snapshot_observed_at":"2026-08-07T17:22:22.826442Z","submitted_at":"2025-07-23T12:41:11Z","title":"ERMV: Editing 4D Robotic Multi-view images to enhance embodied agents","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:34.586243Z"},"links":{"citing_paper":"/paper/2507.17462"},"observation_digest":"sha256:9a53116ffdf324d80a484f7d3cc7f25e2bda1eafae378b463972a5661077ada3","observation_id":"f48df0bf-9d3b-4967-bb78-03bd870c2454","resolution":{"observed_at":"2026-08-06T14:53:34.586243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09723","last_updated":"2025-05-14T18:30:53Z","snapshot_observed_at":"2026-08-07T15:45:19.772471Z","submitted_at":"2025-05-14T18:30:53Z","title":"EnerVerse-AC: Envisioning Embodied Environments with Action Condition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09723","snapshot_observed_at":"2026-08-06T14:53:34.708735Z","title":"Enerverse-ac: Envisioning embodied environments with action condition,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.17462","last_updated":"2025-07-23T12:41:11Z","snapshot_observed_at":"2026-08-07T17:22:22.826442Z","submitted_at":"2025-07-23T12:41:11Z","title":"ERMV: Editing 4D Robotic Multi-view images to enhance embodied agents","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:34.708735Z"},"links":{"cited_paper":"/paper/2505.09723","citing_paper":"/paper/2507.17462"},"observation_digest":"sha256:f0972df38803f8fc37c62dc4391cbbd1fd49c05612098843f6d2dad953bbd20f","observation_id":"e8b228d8-3a7f-428f-bc33-44f5c8b892d9","resolution":{"observed_at":"2026-08-06T14:53:34.708735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:53:42.132574Z","title":"Zero-1-to-3: Zero-shot one image to 3d object,","venue":null,"work_id":"033277bd-b5ed-4254-b7c2-dddb0d4ddace","year":2023},"citing_paper":{"arxiv_id":"2507.17462","last_updated":"2025-07-23T12:41:11Z","snapshot_observed_at":"2026-08-07T17:22:22.826442Z","submitted_at":"2025-07-23T12:41:11Z","title":"ERMV: Editing 4D Robotic Multi-view images to enhance embodied agents","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:34.849354Z"},"links":{"citing_paper":"/paper/2507.17462"},"observation_digest":"sha256:9d2d8fdd80eafb6a08426f3825da68731ac0bd49caabe12dd3414e72278e7bf1","observation_id":"27c73efe-2b8f-4912-8279-17ef1c9a34df","resolution":{"observed_at":"2026-08-06T14:53:42.247498Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07191","last_updated":"2024-04-14T16:54:24Z","snapshot_observed_at":"2026-07-06T17:58:25.894552Z","submitted_at":"2024-04-10T17:48:37Z","title":"InstantMesh: Efficient 3D Mesh Generation from a Single Image with Sparse-view Large Reconstruction Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07191","snapshot_observed_at":"2026-08-06T14:53:34.980027Z","title":"Instantmesh: Efficient 3d mesh generation from a single image with sparse-view large reconstruction models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.17462","last_updated":"2025-07-23T12:41:11Z","snapshot_observed_at":"2026-08-07T17:22:22.826442Z","submitted_at":"2025-07-23T12:41:11Z","title":"ERMV: Editing 4D Robotic Multi-view images to enhance embodied agents","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:34.980027Z"},"links":{"cited_paper":"/paper/2404.07191","citing_paper":"/paper/2507.17462"},"observation_digest":"sha256:8fe1b94fb9ae300b7b53b420ad93b333b8cf64a73cc0e684af4b5bdb43c6d3a9","observation_id":"0bce7733-0683-4bd4-b8a0-e45affa1d359","resolution":{"observed_at":"2026-08-06T14:53:34.980027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18974","last_updated":"2025-02-20T02:42:30Z","snapshot_observed_at":"2026-08-07T19:44:18.242217Z","submitted_at":"2024-10-24T17:59:30Z","title":"3D-Adapter: Geometry-Consistent Multi-View Diffusion for High-Quality 3D Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.18974","snapshot_observed_at":"2026-08-06T14:53:35.168365Z","title":"3d-adapter: Geometry-consistent multi-view diffusion for high-quality 3d generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.17462","last_updated":"2025-07-23T12:41:11Z","snapshot_observed_at":"2026-08-07T17:22:22.826442Z","submitted_at":"2025-07-23T12:41:11Z","title":"ERMV: Editing 4D Robotic Multi-view images to enhance embodied agents","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:35.168365Z"},"links":{"cited_paper":"/paper/2410.18974","citing_paper":"/paper/2507.17462"},"observation_digest":"sha256:615e708f2af866191f5c1720f252ff90c11162e4de45e84c7bf6876effa707cd","observation_id":"1c2321a9-0043-42e0-8703-03a03eeb6977","resolution":{"observed_at":"2026-08-06T14:53:35.168365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:53:41.853321Z","title":"Dge: Direct gaussian 3d editing by consistent multi-view editing,","venue":null,"work_id":"c78c858e-fa5b-4402-ae15-bbb3cc760dd5","year":2024},"citing_paper":{"arxiv_id":"2507.17462","last_updated":"2025-07-23T12:41:11Z","snapshot_observed_at":"2026-08-07T17:22:22.826442Z","submitted_at":"2025-07-23T12:41:11Z","title":"ERMV: Editing 4D Robotic Multi-view images to enhance embodied agents","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:35.339800Z"},"links":{"citing_paper":"/paper/2507.17462"},"observation_digest":"sha256:3b0c2ec85e50c066bfa56faa709e11eb5b19a21c003e1a73f32372b22f7abf81","observation_id":"2d9265b2-33db-4031-a976-f83f19887450","resolution":{"observed_at":"2026-08-06T14:53:42.001632Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:53:41.526109Z","title":"Imfine: 3d inpainting via geometry-guided multi-view refinement,","venue":null,"work_id":"2ec65f82-8235-46da-9251-eb4fa64ca944","year":2025},"citing_paper":{"arxiv_id":"2507.17462","last_updated":"2025-07-23T12:41:11Z","snapshot_observed_at":"2026-08-07T17:22:22.826442Z","submitted_at":"2025-07-23T12:41:11Z","title":"ERMV: Editing 4D Robotic Multi-view images to enhance embodied agents","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:35.479138Z"},"links":{"citing_paper":"/paper/2507.17462"},"observation_digest":"sha256:1179ec2926acc6324ed3a5a900f458359117bc0a4e596a684b7fb6712c2bb077","observation_id":"e8c810d4-e30d-4347-ae5c-2f106ca3aa20","resolution":{"observed_at":"2026-08-06T14:53:41.681720Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:53:35.647926Z","title":"High- resolution image synthesis with latent diffusion models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.17462","last_updated":"2025-07-23T12:41:11Z","snapshot_observed_at":"2026-08-07T17:22:22.826442Z","submitted_at":"2025-07-23T12:41:11Z","title":"ERMV: Editing 4D Robotic Multi-view images to enhance embodied agents","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:35.647926Z"},"links":{"citing_paper":"/paper/2507.17462"},"observation_digest":"sha256:a98438dd75a929f3b459e0a84e1847736bb445d3610de0b946759ad4fbbb0ecb","observation_id":"822d2eb3-7671-400a-b957-cd6d7ef32a5d","resolution":{"observed_at":"2026-08-06T14:53:35.647926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:53:41.243548Z","title":"Towards language-driven video inpainting via multimodal large language models,","venue":null,"work_id":"c8cef571-9296-4511-a4ba-12ea566fa120","year":2024},"citing_paper":{"arxiv_id":"2507.17462","last_updated":"2025-07-23T12:41:11Z","snapshot_observed_at":"2026-08-07T17:22:22.826442Z","submitted_at":"2025-07-23T12:41:11Z","title":"ERMV: Editing 4D Robotic Multi-view images to enhance embodied agents","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:35.820351Z"},"links":{"citing_paper":"/paper/2507.17462"},"observation_digest":"sha256:c021264632b8754a428945ddf1c0c642431143a5c28bb905e44517049056aa8f","observation_id":"efaa2062-6f9e-416b-8b88-5f1e572d0c7a","resolution":{"observed_at":"2026-08-06T14:53:41.373678Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:53:40.944631Z","title":"Brush2prompt: Contextual prompt generator for object inpainting,","venue":null,"work_id":"7a8405f6-84f7-4e79-b8c9-9435586b9c49","year":2024},"citing_paper":{"arxiv_id":"2507.17462","last_updated":"2025-07-23T12:41:11Z","snapshot_observed_at":"2026-08-07T17:22:22.826442Z","submitted_at":"2025-07-23T12:41:11Z","title":"ERMV: Editing 4D Robotic Multi-view images to enhance embodied agents","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:35.926503Z"},"links":{"citing_paper":"/paper/2507.17462"},"observation_digest":"sha256:b4af475edf2ccb992dab8345caa6926486e63c4d85f174a9ec9b039595050ba3","observation_id":"0d35a874-59eb-41ee-8366-83b33dab9d1c","resolution":{"observed_at":"2026-08-06T14:53:41.065267Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:53:40.691295Z","title":"Sketch- guided image inpainting with partial discrete diffusion process,","venue":null,"work_id":"8a5069a3-825a-4f56-bb49-29fd664170a7","year":2024},"citing_paper":{"arxiv_id":"2507.17462","last_updated":"2025-07-23T12:41:11Z","snapshot_observed_at":"2026-08-07T17:22:22.826442Z","submitted_at":"2025-07-23T12:41:11Z","title":"ERMV: Editing 4D Robotic Multi-view images to enhance embodied agents","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:36.052743Z"},"links":{"citing_paper":"/paper/2507.17462"},"observation_digest":"sha256:80eab0cb857a5748ecfdbd2cafe844d387f176602a929d15dc1e0e9a0edcfa4e","observation_id":"9e760139-0a9d-4a6d-9ac5-19d643a221d6","resolution":{"observed_at":"2026-08-06T14:53:40.819891Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:53:40.327524Z","title":"Few-shot image generation via style adaptation and content preservation,","venue":null,"work_id":"d96a82f9-abce-40ea-a373-2a068312cca5","year":2024},"citing_paper":{"arxiv_id":"2507.17462","last_updated":"2025-07-23T12:41:11Z","snapshot_observed_at":"2026-08-07T17:22:22.826442Z","submitted_at":"2025-07-23T12:41:11Z","title":"ERMV: Editing 4D Robotic Multi-view images to enhance embodied agents","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:36.256605Z"},"links":{"citing_paper":"/paper/2507.17462"},"observation_digest":"sha256:918a0ddacef0609dd2c47cee74e37b963b0a78d48273fcf986dbde028f0a2cc8","observation_id":"337a5171-982a-4350-842d-46761fed50a2","resolution":{"observed_at":"2026-08-06T14:53:40.501753Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:53:36.417013Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.17462","last_updated":"2025-07-23T12:41:11Z","snapshot_observed_at":"2026-08-07T17:22:22.826442Z","submitted_at":"2025-07-23T12:41:11Z","title":"ERMV: Editing 4D Robotic Multi-view images to enhance embodied agents","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:36.417013Z"},"links":{"citing_paper":"/paper/2507.17462"},"observation_digest":"sha256:24ce9b237f7e7a57b5fed12595220a6e299a8843226dfd90f3e67e175348264f","observation_id":"2b5dfbe2-4686-4566-ac14-412938512fcb","resolution":{"observed_at":"2026-08-06T14:53:36.417013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:53:36.559772Z","title":"Video diffusion models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.17462","last_updated":"2025-07-23T12:41:11Z","snapshot_observed_at":"2026-08-07T17:22:22.826442Z","submitted_at":"2025-07-23T12:41:11Z","title":"ERMV: Editing 4D Robotic Multi-view images to enhance embodied agents","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:36.559772Z"},"links":{"citing_paper":"/paper/2507.17462"},"observation_digest":"sha256:27d4767975af705035fc04977a7b29f2bb8ea83dd5ed21b343f2a64cf81d3c4b","observation_id":"c1f65cef-63aa-4d4d-b954-2bf34b686539","resolution":{"observed_at":"2026-08-06T14:53:36.559772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:53:36.744744Z","title":"Enerverse: Envisioning embodied future space for robotics manipulation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.17462","last_updated":"2025-07-23T12:41:11Z","snapshot_observed_at":"2026-08-07T17:22:22.826442Z","submitted_at":"2025-07-23T12:41:11Z","title":"ERMV: Editing 4D Robotic Multi-view images to enhance embodied agents","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:36.744744Z"},"links":{"citing_paper":"/paper/2507.17462"},"observation_digest":"sha256:a2391fbfc4356cca84e0f5ecf2237cfc1385e90139b093732bbdced3f56a009e","observation_id":"e59b2166-dec2-49ad-b81d-6e467a3a7ffb","resolution":{"observed_at":"2026-08-06T14:53:36.744744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:53:40.022575Z","title":"Epidiff: Enhancing multi-view synthesis via localized epipolar-constrained diffusion,","venue":null,"work_id":"32b7005a-3926-47cf-a27b-80b10af9ecf0","year":2024},"citing_paper":{"arxiv_id":"2507.17462","last_updated":"2025-07-23T12:41:11Z","snapshot_observed_at":"2026-08-07T17:22:22.826442Z","submitted_at":"2025-07-23T12:41:11Z","title":"ERMV: Editing 4D Robotic Multi-view images to enhance embodied agents","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:36.907756Z"},"links":{"citing_paper":"/paper/2507.17462"},"observation_digest":"sha256:65d484d9fa2d9989d53afacc0cca213e668559e50ec3ac6d53222b97b8ff64bf","observation_id":"02991ebf-d39f-4ce1-b936-b379fb0b1826","resolution":{"observed_at":"2026-08-06T14:53:40.178023Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:53:39.634591Z","title":"Ar-diffusion: Asynchronous video generation with auto-regressive diffusion,","venue":null,"work_id":"b60c3e9d-1580-483a-a767-468525993c6e","year":2025},"citing_paper":{"arxiv_id":"2507.17462","last_updated":"2025-07-23T12:41:11Z","snapshot_observed_at":"2026-08-07T17:22:22.826442Z","submitted_at":"2025-07-23T12:41:11Z","title":"ERMV: Editing 4D Robotic Multi-view images to enhance embodied agents","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:37.094974Z"},"links":{"citing_paper":"/paper/2507.17462"},"observation_digest":"sha256:c8a4bea2d73b5210463a8e167ee5a6531feff9e2f7dc21487614b615bba01315","observation_id":"4e7cb55a-f64f-4b26-b156-4c97ebcb9b65","resolution":{"observed_at":"2026-08-06T14:53:39.812003Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:53:39.381009Z","title":"Progressive autoregressive video diffusion models,","venue":null,"work_id":"a38eb4a6-5fac-4b58-8de1-7d96cdd86dc3","year":2025},"citing_paper":{"arxiv_id":"2507.17462","last_updated":"2025-07-23T12:41:11Z","snapshot_observed_at":"2026-08-07T17:22:22.826442Z","submitted_at":"2025-07-23T12:41:11Z","title":"ERMV: Editing 4D Robotic Multi-view images to enhance embodied agents","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:37.295899Z"},"links":{"citing_paper":"/paper/2507.17462"},"observation_digest":"sha256:1b788c22b25726e9f339194e2ba38cfed4d106315fe70560929a0055480feb56","observation_id":"475c8523-758a-435a-a4cc-b3631bffabf6","resolution":{"observed_at":"2026-08-06T14:53:39.489380Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:53:37.457637Z","title":"From slow bidirectional to fast autoregressive video diffusion models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.17462","last_updated":"2025-07-23T12:41:11Z","snapshot_observed_at":"2026-08-07T17:22:22.826442Z","submitted_at":"2025-07-23T12:41:11Z","title":"ERMV: Editing 4D Robotic Multi-view images to enhance embodied agents","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:37.457637Z"},"links":{"citing_paper":"/paper/2507.17462"},"observation_digest":"sha256:9babc67a9625020629d0520f4ad2c9521479a2d2dabc13d204373be1b341c3c7","observation_id":"8a3c1759-7c0a-4c46-8052-9405e6541aa0","resolution":{"observed_at":"2026-08-06T14:53:37.457637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-06T14:53:37.599945Z","title":"Qwen2. 5-vl technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.17462","last_updated":"2025-07-23T12:41:11Z","snapshot_observed_at":"2026-08-07T17:22:22.826442Z","submitted_at":"2025-07-23T12:41:11Z","title":"ERMV: Editing 4D Robotic Multi-view images to enhance embodied agents","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:37.599945Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2507.17462"},"observation_digest":"sha256:b17ec4a043ddbd8e7f76700a59d9546a83c12414f65660dd5b75e23dd4ddcc07","observation_id":"a207e586-b1bb-4667-bdb0-8ad1045082c9","resolution":{"observed_at":"2026-08-06T14:53:37.599945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.17761","last_updated":"2025-07-31T05:05:45Z","snapshot_observed_at":"2026-07-06T21:14:24.007428Z","submitted_at":"2025-04-24T17:25:12Z","title":"Step1X-Edit: A Practical Framework for General Image Editing","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.17761","snapshot_observed_at":"2026-08-06T14:53:37.812216Z","title":"Step1x-edit: A practical framework for general image editing,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.17462","last_updated":"2025-07-23T12:41:11Z","snapshot_observed_at":"2026-08-07T17:22:22.826442Z","submitted_at":"2025-07-23T12:41:11Z","title":"ERMV: Editing 4D Robotic Multi-view images to enhance embodied agents","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:37.812216Z"},"links":{"cited_paper":"/paper/2504.17761","citing_paper":"/paper/2507.17462"},"observation_digest":"sha256:606d6e343692ed8efc71c34543880eb8aeef20ea4740beed9a0714d89339301b","observation_id":"72315267-80ee-42a1-b6e5-0598d6458ecc","resolution":{"observed_at":"2026-08-06T14:53:37.812216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:53:39.104624Z","title":"Robotwin: Dual-arm robot benchmark with generative digital twins (early version),","venue":null,"work_id":"6c6f561a-7e2a-4361-a2a5-122142e542e4","year":2025},"citing_paper":{"arxiv_id":"2507.17462","last_updated":"2025-07-23T12:41:11Z","snapshot_observed_at":"2026-08-07T17:22:22.826442Z","submitted_at":"2025-07-23T12:41:11Z","title":"ERMV: Editing 4D Robotic Multi-view images to enhance embodied agents","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:37.961048Z"},"links":{"citing_paper":"/paper/2507.17462"},"observation_digest":"sha256:d3eaf52490ad13dafeaafc53b554c0157aa3b3b61444a788a16b79cc78e4c0f5","observation_id":"80f9a6bd-903f-46d4-82d4-275ddf05a4f6","resolution":{"observed_at":"2026-08-06T14:53:39.242888Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:53:38.099075Z","title":"Diffusion policy: Visuomotor policy learning via ac- tion diffusion,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.17462","last_updated":"2025-07-23T12:41:11Z","snapshot_observed_at":"2026-08-07T17:22:22.826442Z","submitted_at":"2025-07-23T12:41:11Z","title":"ERMV: Editing 4D Robotic Multi-view images to enhance embodied agents","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:38.099075Z"},"links":{"citing_paper":"/paper/2507.17462"},"observation_digest":"sha256:81014367030d5e55552f0d257b0ef7d10c7e8ae0b7c36f1a74e4b931fa9943de","observation_id":"4b404dc2-4398-4132-8db1-459fd9fb345d","resolution":{"observed_at":"2026-08-06T14:53:38.099075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:53:38.790540Z","title":"Schedule your edit: A simple yet effective diffu- sion noise schedule for image editing,","venue":null,"work_id":"bbf57581-efbd-4e14-a36b-9b04286b2744","year":2024},"citing_paper":{"arxiv_id":"2507.17462","last_updated":"2025-07-23T12:41:11Z","snapshot_observed_at":"2026-08-07T17:22:22.826442Z","submitted_at":"2025-07-23T12:41:11Z","title":"ERMV: Editing 4D Robotic Multi-view images to enhance embodied agents","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:38.294649Z"},"links":{"citing_paper":"/paper/2507.17462"},"observation_digest":"sha256:583ccb9e74ccb210f7b338452979edc4adf7658d83c02e8dd7f83dd254e165c9","observation_id":"cd782825-b3e2-4a52-a651-73a0e9b715f1","resolution":{"observed_at":"2026-08-06T14:53:38.933412Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.13705","last_updated":"2023-04-23T19:10:53Z","snapshot_observed_at":"2026-08-03T01:22:01.078078Z","submitted_at":"2023-04-23T19:10:53Z","title":"Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.13705","snapshot_observed_at":"2026-08-06T14:53:38.496401Z","title":"Learning fine- grained bimanual manipulation with low-cost hardware,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.17462","last_updated":"2025-07-23T12:41:11Z","snapshot_observed_at":"2026-08-07T17:22:22.826442Z","submitted_at":"2025-07-23T12:41:11Z","title":"ERMV: Editing 4D Robotic Multi-view images to enhance embodied agents","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T14:53:38.496401Z"},"links":{"cited_paper":"/paper/2304.13705","citing_paper":"/paper/2507.17462"},"observation_digest":"sha256:c905ae241f467eeef05f400b31fb7cfc61ec5ffbcf574f0e59f1ef387039695b","observation_id":"b0ffbd48-09d1-4a61-98ee-25730bfa6101","resolution":{"observed_at":"2026-08-06T14:53:38.496401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.17462","last_updated":"2025-07-23T12:41:11Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T17:22:22.826442Z","submitted_at":"2025-07-23T12:41:11Z","title":"ERMV: Editing 4D Robotic Multi-view images to enhance embodied agents"},"reference_resolution":{"displayed":50,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":22,"verified_exact":0,"verified_fuzzy":28},"total_outbound_references":50},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 50 of 50 outbound references and 2 inbound Pith citation observations for arXiv:2507.17462."}