{"as_of":"2026-08-18T21:35:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4b374a3a915f3c88ff9fe09ba77660a59ab0b2f524e4e78cdb8ea5b294acf81d","coverage":[{"denominator":43,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T21:20:29.491954Z","state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.00339/citation-record","integrity":"/paper/2507.00339/integrity","json":"/paper/2507.00339/citation-record.json","paper":"/paper/2507.00339"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:20:30.083541Z","title":"pix2gestalt: Amodal segmentation by synthesizing wholes, 2024","venue":null,"work_id":"47ac6d23-f5a3-4a0d-83b6-66f163e39a13","year":2024},"citing_paper":{"arxiv_id":"2507.00339","last_updated":"2025-07-01T00:36:56Z","snapshot_observed_at":"2026-08-06T21:15:56.293671Z","submitted_at":"2025-07-01T00:36:56Z","title":"Training for X-Ray Vision: Amodal Segmentation, Amodal Content Completion, and View-Invariant Object Representation from Multi-Camera Video","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T21:20:29.348774Z"},"links":{"citing_paper":"/paper/2507.00339"},"observation_digest":"sha256:8c876c68cb8fa4a71afccd93ce0c7b990c3ce84f51aef4e4217845ae4200896f","observation_id":"819ec2c1-fbd4-4282-a469-7038a0e0779e","resolution":{"observed_at":"2026-08-06T21:20:30.090312Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:20:30.066788Z","title":"Bot-sort: Robust associations multi-pedestrian tracking, 2022","venue":null,"work_id":"5b1b01f0-94af-41aa-a4c8-a84045fcc8e3","year":2022},"citing_paper":{"arxiv_id":"2507.00339","last_updated":"2025-07-01T00:36:56Z","snapshot_observed_at":"2026-08-06T21:15:56.293671Z","submitted_at":"2025-07-01T00:36:56Z","title":"Training for X-Ray Vision: Amodal Segmentation, Amodal Content Completion, and View-Invariant Object Representation from Multi-Camera Video","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T21:20:29.352673Z"},"links":{"citing_paper":"/paper/2507.00339"},"observation_digest":"sha256:f2a367677e538cdf57004befc7e944086fe484c7c84cdcf0ab0b3e808ac77806","observation_id":"8c2aa305-2bcc-421e-8869-f0551e80155a","resolution":{"observed_at":"2026-08-06T21:20:30.072720Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:20:30.049985Z","title":"Bytetrack: Multi-object tracking by associating every detection box, 2022","venue":null,"work_id":"4dff5e56-dd17-46ab-9584-529f32675fcf","year":2022},"citing_paper":{"arxiv_id":"2507.00339","last_updated":"2025-07-01T00:36:56Z","snapshot_observed_at":"2026-08-06T21:15:56.293671Z","submitted_at":"2025-07-01T00:36:56Z","title":"Training for X-Ray Vision: Amodal Segmentation, Amodal Content Completion, and View-Invariant Object Representation from Multi-Camera Video","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T21:20:29.356031Z"},"links":{"citing_paper":"/paper/2507.00339"},"observation_digest":"sha256:bcb1b654a221b3c1d85a895155e9da02b32a214f79991f31ed0f4d169c1ccf04","observation_id":"592f2094-4eff-4b4e-b573-d09cfd39dc64","resolution":{"observed_at":"2026-08-06T21:20:30.056150Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:20:30.033772Z","title":null,"venue":null,"work_id":"310a23aa-b2bb-45b4-97d4-e5ca32dc35f2","year":2022},"citing_paper":{"arxiv_id":"2507.00339","last_updated":"2025-07-01T00:36:56Z","snapshot_observed_at":"2026-08-06T21:15:56.293671Z","submitted_at":"2025-07-01T00:36:56Z","title":"Training for X-Ray Vision: Amodal Segmentation, Amodal Content Completion, and View-Invariant Object Representation from Multi-Camera Video","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T21:20:29.359398Z"},"links":{"citing_paper":"/paper/2507.00339"},"observation_digest":"sha256:35a7f89ed7ce3fb74048f067a43aeb7b1128d1ea80fc8486d88cc8b74c91ad78","observation_id":"c7b87e6a-5743-45fd-9436-81016b36c333","resolution":{"observed_at":"2026-08-06T21:20:30.039557Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:20:30.018018Z","title":"Putting the object back into video object segmentation, 2024","venue":null,"work_id":"6a2a3a83-eb93-46ca-886f-014fee921381","year":2024},"citing_paper":{"arxiv_id":"2507.00339","last_updated":"2025-07-01T00:36:56Z","snapshot_observed_at":"2026-08-06T21:15:56.293671Z","submitted_at":"2025-07-01T00:36:56Z","title":"Training for X-Ray Vision: Amodal Segmentation, Amodal Content Completion, and View-Invariant Object Representation from Multi-Camera Video","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T21:20:29.363166Z"},"links":{"citing_paper":"/paper/2507.00339"},"observation_digest":"sha256:ffa7307665cc3314a3079ed35815d9f2888931852413b572f04e6fb204c8e7ec","observation_id":"532f1e6a-d463-43c1-ae0c-5a759a2a0bea","resolution":{"observed_at":"2026-08-06T21:20:30.024364Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:20:29.999848Z","title":"Sam 2: Segment anything in images and videos, 2024","venue":null,"work_id":"e265a579-672b-45ff-bfc1-b96254e11a8e","year":2024},"citing_paper":{"arxiv_id":"2507.00339","last_updated":"2025-07-01T00:36:56Z","snapshot_observed_at":"2026-08-06T21:15:56.293671Z","submitted_at":"2025-07-01T00:36:56Z","title":"Training for X-Ray Vision: Amodal Segmentation, Amodal Content Completion, and View-Invariant Object Representation from Multi-Camera Video","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T21:20:29.366728Z"},"links":{"citing_paper":"/paper/2507.00339"},"observation_digest":"sha256:16c3b18b79616d237632894542851fc55b9fd29893c283824fefd4df947dbb6f","observation_id":"19b5741f-ffda-4bff-803e-e3694f31cbec","resolution":{"observed_at":"2026-08-06T21:20:30.006863Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:20:29.982249Z","title":"Transformer for object re-identification: A survey, 2024","venue":null,"work_id":"3bd8391d-1b60-4668-a3e0-910645bf6c55","year":2024},"citing_paper":{"arxiv_id":"2507.00339","last_updated":"2025-07-01T00:36:56Z","snapshot_observed_at":"2026-08-06T21:15:56.293671Z","submitted_at":"2025-07-01T00:36:56Z","title":"Training for X-Ray Vision: Amodal Segmentation, Amodal Content Completion, and View-Invariant Object Representation from Multi-Camera Video","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T21:20:29.370641Z"},"links":{"citing_paper":"/paper/2507.00339"},"observation_digest":"sha256:56d986723ebd0ce98e96ac4dddd8a6c46d0b5fbd98182b1fd6c86992e582ce1e","observation_id":"e1509505-da74-4e74-8b64-3a3f6762a955","resolution":{"observed_at":"2026-08-06T21:20:29.989284Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:20:29.963771Z","title":"Feature aggregation and con- nectivity for object re-identification","venue":null,"work_id":"25847ab3-da03-4aeb-900f-a130cdfcc094","year":2025},"citing_paper":{"arxiv_id":"2507.00339","last_updated":"2025-07-01T00:36:56Z","snapshot_observed_at":"2026-08-06T21:15:56.293671Z","submitted_at":"2025-07-01T00:36:56Z","title":"Training for X-Ray Vision: Amodal Segmentation, Amodal Content Completion, and View-Invariant Object Representation from Multi-Camera Video","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T21:20:29.373874Z"},"links":{"citing_paper":"/paper/2507.00339"},"observation_digest":"sha256:f2534e9ccfb7d72816b8404386bcc863c0c1ead41e4c3fa41f25476e72b59988","observation_id":"08d3de7d-2b09-454a-a668-619bfeaa5fee","resolution":{"observed_at":"2026-08-06T21:20:29.971467Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:20:29.945559Z","title":"Repaint: Inpainting using denoising diffusion probabilistic models, 2022","venue":null,"work_id":"1676283a-25d7-4493-bbf7-69551eb01d93","year":2022},"citing_paper":{"arxiv_id":"2507.00339","last_updated":"2025-07-01T00:36:56Z","snapshot_observed_at":"2026-08-06T21:15:56.293671Z","submitted_at":"2025-07-01T00:36:56Z","title":"Training for X-Ray Vision: Amodal Segmentation, Amodal Content Completion, and View-Invariant Object Representation from Multi-Camera Video","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T21:20:29.377138Z"},"links":{"citing_paper":"/paper/2507.00339"},"observation_digest":"sha256:eaf35a918ae9c96203569c5b09c35cc946b2c647d0d7f63772d00934dbd47316","observation_id":"5f9ca094-dc0a-4c42-b981-3f62408ca529","resolution":{"observed_at":"2026-08-06T21:20:29.953055Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:20:29.927818Z","title":"Sdxl: Improving latent diffusion models for high-resolution image synthesis, 2023","venue":null,"work_id":"c4edb001-30b0-435b-853f-2fe9dadc0e12","year":2023},"citing_paper":{"arxiv_id":"2507.00339","last_updated":"2025-07-01T00:36:56Z","snapshot_observed_at":"2026-08-06T21:15:56.293671Z","submitted_at":"2025-07-01T00:36:56Z","title":"Training for X-Ray Vision: Amodal Segmentation, Amodal Content Completion, and View-Invariant Object Representation from Multi-Camera Video","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T21:20:29.380332Z"},"links":{"citing_paper":"/paper/2507.00339"},"observation_digest":"sha256:278ac47505eac606c218ba53d9607ccc00b99db84f1574e9a5fd3ac58c894dfe","observation_id":"97ef334d-9a93-41d0-b6bd-b50206a5fde8","resolution":{"observed_at":"2026-08-06T21:20:29.933948Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:20:29.910261Z","title":"Seeing objects in a cluttered world: Computational objectness from motion in video, 2024","venue":null,"work_id":"6f100331-ef42-4779-83a3-37b143d98d7d","year":2024},"citing_paper":{"arxiv_id":"2507.00339","last_updated":"2025-07-01T00:36:56Z","snapshot_observed_at":"2026-08-06T21:15:56.293671Z","submitted_at":"2025-07-01T00:36:56Z","title":"Training for X-Ray Vision: Amodal Segmentation, Amodal Content Completion, and View-Invariant Object Representation from Multi-Camera Video","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T21:20:29.383605Z"},"links":{"citing_paper":"/paper/2507.00339"},"observation_digest":"sha256:311615b839d90dadab082940b700df8397a3bf97de8ae55e43bc323bb83c3da8","observation_id":"c4e3b540-6050-401e-8136-9f6d739ff70e","resolution":{"observed_at":"2026-08-06T21:20:29.917185Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:20:29.895022Z","title":"Learning 6-dof object poses to grasp category-level objects by language instructions, 2022","venue":null,"work_id":"5dbc6e8d-ded5-4320-b52b-ab00575f1371","year":2022},"citing_paper":{"arxiv_id":"2507.00339","last_updated":"2025-07-01T00:36:56Z","snapshot_observed_at":"2026-08-06T21:15:56.293671Z","submitted_at":"2025-07-01T00:36:56Z","title":"Training for X-Ray Vision: Amodal Segmentation, Amodal Content Completion, and View-Invariant Object Representation from Multi-Camera Video","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T21:20:29.386717Z"},"links":{"citing_paper":"/paper/2507.00339"},"observation_digest":"sha256:42ab0f65d33d33a1d26409a7721237b0c14efc2c36f88ece103136d8b6c8ce80","observation_id":"73aa0060-603b-4e78-8885-ff622ff0b4a6","resolution":{"observed_at":"2026-08-06T21:20:29.900816Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:20:29.877161Z","title":"Are we ready for autonomous driving? the kitti vision benchmark suite","venue":null,"work_id":"4ad310c6-3b16-4dcd-bbdf-d8139f1591c1","year":2012},"citing_paper":{"arxiv_id":"2507.00339","last_updated":"2025-07-01T00:36:56Z","snapshot_observed_at":"2026-08-06T21:15:56.293671Z","submitted_at":"2025-07-01T00:36:56Z","title":"Training for X-Ray Vision: Amodal Segmentation, Amodal Content Completion, and View-Invariant Object Representation from Multi-Camera Video","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T21:20:29.390472Z"},"links":{"citing_paper":"/paper/2507.00339"},"observation_digest":"sha256:710f03918c9551a8f7b192c08f8ca3faab1cd7e5c026685d8bf6ab03d1a3d14e","observation_id":"278b6ccc-00cb-4087-92cb-a691cc52b6d0","resolution":{"observed_at":"2026-08-06T21:20:29.883881Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:20:29.863335Z","title":"Impdet: Exploring implicit fields for 3d object detection, 2022","venue":null,"work_id":"57d71f15-aa8e-4a74-8641-c3da4efc9b47","year":2022},"citing_paper":{"arxiv_id":"2507.00339","last_updated":"2025-07-01T00:36:56Z","snapshot_observed_at":"2026-08-06T21:15:56.293671Z","submitted_at":"2025-07-01T00:36:56Z","title":"Training for X-Ray Vision: Amodal Segmentation, Amodal Content Completion, and View-Invariant Object Representation from Multi-Camera Video","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T21:20:29.393568Z"},"links":{"citing_paper":"/paper/2507.00339"},"observation_digest":"sha256:262a347b340ad9811403dc0666dd71ab647d8f1a93155110206db50494df280e","observation_id":"f99b2e6e-9221-4617-bf9e-a694e19d45ee","resolution":{"observed_at":"2026-08-06T21:20:29.867963Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:20:29.850313Z","title":"Rethinking amodal video segmentation from learning supervised signals with object-centric representa- tion, 2023","venue":null,"work_id":"460b9973-ef97-4c5f-8a9f-9685109b6aba","year":2023},"citing_paper":{"arxiv_id":"2507.00339","last_updated":"2025-07-01T00:36:56Z","snapshot_observed_at":"2026-08-06T21:15:56.293671Z","submitted_at":"2025-07-01T00:36:56Z","title":"Training for X-Ray Vision: Amodal Segmentation, Amodal Content Completion, and View-Invariant Object Representation from Multi-Camera Video","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T21:20:29.396601Z"},"links":{"citing_paper":"/paper/2507.00339"},"observation_digest":"sha256:c967997c8b6df1e76559ff6d68cbb29f077b68ec83bb3070141a9cdc1e5dfd68","observation_id":"e1a40c96-28c3-4b3d-85df-fe8dc2fe0cc3","resolution":{"observed_at":"2026-08-06T21:20:29.854334Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:20:29.838629Z","title":"Amodal panoptic segmentation, 2022","venue":null,"work_id":"8f61f3f4-f8c1-426c-bdd7-29f210679ea0","year":2022},"citing_paper":{"arxiv_id":"2507.00339","last_updated":"2025-07-01T00:36:56Z","snapshot_observed_at":"2026-08-06T21:15:56.293671Z","submitted_at":"2025-07-01T00:36:56Z","title":"Training for X-Ray Vision: Amodal Segmentation, Amodal Content Completion, and View-Invariant Object Representation from Multi-Camera Video","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T21:20:29.399868Z"},"links":{"citing_paper":"/paper/2507.00339"},"observation_digest":"sha256:7bce33e4b59822a32d738c879c719a4b051eab02613eb9c7ca684ff4c57b9a1d","observation_id":"47eb4572-7eac-43b9-86a2-fc6cdddf84fc","resolution":{"observed_at":"2026-08-06T21:20:29.842357Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:20:29.826529Z","title":"Aisformer: Amodal instance segmentation with transformer, 2024","venue":null,"work_id":"898c0965-bff2-4df2-b0bd-d06ac10e87c4","year":2024},"citing_paper":{"arxiv_id":"2507.00339","last_updated":"2025-07-01T00:36:56Z","snapshot_observed_at":"2026-08-06T21:15:56.293671Z","submitted_at":"2025-07-01T00:36:56Z","title":"Training for X-Ray Vision: Amodal Segmentation, Amodal Content Completion, and View-Invariant Object Representation from Multi-Camera Video","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T21:20:29.402916Z"},"links":{"citing_paper":"/paper/2507.00339"},"observation_digest":"sha256:3bb8e11c809be1402ed2492f785f946bcf9bd6baa8c9da4b8dd0b3b63aad7ea2","observation_id":"97409735-6b73-4a44-a0e1-dabe75bcd72a","resolution":{"observed_at":"2026-08-06T21:20:29.830942Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:20:29.814517Z","title":"Amodal segmentation based on visible region segmentation and shape prior, 2020","venue":null,"work_id":"f7023b95-788a-470b-a714-4597f6d3fb63","year":2020},"citing_paper":{"arxiv_id":"2507.00339","last_updated":"2025-07-01T00:36:56Z","snapshot_observed_at":"2026-08-06T21:15:56.293671Z","submitted_at":"2025-07-01T00:36:56Z","title":"Training for X-Ray Vision: Amodal Segmentation, Amodal Content Completion, and View-Invariant Object Representation from Multi-Camera Video","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T21:20:29.406447Z"},"links":{"citing_paper":"/paper/2507.00339"},"observation_digest":"sha256:033f94f70742dfe9f25df8d05222cbdcb142dfe08a4de40a5563ffe2ff1a7279","observation_id":"9a55621b-7deb-4154-ac96-d690b50ff049","resolution":{"observed_at":"2026-08-06T21:20:29.818156Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:20:29.802668Z","title":"Deep occlusion-aware instance segmentation with overlap- ping bilayers, 2021","venue":null,"work_id":"6988ce49-a06b-451f-81b4-b8894e60b128","year":2021},"citing_paper":{"arxiv_id":"2507.00339","last_updated":"2025-07-01T00:36:56Z","snapshot_observed_at":"2026-08-06T21:15:56.293671Z","submitted_at":"2025-07-01T00:36:56Z","title":"Training for X-Ray Vision: Amodal Segmentation, Amodal Content Completion, and View-Invariant Object Representation from Multi-Camera Video","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T21:20:29.409900Z"},"links":{"citing_paper":"/paper/2507.00339"},"observation_digest":"sha256:84533f87eaa704c5caa2dfa6ab44da7d0944d3ccf85e6116a095ca3bf9de875e","observation_id":"511b49ae-f443-4713-aaa2-e3ac0a441b22","resolution":{"observed_at":"2026-08-06T21:20:29.806555Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:20:29.790761Z","title":"Using diffusion priors for video amodal segmen- tation, 2024","venue":null,"work_id":"b1bda2ee-924a-44bb-8e89-119e1075c1c7","year":2024},"citing_paper":{"arxiv_id":"2507.00339","last_updated":"2025-07-01T00:36:56Z","snapshot_observed_at":"2026-08-06T21:15:56.293671Z","submitted_at":"2025-07-01T00:36:56Z","title":"Training for X-Ray Vision: Amodal Segmentation, Amodal Content Completion, and View-Invariant Object Representation from Multi-Camera Video","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T21:20:29.413499Z"},"links":{"citing_paper":"/paper/2507.00339"},"observation_digest":"sha256:9ece4cac62b9c9402efebaaaa90ff22affe407fa93932c086a3c60831bc0f94d","observation_id":"7e876359-37f4-4137-9017-5655e87d082c","resolution":{"observed_at":"2026-08-06T21:20:29.795111Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12049","last_updated":"2025-08-04T14:59:28Z","snapshot_observed_at":"2026-08-16T12:49:48.364687Z","submitted_at":"2025-03-15T08:47:45Z","title":"TACO: Taming Diffusion for in-the-wild Video Amodal Completion","version":2},"cited_work":{"arxiv_id":"2503.12049","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.12049","snapshot_observed_at":"2026-08-06T21:20:29.523589Z","title":"TACO: Taming Diffusion for in-the-wild Video Amodal Completion","venue":"cs.CV","work_id":"1af0d46c-ed6d-48af-8305-9ebe35a537cc","year":2025},"citing_paper":{"arxiv_id":"2507.00339","last_updated":"2025-07-01T00:36:56Z","snapshot_observed_at":"2026-08-06T21:15:56.293671Z","submitted_at":"2025-07-01T00:36:56Z","title":"Training for X-Ray Vision: Amodal Segmentation, Amodal Content Completion, and View-Invariant Object Representation from Multi-Camera Video","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T21:20:29.417219Z"},"links":{"cited_paper":"/paper/2503.12049","citing_paper":"/paper/2507.00339"},"observation_digest":"sha256:81a95a797da7678bc495fc6f8e7715267663bf810c825e7497fa4596961f9c61","observation_id":"691d872a-7133-4e1f-80cc-103f83fb3d4e","resolution":{"observed_at":"2026-08-06T21:20:29.529577Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:20:29.778113Z","title":"Learning to see the invisible: End-to-end trainable amodal instance segmentation, 2018","venue":null,"work_id":"f8546d85-1d1b-447d-b569-a122580606cc","year":2018},"citing_paper":{"arxiv_id":"2507.00339","last_updated":"2025-07-01T00:36:56Z","snapshot_observed_at":"2026-08-06T21:15:56.293671Z","submitted_at":"2025-07-01T00:36:56Z","title":"Training for X-Ray Vision: Amodal Segmentation, Amodal Content Completion, and View-Invariant Object Representation from Multi-Camera Video","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T21:20:29.420843Z"},"links":{"citing_paper":"/paper/2507.00339"},"observation_digest":"sha256:8e105b00981556035776bdc0a71db0e21f92d6f04e233a9fa1240f39cd184520","observation_id":"f247ae06-97e1-4153-9b46-f09825a6d974","resolution":{"observed_at":"2026-08-06T21:20:29.782482Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:20:29.766508Z","title":"Amodal instance segmentation with diffusion shape prior estimation, 2024","venue":null,"work_id":"5439b50d-36a6-4b39-8de9-f7d535307635","year":2024},"citing_paper":{"arxiv_id":"2507.00339","last_updated":"2025-07-01T00:36:56Z","snapshot_observed_at":"2026-08-06T21:15:56.293671Z","submitted_at":"2025-07-01T00:36:56Z","title":"Training for X-Ray Vision: Amodal Segmentation, Amodal Content Completion, and View-Invariant Object Representation from Multi-Camera Video","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T21:20:29.424116Z"},"links":{"citing_paper":"/paper/2507.00339"},"observation_digest":"sha256:3915e4894ab031152e17e45be8cda6e228dd2e31d04893be26cca73408db0478","observation_id":"db0b07dc-f981-4645-be60-98ad7bb7205d","resolution":{"observed_at":"2026-08-06T21:20:29.770240Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:20:29.754363Z","title":"Amodal instance segmentation, 2016","venue":null,"work_id":"30831165-febb-46c4-968f-3c57a17f0af2","year":2016},"citing_paper":{"arxiv_id":"2507.00339","last_updated":"2025-07-01T00:36:56Z","snapshot_observed_at":"2026-08-06T21:15:56.293671Z","submitted_at":"2025-07-01T00:36:56Z","title":"Training for X-Ray Vision: Amodal Segmentation, Amodal Content Completion, and View-Invariant Object Representation from Multi-Camera Video","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T21:20:29.427237Z"},"links":{"citing_paper":"/paper/2507.00339"},"observation_digest":"sha256:219309f902b8f8c3da714fec9e01f6d58cdaaf994e0c58f0edc325b7d1dd9622","observation_id":"28924686-6636-43ec-9c72-a5de4b437f65","resolution":{"observed_at":"2026-08-06T21:20:29.758172Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:20:29.743230Z","title":"Self-supervised scene de-occlusion, 2020","venue":null,"work_id":"f2d73e60-f227-45f7-9a94-fbed05ea610c","year":2020},"citing_paper":{"arxiv_id":"2507.00339","last_updated":"2025-07-01T00:36:56Z","snapshot_observed_at":"2026-08-06T21:15:56.293671Z","submitted_at":"2025-07-01T00:36:56Z","title":"Training for X-Ray Vision: Amodal Segmentation, Amodal Content Completion, and View-Invariant Object Representation from Multi-Camera Video","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T21:20:29.430756Z"},"links":{"citing_paper":"/paper/2507.00339"},"observation_digest":"sha256:aa3fb54cd4a8204ea54f78edcbd799d693c02f0d682eabe0e5654eabdcae7804","observation_id":"cb591e8c-bed7-4f7c-abf5-c1d7cd043ff1","resolution":{"observed_at":"2026-08-06T21:20:29.746783Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:20:29.731824Z","title":"Amodal instance segmentation with kins dataset","venue":null,"work_id":"33e4123d-ecfc-4bbb-b3f9-9e306c5377e4","year":2019},"citing_paper":{"arxiv_id":"2507.00339","last_updated":"2025-07-01T00:36:56Z","snapshot_observed_at":"2026-08-06T21:15:56.293671Z","submitted_at":"2025-07-01T00:36:56Z","title":"Training for X-Ray Vision: Amodal Segmentation, Amodal Content Completion, and View-Invariant Object Representation from Multi-Camera Video","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T21:20:29.434388Z"},"links":{"citing_paper":"/paper/2507.00339"},"observation_digest":"sha256:cfe8662d23f124875503435251cf10439d63fe040a3bd13fed8b2d0c6bf49854","observation_id":"da7bc35c-1f2e-47f5-a317-b2dcd1cb81e5","resolution":{"observed_at":"2026-08-06T21:20:29.735320Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:20:29.720851Z","title":"Bosch, Tessa M","venue":null,"work_id":"d5e2b8d3-0c64-4479-8903-9d8bbe6980ba","year":2019},"citing_paper":{"arxiv_id":"2507.00339","last_updated":"2025-07-01T00:36:56Z","snapshot_observed_at":"2026-08-06T21:15:56.293671Z","submitted_at":"2025-07-01T00:36:56Z","title":"Training for X-Ray Vision: Amodal Segmentation, Amodal Content Completion, and View-Invariant Object Representation from Multi-Camera Video","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T21:20:29.437745Z"},"links":{"citing_paper":"/paper/2507.00339"},"observation_digest":"sha256:f5e12f07bec91f50270db07f221af1e5f5f2972917ba29e0c0c3f2a199edcc12","observation_id":"a1cbde60-f6a5-4ead-b760-0e9fa420cf3e","resolution":{"observed_at":"2026-08-06T21:20:29.724027Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:20:29.709340Z","title":"Amodal completion via progressive mixed context diffusion, 2023","venue":null,"work_id":"995a04f9-f845-439a-942c-f8cf0fc2f3d6","year":2023},"citing_paper":{"arxiv_id":"2507.00339","last_updated":"2025-07-01T00:36:56Z","snapshot_observed_at":"2026-08-06T21:15:56.293671Z","submitted_at":"2025-07-01T00:36:56Z","title":"Training for X-Ray Vision: Amodal Segmentation, Amodal Content Completion, and View-Invariant Object Representation from Multi-Camera Video","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T21:20:29.441291Z"},"links":{"citing_paper":"/paper/2507.00339"},"observation_digest":"sha256:7045095d2be9c2975b5fd5b1b880aec8b8b97258559afe0507f799ee6fcc637e","observation_id":"159e4a69-b954-4796-9e60-22f59e3bd55c","resolution":{"observed_at":"2026-08-06T21:20:29.713471Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:20:29.697851Z","title":"Addressing issues with working memory in video object segmentation, 2024","venue":null,"work_id":"d26ff939-50b1-4de0-a514-4cdabc92e4aa","year":2024},"citing_paper":{"arxiv_id":"2507.00339","last_updated":"2025-07-01T00:36:56Z","snapshot_observed_at":"2026-08-06T21:15:56.293671Z","submitted_at":"2025-07-01T00:36:56Z","title":"Training for X-Ray Vision: Amodal Segmentation, Amodal Content Completion, and View-Invariant Object Representation from Multi-Camera Video","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T21:20:29.444516Z"},"links":{"citing_paper":"/paper/2507.00339"},"observation_digest":"sha256:a8bf1d08e85901f89fe64084835daeed3e63adc575987b24065f68289d31bd3b","observation_id":"9bc574ca-6755-4368-b2db-568f4d960c1d","resolution":{"observed_at":"2026-08-06T21:20:29.701488Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:20:29.686871Z","title":"Narasimhan","venue":null,"work_id":"3c0e2507-1545-4fae-84bd-10f452298c38","year":2022},"citing_paper":{"arxiv_id":"2507.00339","last_updated":"2025-07-01T00:36:56Z","snapshot_observed_at":"2026-08-06T21:15:56.293671Z","submitted_at":"2025-07-01T00:36:56Z","title":"Training for X-Ray Vision: Amodal Segmentation, Amodal Content Completion, and View-Invariant Object Representation from Multi-Camera Video","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T21:20:29.448165Z"},"links":{"citing_paper":"/paper/2507.00339"},"observation_digest":"sha256:ccb254e06cbbb5ee842244d610629809aa0d1920e04a7e0dd485ea1578772abe","observation_id":"2508cee0-09d9-4bb5-ba47-136b5b405fa7","resolution":{"observed_at":"2026-08-06T21:20:29.690380Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:20:29.675955Z","title":"Foundation models for amodal video instance segmentation in automated driving, 2024","venue":null,"work_id":"4eeeedd4-d319-44db-9c8f-c4e5c5ae606d","year":2024},"citing_paper":{"arxiv_id":"2507.00339","last_updated":"2025-07-01T00:36:56Z","snapshot_observed_at":"2026-08-06T21:15:56.293671Z","submitted_at":"2025-07-01T00:36:56Z","title":"Training for X-Ray Vision: Amodal Segmentation, Amodal Content Completion, and View-Invariant Object Representation from Multi-Camera Video","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T21:20:29.451745Z"},"links":{"citing_paper":"/paper/2507.00339"},"observation_digest":"sha256:cb295d769ab58a3004b89b665cc9ecbdfb895cb8f6c791bb88102a4d61d49648","observation_id":"d0dae70a-02f8-4152-857b-9d150f35e654","resolution":{"observed_at":"2026-08-06T21:20:29.679575Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:20:29.664920Z","title":"Synwoodscape: Synthetic surround-view fisheye camera dataset for au- tonomous driving","venue":null,"work_id":"459898aa-4580-4a55-89a4-ee7573301c10","year":2022},"citing_paper":{"arxiv_id":"2507.00339","last_updated":"2025-07-01T00:36:56Z","snapshot_observed_at":"2026-08-06T21:15:56.293671Z","submitted_at":"2025-07-01T00:36:56Z","title":"Training for X-Ray Vision: Amodal Segmentation, Amodal Content Completion, and View-Invariant Object Representation from Multi-Camera Video","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T21:20:29.454980Z"},"links":{"citing_paper":"/paper/2507.00339"},"observation_digest":"sha256:46f54d06706ef2465c9ebeab3684b59cda9e15cbac527283fc9bdb64c6d4debb","observation_id":"260c8f1a-d196-46bc-a7f2-c0f23fb3c448","resolution":{"observed_at":"2026-08-06T21:20:29.668427Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:20:29.654002Z","title":"R3d3: Dense 3d reconstruction of dynamic scenes from multiple cameras, 2023","venue":null,"work_id":"1cda9618-fb7c-406d-ab46-f44cc76ac6e0","year":2023},"citing_paper":{"arxiv_id":"2507.00339","last_updated":"2025-07-01T00:36:56Z","snapshot_observed_at":"2026-08-06T21:15:56.293671Z","submitted_at":"2025-07-01T00:36:56Z","title":"Training for X-Ray Vision: Amodal Segmentation, Amodal Content Completion, and View-Invariant Object Representation from Multi-Camera Video","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T21:20:29.458350Z"},"links":{"citing_paper":"/paper/2507.00339"},"observation_digest":"sha256:11d228c43a8421867fabcf689fe5f25733a49aac706e4379c8c87bffa92bc822","observation_id":"3421157e-276b-4dde-9948-6a9e5be691cb","resolution":{"observed_at":"2026-08-06T21:20:29.657567Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:20:29.642001Z","title":"The wildtrack multi-camera person dataset, 2017","venue":null,"work_id":"678a9f81-7930-42f3-aff0-5fb7bccc365e","year":2017},"citing_paper":{"arxiv_id":"2507.00339","last_updated":"2025-07-01T00:36:56Z","snapshot_observed_at":"2026-08-06T21:15:56.293671Z","submitted_at":"2025-07-01T00:36:56Z","title":"Training for X-Ray Vision: Amodal Segmentation, Amodal Content Completion, and View-Invariant Object Representation from Multi-Camera Video","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T21:20:29.461472Z"},"links":{"citing_paper":"/paper/2507.00339"},"observation_digest":"sha256:36b18decd49c1872a042a751659c0e1863dcc759017a10746a607fcff5b1e313","observation_id":"33118de1-2af8-4768-8fe1-a13ba6b12dab","resolution":{"observed_at":"2026-08-06T21:20:29.645775Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:20:29.630665Z","title":"Mmptrack: Large-scale densely annotated multi-camera multiple people tracking benchmark, 2021","venue":null,"work_id":"aed49a62-440c-484e-b28e-15141465ee02","year":2021},"citing_paper":{"arxiv_id":"2507.00339","last_updated":"2025-07-01T00:36:56Z","snapshot_observed_at":"2026-08-06T21:15:56.293671Z","submitted_at":"2025-07-01T00:36:56Z","title":"Training for X-Ray Vision: Amodal Segmentation, Amodal Content Completion, and View-Invariant Object Representation from Multi-Camera Video","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T21:20:29.464826Z"},"links":{"citing_paper":"/paper/2507.00339"},"observation_digest":"sha256:9d37c1e9027e2871f68215c07a1287c83418ab6d423ab932a36f6882fe90c7a4","observation_id":"52c5b61e-219c-464a-9253-1c6c917868ee","resolution":{"observed_at":"2026-08-06T21:20:29.634374Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:20:29.618940Z","title":"Multi-camera multi-object tracking: A review of current trends and future advances","venue":null,"work_id":"e6149343-849d-4246-823d-08f7bffdec3a","year":2023},"citing_paper":{"arxiv_id":"2507.00339","last_updated":"2025-07-01T00:36:56Z","snapshot_observed_at":"2026-08-06T21:15:56.293671Z","submitted_at":"2025-07-01T00:36:56Z","title":"Training for X-Ray Vision: Amodal Segmentation, Amodal Content Completion, and View-Invariant Object Representation from Multi-Camera Video","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T21:20:29.467943Z"},"links":{"citing_paper":"/paper/2507.00339"},"observation_digest":"sha256:86e2987ccd3c395d31c127d027cdbc257ae39b2a9f3ff981471b2399cd4e20bf","observation_id":"22116cae-1fc6-4f91-a65e-2d69b3421e61","resolution":{"observed_at":"2026-08-06T21:20:29.622827Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:20:29.607709Z","title":"Ferryman and Ali Shahrokni","venue":null,"work_id":"db0f27b0-b38f-4d4e-b6b5-c18e97c19463","year":2009},"citing_paper":{"arxiv_id":"2507.00339","last_updated":"2025-07-01T00:36:56Z","snapshot_observed_at":"2026-08-06T21:15:56.293671Z","submitted_at":"2025-07-01T00:36:56Z","title":"Training for X-Ray Vision: Amodal Segmentation, Amodal Content Completion, and View-Invariant Object Representation from Multi-Camera Video","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T21:20:29.471216Z"},"links":{"citing_paper":"/paper/2507.00339"},"observation_digest":"sha256:dff953a43e8d4778fc6a734da8a7b6fdb1336e9274310dc9fc3807035375487a","observation_id":"14f18e15-0d0f-4e84-b0eb-b9cf63ad9597","resolution":{"observed_at":"2026-08-06T21:20:29.611262Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:20:29.596748Z","title":"Multiview equivariance improves 3d correspondence understanding with minimal feature finetuning, 2025","venue":null,"work_id":"371009be-7eb2-426a-9b9c-6e887b59b5c5","year":2025},"citing_paper":{"arxiv_id":"2507.00339","last_updated":"2025-07-01T00:36:56Z","snapshot_observed_at":"2026-08-06T21:15:56.293671Z","submitted_at":"2025-07-01T00:36:56Z","title":"Training for X-Ray Vision: Amodal Segmentation, Amodal Content Completion, and View-Invariant Object Representation from Multi-Camera Video","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T21:20:29.474776Z"},"links":{"citing_paper":"/paper/2507.00339"},"observation_digest":"sha256:ab264e37aba4eab2b6c7b55a6d6df0e102bcb2ee012c0270d16052372706e16f","observation_id":"a19c364c-81e1-480c-a4e1-4c53462200dc","resolution":{"observed_at":"2026-08-06T21:20:29.600320Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:20:29.584472Z","title":null,"venue":null,"work_id":"0d6783b8-dfc5-4eec-9bee-d27d67f03f1d","year":2022},"citing_paper":{"arxiv_id":"2507.00339","last_updated":"2025-07-01T00:36:56Z","snapshot_observed_at":"2026-08-06T21:15:56.293671Z","submitted_at":"2025-07-01T00:36:56Z","title":"Training for X-Ray Vision: Amodal Segmentation, Amodal Content Completion, and View-Invariant Object Representation from Multi-Camera Video","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T21:20:29.478182Z"},"links":{"citing_paper":"/paper/2507.00339"},"observation_digest":"sha256:6e27bd79d01695b61b6d73b6e02c90c6f3fdf0d2a20a21244d9795cc1763d097","observation_id":"1d2da6c8-06b9-46ce-bbf2-e91a8eebca66","resolution":{"observed_at":"2026-08-06T21:20:29.588352Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:20:29.572731Z","title":"Coarse-to-fine amodal segmentation with shape prior, 2023","venue":null,"work_id":"d6bd979d-8d98-41f8-b724-2efae96a8c77","year":2023},"citing_paper":{"arxiv_id":"2507.00339","last_updated":"2025-07-01T00:36:56Z","snapshot_observed_at":"2026-08-06T21:15:56.293671Z","submitted_at":"2025-07-01T00:36:56Z","title":"Training for X-Ray Vision: Amodal Segmentation, Amodal Content Completion, and View-Invariant Object Representation from Multi-Camera Video","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T21:20:29.481730Z"},"links":{"citing_paper":"/paper/2507.00339"},"observation_digest":"sha256:ef9a4444a45c11dd6e63b87c7271b6c9509722c6b6abb25f0d97d1c9dc895600","observation_id":"183cbd46-ebe3-4036-bdde-6190fdbedd68","resolution":{"observed_at":"2026-08-06T21:20:29.576435Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:20:29.561130Z","title":"Self-supervised amodal video object segmentation, 2022","venue":null,"work_id":"826dbe0e-dd62-40ae-b47a-9ab6d64767e0","year":2022},"citing_paper":{"arxiv_id":"2507.00339","last_updated":"2025-07-01T00:36:56Z","snapshot_observed_at":"2026-08-06T21:15:56.293671Z","submitted_at":"2025-07-01T00:36:56Z","title":"Training for X-Ray Vision: Amodal Segmentation, Amodal Content Completion, and View-Invariant Object Representation from Multi-Camera Video","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T21:20:29.485230Z"},"links":{"citing_paper":"/paper/2507.00339"},"observation_digest":"sha256:1ad7f7f72a13a4e6f676193c3c1ed33cb1c17e4e5ecfbddb80da40d7d06a369d","observation_id":"023a954a-dfd3-4e2c-8506-ab46f321c52b","resolution":{"observed_at":"2026-08-06T21:20:29.564822Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:20:29.549307Z","title":"Efros, Eli Shechtman, and Oliver Wang","venue":null,"work_id":"bd635dcf-b12f-467c-a417-7ce2bab01938","year":2018},"citing_paper":{"arxiv_id":"2507.00339","last_updated":"2025-07-01T00:36:56Z","snapshot_observed_at":"2026-08-06T21:15:56.293671Z","submitted_at":"2025-07-01T00:36:56Z","title":"Training for X-Ray Vision: Amodal Segmentation, Amodal Content Completion, and View-Invariant Object Representation from Multi-Camera Video","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T21:20:29.488715Z"},"links":{"citing_paper":"/paper/2507.00339"},"observation_digest":"sha256:507cb933c5e94d2908f5e3081c18732f1774f9ba743407f97363744aeef43148","observation_id":"eefac145-34e0-479c-86a1-a36779eaa53e","resolution":{"observed_at":"2026-08-06T21:20:29.552895Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:20:29.537972Z","title":null,"venue":null,"work_id":"3b69a16b-9b1a-4fdf-94d1-bab4660f3c9f","year":2004},"citing_paper":{"arxiv_id":"2507.00339","last_updated":"2025-07-01T00:36:56Z","snapshot_observed_at":"2026-08-06T21:15:56.293671Z","submitted_at":"2025-07-01T00:36:56Z","title":"Training for X-Ray Vision: Amodal Segmentation, Amodal Content Completion, and View-Invariant Object Representation from Multi-Camera Video","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T21:20:29.491954Z"},"links":{"citing_paper":"/paper/2507.00339"},"observation_digest":"sha256:7af689cee71fbee65763188fa55245895da97ba6e3d218a3eaedbe111d65156d","observation_id":"b1435de9-3887-4c15-afbc-bed4d92bc61c","resolution":{"observed_at":"2026-08-06T21:20:29.541503Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.00339","last_updated":"2025-07-01T00:36:56Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T21:15:56.293671Z","submitted_at":"2025-07-01T00:36:56Z","title":"Training for X-Ray Vision: Amodal Segmentation, Amodal Content Completion, and View-Invariant Object Representation from Multi-Camera Video"},"reference_resolution":{"displayed":43,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":3,"verified_exact":1,"verified_fuzzy":39},"total_outbound_references":43},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 43 of 43 outbound references and 0 inbound Pith citation observations for arXiv:2507.00339."}