{"as_of":"2026-08-10T07:35:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:419f22d57276d03be4a70a7ce1cef6a595c6a02c74a7b498bd2fe174353565da","coverage":[{"denominator":67,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":67,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T10:42:01.073080Z","state":"measured"},{"denominator":70,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":70,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T20:38:59.086885Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-16T02:57:11.800477Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.23567","last_updated":"2025-09-05T15:41:13Z","snapshot_observed_at":"2026-08-08T01:12:00.953493Z","submitted_at":"2025-07-31T13:56:41Z","title":"3D-MOOD: Lifting 2D to 3D for Monocular Open-Set Object Detection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.23567","snapshot_observed_at":"2026-08-06T20:38:59.086885Z","title":"arXiv preprint arXiv:2507.23567 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02393","last_updated":"2026-06-26T14:26:46Z","snapshot_observed_at":"2026-08-07T13:57:15.763642Z","submitted_at":"2025-07-03T07:46:39Z","title":"PLOT: Pseudo-Labeling via Object Tracking for Monocular 3D Object Detection","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T20:38:59.086885Z"},"links":{"cited_paper":"/paper/2507.23567","citing_paper":"/paper/2507.02393"},"observation_digest":"sha256:6c84453c81c277c1ebab36f2d6d2db8b920ad31c8bdbf9df61336a4b159c7aa3","observation_id":"1f64fde7-d9ad-4aa0-a662-e6ef6d713ba1","resolution":{"observed_at":"2026-08-06T20:38:59.086885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.23567","last_updated":"2025-09-05T15:41:13Z","snapshot_observed_at":"2026-08-08T01:12:00.953493Z","submitted_at":"2025-07-31T13:56:41Z","title":"3D-MOOD: Lifting 2D to 3D for Monocular Open-Set Object Detection","version":2},"cited_work":{"arxiv_id":"2507.23567","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.23567","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"3d-mood: Lifting 2d to 3d for monocular open- set object detection","venue":null,"work_id":"060dff3c-8fd0-4b4a-bef2-c0e747f0cae2","year":2025},"citing_paper":{"arxiv_id":"2602.09532","last_updated":"2026-04-04T18:46:31Z","snapshot_observed_at":"2026-08-03T11:48:26.973469Z","submitted_at":"2026-02-10T08:44:31Z","title":"RAD: Retrieval-Augmented Monocular Metric Depth Estimation for Underrepresented Classes","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-16T02:54:48.648483Z"},"links":{"cited_paper":"/paper/2507.23567","citing_paper":"/paper/2602.09532"},"observation_digest":"sha256:a313cb6b0e7856aba3fd3e7ee48374cefbefa282066833f8f7ed86db6117c9d2","observation_id":"896f1474-7f19-4eda-8ed9-de9fb701ff33","resolution":{"observed_at":"2026-05-16T02:57:11.803753Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.23567","last_updated":"2025-09-05T15:41:13Z","snapshot_observed_at":"2026-08-08T01:12:00.953493Z","submitted_at":"2025-07-31T13:56:41Z","title":"3D-MOOD: Lifting 2D to 3D for Monocular Open-Set Object Detection","version":2},"cited_work":{"arxiv_id":"2507.23567","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.23567","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"3d-mood: Lifting 2d to 3d for monocular open- set object detection","venue":null,"work_id":"060dff3c-8fd0-4b4a-bef2-c0e747f0cae2","year":2025},"citing_paper":{"arxiv_id":"2604.08626","last_updated":"2026-04-17T22:49:55Z","snapshot_observed_at":"2026-07-06T22:57:40.773778Z","submitted_at":"2026-04-09T16:00:10Z","title":"WildDet3D: Scaling Promptable 3D Detection in the Wild","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-10T17:38:13.336003Z"},"links":{"cited_paper":"/paper/2507.23567","citing_paper":"/paper/2604.08626"},"observation_digest":"sha256:fa7188a1bfffe6dd56351d14fab9f83bcc59b3706e1f79e763852dc9d0d2a392","observation_id":"14e18396-47b2-41f8-9537-1a0157a41913","resolution":{"observed_at":"2026-05-11T06:26:00.640343Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.23567/citation-record","integrity":"/paper/2507.23567/integrity","json":"/paper/2507.23567/citation-record.json","paper":"/paper/2507.23567"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:42:01.616555Z","title":"Objectron: A large scale dataset of object-centric videos in the wild with pose anno- tations.Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, 2021","venue":null,"work_id":"fde2d85f-09b5-49bf-b4c5-fe8c670c6a7f","year":2021},"citing_paper":{"arxiv_id":"2507.23567","last_updated":"2025-09-05T15:41:13Z","snapshot_observed_at":"2026-08-08T01:12:00.953493Z","submitted_at":"2025-07-31T13:56:41Z","title":"3D-MOOD: Lifting 2D to 3D for Monocular Open-Set Object Detection","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T10:42:00.900915Z"},"links":{"citing_paper":"/paper/2507.23567"},"observation_digest":"sha256:7b8c9552758ea033039f05bd22f5d91af7c628446a6ddf9b9f1fbea24802e550","observation_id":"fdf0b8cf-5a88-4248-a0b4-8ab2138d83b6","resolution":{"observed_at":"2026-08-06T10:42:01.619437Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:42:01.608371Z","title":"ARK- itscenes - a diverse real-world dataset for 3d indoor scene understanding using mobile RGB-d data","venue":null,"work_id":"c19a7527-7c1c-4cf3-8718-7cd827c3d74e","year":2021},"citing_paper":{"arxiv_id":"2507.23567","last_updated":"2025-09-05T15:41:13Z","snapshot_observed_at":"2026-08-08T01:12:00.953493Z","submitted_at":"2025-07-31T13:56:41Z","title":"3D-MOOD: Lifting 2D to 3D for Monocular Open-Set Object Detection","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T10:42:00.904104Z"},"links":{"citing_paper":"/paper/2507.23567"},"observation_digest":"sha256:917b17219704bd8c3feae1164875b86c8f5b67bb6b4fba2b43ead2cb2cd7fe51","observation_id":"7d51f48b-aadd-49b7-b403-2e8daf03b34f","resolution":{"observed_at":"2026-08-06T10:42:01.611248Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02073","last_updated":"2025-04-21T12:09:08Z","snapshot_observed_at":"2026-08-02T06:32:26.688405Z","submitted_at":"2024-10-02T22:42:20Z","title":"Depth Pro: Sharp Monocular Metric Depth in Less Than a Second","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02073","snapshot_observed_at":"2026-08-06T10:42:00.907006Z","title":"Depth pro: Sharp monocular metric depth in less than a second.arXiv preprint arXiv:2410.02073, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.23567","last_updated":"2025-09-05T15:41:13Z","snapshot_observed_at":"2026-08-08T01:12:00.953493Z","submitted_at":"2025-07-31T13:56:41Z","title":"3D-MOOD: Lifting 2D to 3D for Monocular Open-Set Object Detection","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T10:42:00.907006Z"},"links":{"cited_paper":"/paper/2410.02073","citing_paper":"/paper/2507.23567"},"observation_digest":"sha256:2baf97087479d17c0da8a4e0bbfa9e368e7e3ff92e8f56c8bcfb741d8c07d1ed","observation_id":"bf0dfa08-d5bc-4d37-a9ef-0fbea5712f96","resolution":{"observed_at":"2026-08-06T10:42:00.907006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:42:01.599844Z","title":"Omni3d: A large benchmark and model for 3d object detection in the wild","venue":null,"work_id":"3c44de6b-6c75-46d1-89ed-971f33da5a79","year":2023},"citing_paper":{"arxiv_id":"2507.23567","last_updated":"2025-09-05T15:41:13Z","snapshot_observed_at":"2026-08-08T01:12:00.953493Z","submitted_at":"2025-07-31T13:56:41Z","title":"3D-MOOD: Lifting 2D to 3D for Monocular Open-Set Object Detection","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T10:42:00.910426Z"},"links":{"citing_paper":"/paper/2507.23567"},"observation_digest":"sha256:5db90df565282e528a5f7f446a59e379e9bc5fc887e45330587b46b66af6d673","observation_id":"af31f20b-466a-4462-bb14-71abc8ca1f06","resolution":{"observed_at":"2026-08-06T10:42:01.602685Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1903.11027","last_updated":"2020-05-05T09:13:24Z","snapshot_observed_at":"2026-08-08T05:33:42.283828Z","submitted_at":"2019-03-26T17:19:56Z","title":"nuScenes: A multimodal dataset for autonomous driving","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1903.11027","snapshot_observed_at":"2026-08-06T10:42:00.913116Z","title":"Lang, Sourabh V ora, Venice Erin Liong, Qiang Xu, Anush Krishnan, Yu Pan, Giancarlo Baldan, and Oscar Beijbom","venue":null,"work_id":null,"year":1903},"citing_paper":{"arxiv_id":"2507.23567","last_updated":"2025-09-05T15:41:13Z","snapshot_observed_at":"2026-08-08T01:12:00.953493Z","submitted_at":"2025-07-31T13:56:41Z","title":"3D-MOOD: Lifting 2D to 3D for Monocular Open-Set Object Detection","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T10:42:00.913116Z"},"links":{"cited_paper":"/paper/1903.11027","citing_paper":"/paper/2507.23567"},"observation_digest":"sha256:bd892f682578cf26a78a42273706e84c3dfb71928326df5ec74a75d200da8475","observation_id":"91c8403f-52fc-4aab-91cf-3c7dc2cb5bb6","resolution":{"observed_at":"2026-08-06T10:42:00.913116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:42:01.591804Z","title":"End-to- end object detection with transformers","venue":null,"work_id":"c83bb55f-b2d5-4f19-8278-0292f15d6cb4","year":2020},"citing_paper":{"arxiv_id":"2507.23567","last_updated":"2025-09-05T15:41:13Z","snapshot_observed_at":"2026-08-08T01:12:00.953493Z","submitted_at":"2025-07-31T13:56:41Z","title":"3D-MOOD: Lifting 2D to 3D for Monocular Open-Set Object Detection","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T10:42:00.916021Z"},"links":{"citing_paper":"/paper/2507.23567"},"observation_digest":"sha256:7ba238e83ee05e92a92574fca39756c244f4bf900efe077aa99fa2190325a363","observation_id":"bba8314b-7f0b-428b-90a0-137c97bb6df6","resolution":{"observed_at":"2026-08-06T10:42:01.594562Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.17270","last_updated":"2024-02-22T13:05:52Z","snapshot_observed_at":"2026-08-09T16:14:37.195905Z","submitted_at":"2024-01-30T18:59:38Z","title":"YOLO-World: Real-Time Open-Vocabulary Object Detection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.17270","snapshot_observed_at":"2026-08-06T10:42:00.918835Z","title":"Yolo-world: Real- time open-vocabulary object detection.arXiv preprint arXiv:2401.17270, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.23567","last_updated":"2025-09-05T15:41:13Z","snapshot_observed_at":"2026-08-08T01:12:00.953493Z","submitted_at":"2025-07-31T13:56:41Z","title":"3D-MOOD: Lifting 2D to 3D for Monocular Open-Set Object Detection","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T10:42:00.918835Z"},"links":{"cited_paper":"/paper/2401.17270","citing_paper":"/paper/2507.23567"},"observation_digest":"sha256:a9f72c88e754ff7dce8397187e18cad8829f8e3a441e46bf42867f9260cc56d2","observation_id":"ddcec91a-5e94-4dbd-b8fd-9fda3afe1aed","resolution":{"observed_at":"2026-08-06T10:42:00.918835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:42:01.583164Z","title":"Chang, Manolis Savva, Maciej Hal- ber, Thomas Funkhouser, and Matthias Nießner","venue":null,"work_id":"b83be978-b1bc-4a85-b5e9-ea2b8edd192d","year":2017},"citing_paper":{"arxiv_id":"2507.23567","last_updated":"2025-09-05T15:41:13Z","snapshot_observed_at":"2026-08-08T01:12:00.953493Z","submitted_at":"2025-07-31T13:56:41Z","title":"3D-MOOD: Lifting 2D to 3D for Monocular Open-Set Object Detection","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T10:42:00.921639Z"},"links":{"citing_paper":"/paper/2507.23567"},"observation_digest":"sha256:7c6eff02aeceac32c6a6846479b019b72230ebff80c49ef447d7905d19f50f7b","observation_id":"2d3ea326-68a3-43c4-a804-647bb19ce6c6","resolution":{"observed_at":"2026-08-06T10:42:01.586360Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-07-30T09:12:38.100527Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-06T10:42:00.924084Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding.arXiv preprint arXiv:1810.04805, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.23567","last_updated":"2025-09-05T15:41:13Z","snapshot_observed_at":"2026-08-08T01:12:00.953493Z","submitted_at":"2025-07-31T13:56:41Z","title":"3D-MOOD: Lifting 2D to 3D for Monocular Open-Set Object Detection","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T10:42:00.924084Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2507.23567"},"observation_digest":"sha256:844bfd6f75a6617b71e6e59d65f64ca87002fe358531ca0dcb2f9fe68d42d27e","observation_id":"861526cf-a957-44b4-a9e2-fa643786b21d","resolution":{"observed_at":"2026-08-06T10:42:00.924084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:42:00.926810Z","title":"Towards real-time monocular depth estimation for robotics: A survey.IEEE Transactions on Intelligent Transportation Systems, 23(10):16940–16961,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.23567","last_updated":"2025-09-05T15:41:13Z","snapshot_observed_at":"2026-08-08T01:12:00.953493Z","submitted_at":"2025-07-31T13:56:41Z","title":"3D-MOOD: Lifting 2D to 3D for Monocular Open-Set Object Detection","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T10:42:00.926810Z"},"links":{"citing_paper":"/paper/2507.23567"},"observation_digest":"sha256:21fd1f1d007f5407b0cb9f10a9561baa932d986c527ae55e5aa680ea04a7733a","observation_id":"14e1d856-d00c-47fc-9962-52a62b65339f","resolution":{"observed_at":"2026-08-06T10:42:00.926810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:42:01.569574Z","title":"Depth map prediction from a single image using a multi-scale deep net- work.Advances in Neural Information Processing Systems (NeurIPS), 27, 2014","venue":null,"work_id":"280791b2-cf47-4d1d-8e59-c981f2d5a230","year":2014},"citing_paper":{"arxiv_id":"2507.23567","last_updated":"2025-09-05T15:41:13Z","snapshot_observed_at":"2026-08-08T01:12:00.953493Z","submitted_at":"2025-07-31T13:56:41Z","title":"3D-MOOD: Lifting 2D to 3D for Monocular Open-Set Object Detection","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T10:42:00.929476Z"},"links":{"citing_paper":"/paper/2507.23567"},"observation_digest":"sha256:d297176e477a2750c9db26f9cd31adeacf10cfa0eaeea5178125edc543f031a5","observation_id":"fd4b8411-3372-4ff4-8577-3feedbce634b","resolution":{"observed_at":"2026-08-06T10:42:01.572655Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:42:01.560970Z","title":"Cc-3dt: Panoramic 3d object tracking via cross-camera fusion","venue":null,"work_id":"f3fcc80f-b293-4191-88af-28e714ace7d8","year":2022},"citing_paper":{"arxiv_id":"2507.23567","last_updated":"2025-09-05T15:41:13Z","snapshot_observed_at":"2026-08-08T01:12:00.953493Z","submitted_at":"2025-07-31T13:56:41Z","title":"3D-MOOD: Lifting 2D to 3D for Monocular Open-Set Object Detection","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T10:42:00.931949Z"},"links":{"citing_paper":"/paper/2507.23567"},"observation_digest":"sha256:e8ff0427c433fc2a6ea5d0585a634d3ec2a9d33e68bb1101b22afd054db84a19","observation_id":"b3852928-2dbd-417e-af2e-dcc5bb1e3b33","resolution":{"observed_at":"2026-08-06T10:42:01.563875Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:42:01.552916Z","title":"Cross-domain few-shot object detection via enhanced open-set object detector","venue":null,"work_id":"cc56f7dc-c02f-4e4e-b0d8-f3010efa3fdc","year":2024},"citing_paper":{"arxiv_id":"2507.23567","last_updated":"2025-09-05T15:41:13Z","snapshot_observed_at":"2026-08-08T01:12:00.953493Z","submitted_at":"2025-07-31T13:56:41Z","title":"3D-MOOD: Lifting 2D to 3D for Monocular Open-Set Object Detection","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T10:42:00.934329Z"},"links":{"citing_paper":"/paper/2507.23567"},"observation_digest":"sha256:d4247e15da2272eb76a92b65a42f8538b369afbc10be426c29f07a2cde2158ab","observation_id":"80b34638-ebbf-4136-80b9-04764453a65e","resolution":{"observed_at":"2026-08-06T10:42:01.555645Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:42:01.544584Z","title":"Are we ready for autonomous driving? the kitti vision benchmark suite","venue":null,"work_id":"5450dff6-3e7f-4808-b76a-39570d1e02fc","year":2012},"citing_paper":{"arxiv_id":"2507.23567","last_updated":"2025-09-05T15:41:13Z","snapshot_observed_at":"2026-08-08T01:12:00.953493Z","submitted_at":"2025-07-31T13:56:41Z","title":"3D-MOOD: Lifting 2D to 3D for Monocular Open-Set Object Detection","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T10:42:00.936709Z"},"links":{"citing_paper":"/paper/2507.23567"},"observation_digest":"sha256:157f3d45adea19cb46ee1bcbc366e22eecf1d998ba6ad2284c43e7a9497eda22","observation_id":"4878b13e-59e6-42ef-b6b2-48f0272009ff","resolution":{"observed_at":"2026-08-06T10:42:01.547410Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:42:00.938983Z","title":"Deep residual learning for image recognition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.23567","last_updated":"2025-09-05T15:41:13Z","snapshot_observed_at":"2026-08-08T01:12:00.953493Z","submitted_at":"2025-07-31T13:56:41Z","title":"3D-MOOD: Lifting 2D to 3D for Monocular Open-Set Object Detection","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T10:42:00.938983Z"},"links":{"citing_paper":"/paper/2507.23567"},"observation_digest":"sha256:eb346cb36a845c3b42cc50fc83dd4102b664726a3dcce73b151c64f43f206d63","observation_id":"ca019b5e-aba8-46af-91b9-e43144ee9b9c","resolution":{"observed_at":"2026-08-06T10:42:00.938983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:42:01.530780Z","title":"Sequential multi-object grasping with one dexterous hand.IROS, 2025","venue":null,"work_id":"9134f0e7-8e81-41e0-8d91-4e64f01229ca","year":2025},"citing_paper":{"arxiv_id":"2507.23567","last_updated":"2025-09-05T15:41:13Z","snapshot_observed_at":"2026-08-08T01:12:00.953493Z","submitted_at":"2025-07-31T13:56:41Z","title":"3D-MOOD: Lifting 2D to 3D for Monocular Open-Set Object Detection","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T10:42:00.941425Z"},"links":{"citing_paper":"/paper/2507.23567"},"observation_digest":"sha256:0494932e66d3d35274b16edb6a2deb2613a7ba00a111b8235fd6fb1451c130aa","observation_id":"b078763f-c91e-4b37-90e7-bb3afdff6075","resolution":{"observed_at":"2026-08-06T10:42:01.533544Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:42:01.522046Z","title":"Monocular quasi-dense 3d object tracking.IEEE Transactions on Pattern Analysis and Machine Intelligence, 45(2):1992–2008, 2022","venue":null,"work_id":"3217569a-b2a5-41ea-b6e2-e05a3a3a7d59","year":1992},"citing_paper":{"arxiv_id":"2507.23567","last_updated":"2025-09-05T15:41:13Z","snapshot_observed_at":"2026-08-08T01:12:00.953493Z","submitted_at":"2025-07-31T13:56:41Z","title":"3D-MOOD: Lifting 2D to 3D for Monocular Open-Set Object Detection","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T10:42:00.943808Z"},"links":{"citing_paper":"/paper/2507.23567"},"observation_digest":"sha256:fafbafc4e58753014722e024708a31e5d84c752ab464d200c3e83199d7d11db3","observation_id":"8f5f0c3a-1590-47d7-8435-dd684ce0cefd","resolution":{"observed_at":"2026-08-06T10:42:01.525212Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:42:01.513480Z","title":"Training an open-vocabulary monocular 3d detection model without 3d data","venue":null,"work_id":"880c11b4-7566-4d98-b5c4-87a256354b1d","year":2024},"citing_paper":{"arxiv_id":"2507.23567","last_updated":"2025-09-05T15:41:13Z","snapshot_observed_at":"2026-08-08T01:12:00.953493Z","submitted_at":"2025-07-31T13:56:41Z","title":"3D-MOOD: Lifting 2D to 3D for Monocular Open-Set Object Detection","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T10:42:00.946250Z"},"links":{"citing_paper":"/paper/2507.23567"},"observation_digest":"sha256:4d1319adc534f164e290c9501b4a32616f7dd036deff9bf507136f12857ca509","observation_id":"ac08359a-fae2-4f71-bf8e-d4462bf9f566","resolution":{"observed_at":"2026-08-06T10:42:01.516453Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.02643","last_updated":"2023-04-05T17:59:46Z","snapshot_observed_at":"2026-08-08T05:14:59.435033Z","submitted_at":"2023-04-05T17:59:46Z","title":"Segment Anything","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.02643","snapshot_observed_at":"2026-08-06T10:42:00.948559Z","title":"Berg, Wan-Yen Lo, Piotr Doll ´ar, and Ross Girshick","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.23567","last_updated":"2025-09-05T15:41:13Z","snapshot_observed_at":"2026-08-08T01:12:00.953493Z","submitted_at":"2025-07-31T13:56:41Z","title":"3D-MOOD: Lifting 2D to 3D for Monocular Open-Set Object Detection","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T10:42:00.948559Z"},"links":{"cited_paper":"/paper/2304.02643","citing_paper":"/paper/2507.23567"},"observation_digest":"sha256:fc5e963399dc624cb4b1d95edbc14cdfce8486494861ccb1cdb815480a7ff71a","observation_id":"01f8b822-2fb5-4bbc-934a-68c165058032","resolution":{"observed_at":"2026-08-06T10:42:00.948559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:42:01.505200Z","title":"3d-rcnn: Instance-level 3d object reconstruction via render-and- compare","venue":null,"work_id":"8fc20bfd-125a-42df-a413-112af39794da","year":null},"citing_paper":{"arxiv_id":"2507.23567","last_updated":"2025-09-05T15:41:13Z","snapshot_observed_at":"2026-08-08T01:12:00.953493Z","submitted_at":"2025-07-31T13:56:41Z","title":"3D-MOOD: Lifting 2D to 3D for Monocular Open-Set Object Detection","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T10:42:00.952139Z"},"links":{"citing_paper":"/paper/2507.23567"},"observation_digest":"sha256:71257a0e26feb708823f4c51e91a410524751156eab797ae4a1d0b22ad2e24a7","observation_id":"0d5174a3-88b7-4bfa-a707-1dbea571b21b","resolution":{"observed_at":"2026-08-06T10:42:01.508206Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:42:01.496835Z","title":"Grounded language-image pre-training","venue":null,"work_id":"f4b8d672-ab26-42c3-87bb-4bcb225ca466","year":2022},"citing_paper":{"arxiv_id":"2507.23567","last_updated":"2025-09-05T15:41:13Z","snapshot_observed_at":"2026-08-08T01:12:00.953493Z","submitted_at":"2025-07-31T13:56:41Z","title":"3D-MOOD: Lifting 2D to 3D for Monocular Open-Set Object Detection","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T10:42:00.954868Z"},"links":{"citing_paper":"/paper/2507.23567"},"observation_digest":"sha256:e80ef6fc2067475d08e46f302d7be2a07dea08006fdc00f99b268c254ef7a734","observation_id":"29b1df6e-1b9c-4938-8791-e1d8e5e62d2e","resolution":{"observed_at":"2026-08-06T10:42:01.499579Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.17270","last_updated":"2022-07-13T06:57:28Z","snapshot_observed_at":"2026-08-10T01:37:48.916044Z","submitted_at":"2022-03-31T17:59:01Z","title":"BEVFormer: Learning Bird's-Eye-View Representation from Multi-Camera Images via Spatiotemporal Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.17270","snapshot_observed_at":"2026-08-06T10:42:00.957398Z","title":"Bevformer: 9 Learning bird’s-eye-view representation from multi-camera images via spatiotemporal transformers.arXiv preprint arXiv:2203.17270, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.23567","last_updated":"2025-09-05T15:41:13Z","snapshot_observed_at":"2026-08-08T01:12:00.953493Z","submitted_at":"2025-07-31T13:56:41Z","title":"3D-MOOD: Lifting 2D to 3D for Monocular Open-Set Object Detection","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T10:42:00.957398Z"},"links":{"cited_paper":"/paper/2203.17270","citing_paper":"/paper/2507.23567"},"observation_digest":"sha256:3e748206561e018d76de84ad329da2f2df75339cb07350216198f0c39636188f","observation_id":"aa3b2e12-822b-4e27-a50c-77f6bfcf1f42","resolution":{"observed_at":"2026-08-06T10:42:00.957398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:42:01.488265Z","title":"Unimode: Unified monocular 3d object detection","venue":null,"work_id":"0152cfe8-220d-4bb7-935f-b7c1be4aa193","year":null},"citing_paper":{"arxiv_id":"2507.23567","last_updated":"2025-09-05T15:41:13Z","snapshot_observed_at":"2026-08-08T01:12:00.953493Z","submitted_at":"2025-07-31T13:56:41Z","title":"3D-MOOD: Lifting 2D to 3D for Monocular Open-Set Object Detection","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T10:42:00.960356Z"},"links":{"citing_paper":"/paper/2507.23567"},"observation_digest":"sha256:19cc9453a215b599885cf31be5d587cd5b8d09ad4b36026455738adf9b07a607","observation_id":"e9c23551-6191-4d91-bb2f-2c3b23700608","resolution":{"observed_at":"2026-08-06T10:42:01.491516Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:42:01.479939Z","title":"Feature pyra- mid networks for object detection","venue":null,"work_id":"c1548e4e-2099-41bc-8033-1dc981a5d702","year":2017},"citing_paper":{"arxiv_id":"2507.23567","last_updated":"2025-09-05T15:41:13Z","snapshot_observed_at":"2026-08-08T01:12:00.953493Z","submitted_at":"2025-07-31T13:56:41Z","title":"3D-MOOD: Lifting 2D to 3D for Monocular Open-Set Object Detection","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T10:42:00.963144Z"},"links":{"citing_paper":"/paper/2507.23567"},"observation_digest":"sha256:4cd251dccc2be18f6e86c12c22d35a775944c08c005d8307518f23ea8af6c19f","observation_id":"23e5ecb3-638e-4f21-ab1a-1fdfe362e9c8","resolution":{"observed_at":"2026-08-06T10:42:01.482898Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.10581","last_updated":"2023-02-10T05:47:05Z","snapshot_observed_at":"2026-08-09T18:47:26.148925Z","submitted_at":"2022-11-19T04:20:57Z","title":"Sparse4D: Multi-view 3D Object Detection with Sparse Spatial-Temporal Fusion","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.10581","snapshot_observed_at":"2026-08-06T10:42:00.965776Z","title":"Sparse4d: Multi-view 3d object detec- tion with sparse spatial-temporal fusion.arXiv preprint arXiv:2211.10581, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.23567","last_updated":"2025-09-05T15:41:13Z","snapshot_observed_at":"2026-08-08T01:12:00.953493Z","submitted_at":"2025-07-31T13:56:41Z","title":"3D-MOOD: Lifting 2D to 3D for Monocular Open-Set Object Detection","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T10:42:00.965776Z"},"links":{"cited_paper":"/paper/2211.10581","citing_paper":"/paper/2507.23567"},"observation_digest":"sha256:8116662d3b2315b1b3b9f0b50934f2b13f2fe8660f42eb6934b66c87bd5c6107","observation_id":"534d9725-5280-45d3-aa1e-69eee1b9382e","resolution":{"observed_at":"2026-08-06T10:42:00.965776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.11722","last_updated":"2023-11-20T12:37:58Z","snapshot_observed_at":"2026-07-06T16:49:53.770544Z","submitted_at":"2023-11-20T12:37:58Z","title":"Sparse4D v3: Advancing End-to-End 3D Detection and Tracking","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.11722","snapshot_observed_at":"2026-08-06T10:42:00.968635Z","title":"Sparse4d v3: Advancing end-to-end 3d detec- tion and tracking.arXiv preprint arXiv:2311.11722, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.23567","last_updated":"2025-09-05T15:41:13Z","snapshot_observed_at":"2026-08-08T01:12:00.953493Z","submitted_at":"2025-07-31T13:56:41Z","title":"3D-MOOD: Lifting 2D to 3D for Monocular Open-Set Object Detection","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T10:42:00.968635Z"},"links":{"cited_paper":"/paper/2311.11722","citing_paper":"/paper/2507.23567"},"observation_digest":"sha256:5daa6815d7abb8f9adeef8316a8d091f3201abd50a2a72399bbd02c5b26ee693","observation_id":"b0eb3317-79d2-4e5b-b84d-110c25925d07","resolution":{"observed_at":"2026-08-06T10:42:00.968635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.05499","last_updated":"2024-07-19T06:00:41Z","snapshot_observed_at":"2026-07-06T15:00:58.804337Z","submitted_at":"2023-03-09T18:52:16Z","title":"Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.05499","snapshot_observed_at":"2026-08-06T10:42:00.971404Z","title":"Grounding dino: Marrying dino with grounded pre-training for open-set object detection.arXiv preprint arXiv:2303.05499, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.23567","last_updated":"2025-09-05T15:41:13Z","snapshot_observed_at":"2026-08-08T01:12:00.953493Z","submitted_at":"2025-07-31T13:56:41Z","title":"3D-MOOD: Lifting 2D to 3D for Monocular Open-Set Object Detection","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T10:42:00.971404Z"},"links":{"cited_paper":"/paper/2303.05499","citing_paper":"/paper/2507.23567"},"observation_digest":"sha256:77cea84ed976359e183e9044acd29cd64ec6d46a84273aad656486ed3cf49bd8","observation_id":"bf10aaed-8dd9-4684-937b-e0ee92935092","resolution":{"observed_at":"2026-08-06T10:42:00.971404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.05625","last_updated":"2022-07-19T08:30:57Z","snapshot_observed_at":"2026-08-10T01:20:39.174004Z","submitted_at":"2022-03-10T20:33:28Z","title":"PETR: Position Embedding Transformation for Multi-View 3D Object Detection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.05625","snapshot_observed_at":"2026-08-06T10:42:00.974207Z","title":"Petr: Position embedding transformation for multi-view 3d object detection.arXiv preprint arXiv:2203.05625, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.23567","last_updated":"2025-09-05T15:41:13Z","snapshot_observed_at":"2026-08-08T01:12:00.953493Z","submitted_at":"2025-07-31T13:56:41Z","title":"3D-MOOD: Lifting 2D to 3D for Monocular Open-Set Object Detection","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T10:42:00.974207Z"},"links":{"cited_paper":"/paper/2203.05625","citing_paper":"/paper/2507.23567"},"observation_digest":"sha256:d923a24294738acfac2e7a32b91667cb29bea68b0c140906accb66ee2834d4fa","observation_id":"507ae2ae-3001-4de1-8154-32012bf24a6b","resolution":{"observed_at":"2026-08-06T10:42:00.974207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:42:00.976982Z","title":"Smoke: Single- stage monocular 3d object detection via keypoint estimation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.23567","last_updated":"2025-09-05T15:41:13Z","snapshot_observed_at":"2026-08-08T01:12:00.953493Z","submitted_at":"2025-07-31T13:56:41Z","title":"3D-MOOD: Lifting 2D to 3D for Monocular Open-Set Object Detection","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T10:42:00.976982Z"},"links":{"citing_paper":"/paper/2507.23567"},"observation_digest":"sha256:d5f6115881f9b5c66a027576d557377465873af8b168b527be153a9d3d13899c","observation_id":"d33778fe-fb48-4031-989a-19cdce9a8574","resolution":{"observed_at":"2026-08-06T10:42:00.976982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:42:01.466791Z","title":"Swin transformer: Hierarchical vision transformer using shifted windows","venue":null,"work_id":"f936c5b6-ef7a-4aa8-9b0c-a7339970a258","year":2021},"citing_paper":{"arxiv_id":"2507.23567","last_updated":"2025-09-05T15:41:13Z","snapshot_observed_at":"2026-08-08T01:12:00.953493Z","submitted_at":"2025-07-31T13:56:41Z","title":"3D-MOOD: Lifting 2D to 3D for Monocular Open-Set Object Detection","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T10:42:00.980237Z"},"links":{"citing_paper":"/paper/2507.23567"},"observation_digest":"sha256:a495b6655776742fafdf518e3cc2b282998483a5472dd04cde70012176cff35d","observation_id":"c6dd50f0-a6e8-4ce6-87bc-8c227784b91b","resolution":{"observed_at":"2026-08-06T10:42:01.469599Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:42:00.982646Z","title":"A convnet for the 2020s","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.23567","last_updated":"2025-09-05T15:41:13Z","snapshot_observed_at":"2026-08-08T01:12:00.953493Z","submitted_at":"2025-07-31T13:56:41Z","title":"3D-MOOD: Lifting 2D to 3D for Monocular Open-Set Object Detection","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T10:42:00.982646Z"},"links":{"citing_paper":"/paper/2507.23567"},"observation_digest":"sha256:462de1e30868521c57b0f648bba384121f448bfac4658eb7637b64d1d3285d97","observation_id":"128143e6-b46b-4764-94cb-c5fb750a2b41","resolution":{"observed_at":"2026-08-06T10:42:00.982646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:42:01.452674Z","title":"Shift r-cnn: Deep monocular 3d object detection with closed-form geometric constraints","venue":null,"work_id":"25a892f1-9eb5-4878-997c-728a4b8779f4","year":2019},"citing_paper":{"arxiv_id":"2507.23567","last_updated":"2025-09-05T15:41:13Z","snapshot_observed_at":"2026-08-08T01:12:00.953493Z","submitted_at":"2025-07-31T13:56:41Z","title":"3D-MOOD: Lifting 2D to 3D for Monocular Open-Set Object Detection","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T10:42:00.985191Z"},"links":{"citing_paper":"/paper/2507.23567"},"observation_digest":"sha256:6b14b91b2a1d8c776214d71136564abec11e41c2c02bedd3bbef97ec00be7f52","observation_id":"7ecda1e8-516b-4ef4-85be-1e7dc9be4b01","resolution":{"observed_at":"2026-08-06T10:42:01.455698Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:42:01.444255Z","title":"Scalable parallel programming with cuda: Is cuda the parallel programming model that application developers have been waiting for?Queue, 6(2):40–53, 2008","venue":null,"work_id":"e138237f-9ece-4fec-897d-5f2a2a00268b","year":2008},"citing_paper":{"arxiv_id":"2507.23567","last_updated":"2025-09-05T15:41:13Z","snapshot_observed_at":"2026-08-08T01:12:00.953493Z","submitted_at":"2025-07-31T13:56:41Z","title":"3D-MOOD: Lifting 2D to 3D for Monocular Open-Set Object Detection","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T10:42:00.987827Z"},"links":{"citing_paper":"/paper/2507.23567"},"observation_digest":"sha256:b8d47a7e01d44c29302073aa246cac63d23dc220e6cb092be3dff26ad9a9ef41","observation_id":"c94ca5bd-f02b-46c3-894b-b735bdace404","resolution":{"observed_at":"2026-08-06T10:42:01.447083Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-09T18:02:17.307812Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-06T10:42:00.990249Z","title":"Dinov2: Learning robust visual features without supervision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.23567","last_updated":"2025-09-05T15:41:13Z","snapshot_observed_at":"2026-08-08T01:12:00.953493Z","submitted_at":"2025-07-31T13:56:41Z","title":"3D-MOOD: Lifting 2D to 3D for Monocular Open-Set Object Detection","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T10:42:00.990249Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2507.23567"},"observation_digest":"sha256:8e9c8cfc498952887b7d68bdb5867fb0959068706bc48dcd35df73727dd14673","observation_id":"855e896a-a1b3-42d6-90b5-b20e7d2ed2a2","resolution":{"observed_at":"2026-08-06T10:42:00.990249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.09110","last_updated":"2025-03-06T09:26:00Z","snapshot_observed_at":"2026-08-09T08:21:27.673802Z","submitted_at":"2024-08-17T06:24:43Z","title":"Locate Anything on Earth: Advancing Open-Vocabulary Object Detection for Remote Sensing Community","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.09110","snapshot_observed_at":"2026-08-06T10:42:00.992859Z","title":"Locate anything on earth: Advancing open-vocabulary ob- ject detection for remote sensing community.arXiv preprint arXiv:2408.09110, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.23567","last_updated":"2025-09-05T15:41:13Z","snapshot_observed_at":"2026-08-08T01:12:00.953493Z","submitted_at":"2025-07-31T13:56:41Z","title":"3D-MOOD: Lifting 2D to 3D for Monocular Open-Set Object Detection","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T10:42:00.992859Z"},"links":{"cited_paper":"/paper/2408.09110","citing_paper":"/paper/2507.23567"},"observation_digest":"sha256:ddd8e0ed0a8007ce129ed914e840cc4a155c610eca1323b1b02d0cb03ede4ca4","observation_id":"5ab23123-b844-49af-8e88-c77fe4dbf8a7","resolution":{"observed_at":"2026-08-06T10:42:00.992859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:42:01.435490Z","title":"Is pseudo-lidar needed for monocular 3d object detection? InIEEE/CVF International Conference on Computer Vision (ICCV), 2021","venue":null,"work_id":"412bde5d-2f92-4379-8d53-2a628b3a9e59","year":2021},"citing_paper":{"arxiv_id":"2507.23567","last_updated":"2025-09-05T15:41:13Z","snapshot_observed_at":"2026-08-08T01:12:00.953493Z","submitted_at":"2025-07-31T13:56:41Z","title":"3D-MOOD: Lifting 2D to 3D for Monocular Open-Set Object Detection","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T10:42:00.995696Z"},"links":{"citing_paper":"/paper/2507.23567"},"observation_digest":"sha256:9003ff837a6e4abf8301fb67c6110ff89d7a9e6ccc2e07993e302d2f0d57a09f","observation_id":"47e0b47e-52da-45c3-ae74-459c17300c48","resolution":{"observed_at":"2026-08-06T10:42:01.438323Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:42:01.427405Z","title":"Py- torch: An imperative style, high-performance deep learning library","venue":null,"work_id":"a9269e91-c77d-4bda-96ea-161736ac154c","year":null},"citing_paper":{"arxiv_id":"2507.23567","last_updated":"2025-09-05T15:41:13Z","snapshot_observed_at":"2026-08-08T01:12:00.953493Z","submitted_at":"2025-07-31T13:56:41Z","title":"3D-MOOD: Lifting 2D to 3D for Monocular Open-Set Object Detection","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T10:42:00.998127Z"},"links":{"citing_paper":"/paper/2507.23567"},"observation_digest":"sha256:9eb4d8a7365344263b66dc9d3aba9fc2b6f11976c9a8072c67b9dc38f22d6831","observation_id":"73141282-d92d-4c36-b876-d5c52544b19c","resolution":{"observed_at":"2026-08-06T10:42:01.430192Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:42:01.418978Z","title":"UniDepth: Universal monocular metric depth estimation","venue":null,"work_id":"647a003d-748f-4570-83c5-16c1de76a8ee","year":2024},"citing_paper":{"arxiv_id":"2507.23567","last_updated":"2025-09-05T15:41:13Z","snapshot_observed_at":"2026-08-08T01:12:00.953493Z","submitted_at":"2025-07-31T13:56:41Z","title":"3D-MOOD: Lifting 2D to 3D for Monocular Open-Set Object Detection","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T10:42:01.001024Z"},"links":{"citing_paper":"/paper/2507.23567"},"observation_digest":"sha256:ac50a139e9bd0e36bfc181bd8d5a782d87bf19e72fa3861f546f465101390175","observation_id":"41c620fb-1b4e-4e7d-83a5-1a2cdbd11ff4","resolution":{"observed_at":"2026-08-06T10:42:01.421953Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:42:01.410869Z","title":"UniK3D: Universal camera monocular 3d estimation","venue":null,"work_id":"dfdad7a2-7b0a-4973-9ad6-6bfc935d8fdd","year":2025},"citing_paper":{"arxiv_id":"2507.23567","last_updated":"2025-09-05T15:41:13Z","snapshot_observed_at":"2026-08-08T01:12:00.953493Z","submitted_at":"2025-07-31T13:56:41Z","title":"3D-MOOD: Lifting 2D to 3D for Monocular Open-Set Object Detection","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T10:42:01.003379Z"},"links":{"citing_paper":"/paper/2507.23567"},"observation_digest":"sha256:ba18ae80d1e8bf9802519f1a2b6bf9b1e09b739db40643d4a11a1203c272deb0","observation_id":"0e98b48e-f9ef-475e-88d1-96b5eef1225d","resolution":{"observed_at":"2026-08-06T10:42:01.413608Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.20110","last_updated":"2025-12-18T09:32:11Z","snapshot_observed_at":"2026-08-08T08:28:09.948334Z","submitted_at":"2025-02-27T14:03:15Z","title":"UniDepthV2: Universal Monocular Metric Depth Estimation Made Simpler","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.20110","snapshot_observed_at":"2026-08-06T10:42:01.005651Z","title":"UniDepthV2: Universal monocular metric depth estimation made simpler.arXiv:2502.20110, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.23567","last_updated":"2025-09-05T15:41:13Z","snapshot_observed_at":"2026-08-08T01:12:00.953493Z","submitted_at":"2025-07-31T13:56:41Z","title":"3D-MOOD: Lifting 2D to 3D for Monocular Open-Set Object Detection","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T10:42:01.005651Z"},"links":{"cited_paper":"/paper/2502.20110","citing_paper":"/paper/2507.23567"},"observation_digest":"sha256:43c776b0f37ada4db963d1eab6d64a9c2ea921b94903b1d5c58a2f33ef6f272f","observation_id":"4b9d058a-3cbe-4b23-9615-b721960e2f2c","resolution":{"observed_at":"2026-08-06T10:42:01.005651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:42:01.008277Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.23567","last_updated":"2025-09-05T15:41:13Z","snapshot_observed_at":"2026-08-08T01:12:00.953493Z","submitted_at":"2025-07-31T13:56:41Z","title":"3D-MOOD: Lifting 2D to 3D for Monocular Open-Set Object Detection","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T10:42:01.008277Z"},"links":{"citing_paper":"/paper/2507.23567"},"observation_digest":"sha256:f021ebb6187c450af76944e7a4e392859903764651c663dd6131481869051ed1","observation_id":"280d2240-afea-477b-9b6e-a8f8aa9e2285","resolution":{"observed_at":"2026-08-06T10:42:01.008277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:42:01.010618Z","title":"Generalized in- tersection over union: A metric and a loss for bounding box regression","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.23567","last_updated":"2025-09-05T15:41:13Z","snapshot_observed_at":"2026-08-08T01:12:00.953493Z","submitted_at":"2025-07-31T13:56:41Z","title":"3D-MOOD: Lifting 2D to 3D for Monocular Open-Set Object Detection","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T10:42:01.010618Z"},"links":{"citing_paper":"/paper/2507.23567"},"observation_digest":"sha256:ebab05dee9d7cf5cae2a7b162c2b98845e20d443e3db02cde833ad891bad8045","observation_id":"38061747-79d6-47e5-a833-19f164ba5681","resolution":{"observed_at":"2026-08-06T10:42:01.010618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:42:01.013113Z","title":"Susskind","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.23567","last_updated":"2025-09-05T15:41:13Z","snapshot_observed_at":"2026-08-08T01:12:00.953493Z","submitted_at":"2025-07-31T13:56:41Z","title":"3D-MOOD: Lifting 2D to 3D for Monocular Open-Set Object Detection","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T10:42:01.013113Z"},"links":{"citing_paper":"/paper/2507.23567"},"observation_digest":"sha256:f7aeb78fb87515d993f85fd8cea013b491a9a60cf28fc5abbf2ced036b8f9d69","observation_id":"606c97e4-2491-49aa-8fc1-e9f680045545","resolution":{"observed_at":"2026-08-06T10:42:01.013113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:42:01.387728Z","title":"Imvoxelnet: Image to voxels projection for monocular and multi-view general-purpose 3d object detection","venue":null,"work_id":"100ab62e-f584-42af-9be8-307431bbfafc","year":2022},"citing_paper":{"arxiv_id":"2507.23567","last_updated":"2025-09-05T15:41:13Z","snapshot_observed_at":"2026-08-08T01:12:00.953493Z","submitted_at":"2025-07-31T13:56:41Z","title":"3D-MOOD: Lifting 2D to 3D for Monocular Open-Set Object Detection","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T10:42:01.015685Z"},"links":{"citing_paper":"/paper/2507.23567"},"observation_digest":"sha256:27993ab77814fd6e2f9053f88491b515085535aab42708d52f91aa5e1e0a01e7","observation_id":"c67bf58e-f12a-48f1-85d9-c7c5b9efc9e2","resolution":{"observed_at":"2026-08-06T10:42:01.390542Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:42:01.018171Z","title":"Structure-from-motion revisited","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.23567","last_updated":"2025-09-05T15:41:13Z","snapshot_observed_at":"2026-08-08T01:12:00.953493Z","submitted_at":"2025-07-31T13:56:41Z","title":"3D-MOOD: Lifting 2D to 3D for Monocular Open-Set Object Detection","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T10:42:01.018171Z"},"links":{"citing_paper":"/paper/2507.23567"},"observation_digest":"sha256:5dc8e188fb90d80da146552ffbb28ef4bc66074fce00885022b4bdbc2d9be25d","observation_id":"ff269098-c4bb-41c4-9985-228880c550aa","resolution":{"observed_at":"2026-08-06T10:42:01.018171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:42:01.020537Z","title":"Pixelwise view selection for un- structured multi-view stereo","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.23567","last_updated":"2025-09-05T15:41:13Z","snapshot_observed_at":"2026-08-08T01:12:00.953493Z","submitted_at":"2025-07-31T13:56:41Z","title":"3D-MOOD: Lifting 2D to 3D for Monocular Open-Set Object Detection","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T10:42:01.020537Z"},"links":{"citing_paper":"/paper/2507.23567"},"observation_digest":"sha256:289a6a61b238020b9924b1e70c0cbe84f835b7c48b1b3a26b57e1d51d0e1f9f6","observation_id":"da8fa163-83d6-4379-bd57-9bda94adf2eb","resolution":{"observed_at":"2026-08-06T10:42:01.020537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:42:01.368503Z","title":"Sun rgb-d: A rgb-d scene understanding benchmark suite","venue":null,"work_id":"259681c3-f493-4017-8d53-3b8f87f52415","year":2015},"citing_paper":{"arxiv_id":"2507.23567","last_updated":"2025-09-05T15:41:13Z","snapshot_observed_at":"2026-08-08T01:12:00.953493Z","submitted_at":"2025-07-31T13:56:41Z","title":"3D-MOOD: Lifting 2D to 3D for Monocular Open-Set Object Detection","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T10:42:01.022996Z"},"links":{"citing_paper":"/paper/2507.23567"},"observation_digest":"sha256:d3eead87d1df18579c7edc61268a057699070833e141a461332ea7949fc0c487","observation_id":"9e6f499f-7ea3-48fe-a507-f766549fcebd","resolution":{"observed_at":"2026-08-06T10:42:01.371407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-06T10:42:01.025423Z","title":"Gemini: a family of highly capable multimodal models.arXiv preprint arXiv:2312.11805, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.23567","last_updated":"2025-09-05T15:41:13Z","snapshot_observed_at":"2026-08-08T01:12:00.953493Z","submitted_at":"2025-07-31T13:56:41Z","title":"3D-MOOD: Lifting 2D to 3D for Monocular Open-Set Object Detection","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T10:42:01.025423Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2507.23567"},"observation_digest":"sha256:2a278b5f9b429b35189bc244dd4adffbdf0a3d0e295f824a134e246d6b17425e","observation_id":"216d5935-cf88-4108-a468-a801626f1c24","resolution":{"observed_at":"2026-08-06T10:42:01.025423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:42:01.359926Z","title":"Im- geonet: Image-induced geometry-aware voxel representation for multi-view 3d object detection","venue":null,"work_id":"0abba447-e9d9-4646-a262-6367dd61b91f","year":2023},"citing_paper":{"arxiv_id":"2507.23567","last_updated":"2025-09-05T15:41:13Z","snapshot_observed_at":"2026-08-08T01:12:00.953493Z","submitted_at":"2025-07-31T13:56:41Z","title":"3D-MOOD: Lifting 2D to 3D for Monocular Open-Set Object Detection","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T10:42:01.028073Z"},"links":{"citing_paper":"/paper/2507.23567"},"observation_digest":"sha256:db37248f0821cea9b8793e04998dba297ae71b57a9eda8bfa5df82afc9b2deea","observation_id":"97e63816-4064-408b-ad67-ba648f66a9e6","resolution":{"observed_at":"2026-08-06T10:42:01.362848Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:42:01.351871Z","title":"Attention is all you need.Advances in Neural Information Processing Systems, 2017","venue":null,"work_id":"fd4365b1-4073-4af4-ae10-4b77bc3acf3f","year":2017},"citing_paper":{"arxiv_id":"2507.23567","last_updated":"2025-09-05T15:41:13Z","snapshot_observed_at":"2026-08-08T01:12:00.953493Z","submitted_at":"2025-07-31T13:56:41Z","title":"3D-MOOD: Lifting 2D to 3D for Monocular Open-Set Object Detection","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T10:42:01.030499Z"},"links":{"citing_paper":"/paper/2507.23567"},"observation_digest":"sha256:fac28678763cdb17000b2edf45e7ceb0e1f87658ca7dd089138a5f17987974f9","observation_id":"1d2b1216-894d-424f-a517-3ec8514c14e7","resolution":{"observed_at":"2026-08-06T10:42:01.354813Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:42:01.343567Z","title":"Fcos3d: Fully convolutional one-stage monocular 3d object detection","venue":null,"work_id":"28e44e92-917e-4ed6-bb44-444fd55d78df","year":2021},"citing_paper":{"arxiv_id":"2507.23567","last_updated":"2025-09-05T15:41:13Z","snapshot_observed_at":"2026-08-08T01:12:00.953493Z","submitted_at":"2025-07-31T13:56:41Z","title":"3D-MOOD: Lifting 2D to 3D for Monocular Open-Set Object Detection","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T10:42:01.033046Z"},"links":{"citing_paper":"/paper/2507.23567"},"observation_digest":"sha256:13b230f385aaa4779cc4dd8b11ab9045f072566a3610e26e72494e48f9322b53","observation_id":"3ad6a563-3390-4a70-8bde-54dab715ab30","resolution":{"observed_at":"2026-08-06T10:42:01.346458Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:42:01.335144Z","title":"Probabilistic and geometric depth: Detecting objects in per- spective","venue":null,"work_id":"5914ef09-a71b-4901-a3ca-5636ca7018bd","year":null},"citing_paper":{"arxiv_id":"2507.23567","last_updated":"2025-09-05T15:41:13Z","snapshot_observed_at":"2026-08-08T01:12:00.953493Z","submitted_at":"2025-07-31T13:56:41Z","title":"3D-MOOD: Lifting 2D to 3D for Monocular Open-Set Object Detection","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T10:42:01.035738Z"},"links":{"citing_paper":"/paper/2507.23567"},"observation_digest":"sha256:1a76cee3f5e18ee6ede5bcaa7f0daa4ba1f14553cefae0bda72f25bdc5b8b340","observation_id":"c94a7730-e6d0-4c2e-9d24-32097d308b90","resolution":{"observed_at":"2026-08-06T10:42:01.337866Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:42:01.326661Z","title":"Pseudo- lidar from visual depth estimation: Bridging the gap in 3d object detection for autonomous driving","venue":null,"work_id":"777c984e-88e0-4d9d-baa0-d7fcf10f95d7","year":2019},"citing_paper":{"arxiv_id":"2507.23567","last_updated":"2025-09-05T15:41:13Z","snapshot_observed_at":"2026-08-08T01:12:00.953493Z","submitted_at":"2025-07-31T13:56:41Z","title":"3D-MOOD: Lifting 2D to 3D for Monocular Open-Set Object Detection","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T10:42:01.038190Z"},"links":{"citing_paper":"/paper/2507.23567"},"observation_digest":"sha256:ea496eb1c86800a4036d22d7d0472b3914c065f2bb132153e5d4eb76848e5567","observation_id":"857965ea-e48a-468e-aa6a-ebc3b6d74f0f","resolution":{"observed_at":"2026-08-06T10:42:01.329426Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:42:01.318322Z","title":"Argoverse 2: Next generation datasets for self-driving perception and fore- casting","venue":null,"work_id":"5cc6798c-148e-4eb5-a141-d64f0c815d55","year":2021},"citing_paper":{"arxiv_id":"2507.23567","last_updated":"2025-09-05T15:41:13Z","snapshot_observed_at":"2026-08-08T01:12:00.953493Z","submitted_at":"2025-07-31T13:56:41Z","title":"3D-MOOD: Lifting 2D to 3D for Monocular Open-Set Object Detection","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T10:42:01.040759Z"},"links":{"citing_paper":"/paper/2507.23567"},"observation_digest":"sha256:c5d15a20f4d554568656b51a50124cb40f822a995e8056290ad85e4f0f8d224a","observation_id":"a0079fec-cc53-4bf9-9009-1c924e738ff3","resolution":{"observed_at":"2026-08-06T10:42:01.321116Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:42:01.310317Z","title":"Qiao, Lewei Lu, Jie Zhou, and Jifeng Dai","venue":null,"work_id":"7a203e01-d753-4788-9326-4b8667ae27e3","year":2022},"citing_paper":{"arxiv_id":"2507.23567","last_updated":"2025-09-05T15:41:13Z","snapshot_observed_at":"2026-08-08T01:12:00.953493Z","submitted_at":"2025-07-31T13:56:41Z","title":"3D-MOOD: Lifting 2D to 3D for Monocular Open-Set Object Detection","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T10:42:01.043254Z"},"links":{"citing_paper":"/paper/2507.23567"},"observation_digest":"sha256:0be2fc0848d87c23692eb2397cec7adb8666bbcb67b80e7a69653d376fb058a1","observation_id":"5be9a1b3-a74d-473b-a214-14c85e665693","resolution":{"observed_at":"2026-08-06T10:42:01.312990Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:42:01.302383Z","title":"Huang, Ren ´e Zurbr¨ugg, Tao Sun, and Fisher Yu","venue":null,"work_id":"39120287-a937-47bf-8d3c-38f05c21135c","year":2024},"citing_paper":{"arxiv_id":"2507.23567","last_updated":"2025-09-05T15:41:13Z","snapshot_observed_at":"2026-08-08T01:12:00.953493Z","submitted_at":"2025-07-31T13:56:41Z","title":"3D-MOOD: Lifting 2D to 3D for Monocular Open-Set Object Detection","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T10:42:01.045693Z"},"links":{"citing_paper":"/paper/2507.23567"},"observation_digest":"sha256:91320cbcedf5f0cdebf9fb5edc3e62c8ce4de503063fe34f3712f8bab13c1ef5","observation_id":"8f404a29-2e1d-4488-8ed2-942625f1fca3","resolution":{"observed_at":"2026-08-06T10:42:01.305060Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:42:01.048100Z","title":"Center- based 3d object detection and tracking","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.23567","last_updated":"2025-09-05T15:41:13Z","snapshot_observed_at":"2026-08-08T01:12:00.953493Z","submitted_at":"2025-07-31T13:56:41Z","title":"3D-MOOD: Lifting 2D to 3D for Monocular Open-Set Object Detection","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T10:42:01.048100Z"},"links":{"citing_paper":"/paper/2507.23567"},"observation_digest":"sha256:64d99e344dfabea041fb9aef3c7a7f59c8e7b7b423246dd5b52c5ae94fe9bf91","observation_id":"6797076e-11f1-4af6-b910-26ffa7a2fd70","resolution":{"observed_at":"2026-08-06T10:42:01.048100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:42:01.287949Z","title":"Metric3d: Towards zero-shot metric 3d prediction from a single image","venue":null,"work_id":"8e3d70db-8a35-445e-b52e-334869a2aefd","year":2023},"citing_paper":{"arxiv_id":"2507.23567","last_updated":"2025-09-05T15:41:13Z","snapshot_observed_at":"2026-08-08T01:12:00.953493Z","submitted_at":"2025-07-31T13:56:41Z","title":"3D-MOOD: Lifting 2D to 3D for Monocular Open-Set Object Detection","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T10:42:01.050566Z"},"links":{"citing_paper":"/paper/2507.23567"},"observation_digest":"sha256:b84b5de5fcb0daad9089e436ef9cc7bc2613306ce7e47e5497e0b3d1ac1c891b","observation_id":"e35c48c4-8913-41eb-a42e-5fd3661ef217","resolution":{"observed_at":"2026-08-06T10:42:01.291569Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:42:01.279494Z","title":"Deep layer aggregation","venue":null,"work_id":"e3bf7e40-ced1-4ea2-8093-545680214ce7","year":2018},"citing_paper":{"arxiv_id":"2507.23567","last_updated":"2025-09-05T15:41:13Z","snapshot_observed_at":"2026-08-08T01:12:00.953493Z","submitted_at":"2025-07-31T13:56:41Z","title":"3D-MOOD: Lifting 2D to 3D for Monocular Open-Set Object Detection","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T10:42:01.052953Z"},"links":{"citing_paper":"/paper/2507.23567"},"observation_digest":"sha256:90e87fc69e7a40ee2a9f3ba148b3feac830a78e597409874539aef4bd163d980","observation_id":"c4e14899-8642-4a0a-9882-e7edf8b94145","resolution":{"observed_at":"2026-08-06T10:42:01.282217Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:42:01.269523Z","title":"Open-vocabulary detr with conditional matching","venue":null,"work_id":"35aaf3bc-af92-4f18-956d-a321c6128b47","year":2022},"citing_paper":{"arxiv_id":"2507.23567","last_updated":"2025-09-05T15:41:13Z","snapshot_observed_at":"2026-08-08T01:12:00.953493Z","submitted_at":"2025-07-31T13:56:41Z","title":"3D-MOOD: Lifting 2D to 3D for Monocular Open-Set Object Detection","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T10:42:01.055740Z"},"links":{"citing_paper":"/paper/2507.23567"},"observation_digest":"sha256:4a612d5b617a1c7ce2d5ac57e08f25ae7496e6484f7732bd237174f917badf4b","observation_id":"143c6077-e044-4317-bde8-f5f4786e205b","resolution":{"observed_at":"2026-08-06T10:42:01.273529Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:42:01.261154Z","title":"Open-vocabulary object detection using captions","venue":null,"work_id":"52bd7552-1dd4-4d91-b83d-a1f8c96f54fc","year":2021},"citing_paper":{"arxiv_id":"2507.23567","last_updated":"2025-09-05T15:41:13Z","snapshot_observed_at":"2026-08-08T01:12:00.953493Z","submitted_at":"2025-07-31T13:56:41Z","title":"3D-MOOD: Lifting 2D to 3D for Monocular Open-Set Object Detection","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T10:42:01.058147Z"},"links":{"citing_paper":"/paper/2507.23567"},"observation_digest":"sha256:dc9aa04e54365a93992eb413a1ec65e878028093b3331bc70fe85544511ced2f","observation_id":"097708ff-4bef-47d6-acea-caa0869dc95a","resolution":{"observed_at":"2026-08-06T10:42:01.264133Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.03605","last_updated":"2022-07-11T10:30:29Z","snapshot_observed_at":"2026-08-07T03:38:32.486362Z","submitted_at":"2022-03-07T18:55:26Z","title":"DINO: DETR with Improved DeNoising Anchor Boxes for End-to-End Object Detection","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.03605","snapshot_observed_at":"2026-08-06T10:42:01.060542Z","title":"Dino: Detr with improved denoising anchor boxes for end-to-end object detection.arXiv preprint arXiv:2203.03605, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.23567","last_updated":"2025-09-05T15:41:13Z","snapshot_observed_at":"2026-08-08T01:12:00.953493Z","submitted_at":"2025-07-31T13:56:41Z","title":"3D-MOOD: Lifting 2D to 3D for Monocular Open-Set Object Detection","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T10:42:01.060542Z"},"links":{"cited_paper":"/paper/2203.03605","citing_paper":"/paper/2507.23567"},"observation_digest":"sha256:175d16d9f9207a1fdefc497d45eb196902b458158e988ac815af332ca83ad754","observation_id":"2aedeeeb-25e1-420c-9dd8-8ac396735149","resolution":{"observed_at":"2026-08-06T10:42:01.060542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:42:01.252729Z","title":"Monodetr: Depth- guided transformer for monocular 3d object detection.ICCV 2023, 2022","venue":null,"work_id":"e9fc0ae4-5b62-4653-b4c2-15a8788bb3a8","year":2023},"citing_paper":{"arxiv_id":"2507.23567","last_updated":"2025-09-05T15:41:13Z","snapshot_observed_at":"2026-08-08T01:12:00.953493Z","submitted_at":"2025-07-31T13:56:41Z","title":"3D-MOOD: Lifting 2D to 3D for Monocular Open-Set Object Detection","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T10:42:01.063207Z"},"links":{"citing_paper":"/paper/2507.23567"},"observation_digest":"sha256:7f4dff97fe4367e8d5572eba1c7c3d71f6fc6fab350f544e4104e167ae7953dd","observation_id":"1d97dfcc-3f2e-4a20-8fe6-b239aa42e960","resolution":{"observed_at":"2026-08-06T10:42:01.255593Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02361","last_updated":"2024-01-05T06:21:19Z","snapshot_observed_at":"2026-08-09T12:00:25.208070Z","submitted_at":"2024-01-04T17:00:49Z","title":"An Open and Comprehensive Pipeline for Unified Object Grounding and Detection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02361","snapshot_observed_at":"2026-08-06T10:42:01.065564Z","title":"An open and com- prehensive pipeline for unified object grounding and detec- tion.arXiv preprint arXiv:2401.02361, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.23567","last_updated":"2025-09-05T15:41:13Z","snapshot_observed_at":"2026-08-08T01:12:00.953493Z","submitted_at":"2025-07-31T13:56:41Z","title":"3D-MOOD: Lifting 2D to 3D for Monocular Open-Set Object Detection","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T10:42:01.065564Z"},"links":{"cited_paper":"/paper/2401.02361","citing_paper":"/paper/2507.23567"},"observation_digest":"sha256:e0ac9992fa98f570a6dd8aff436b9fe5dae2579435a297867b14ee333efe4daf","observation_id":"45e8d754-781f-409c-999e-6debc3a739d7","resolution":{"observed_at":"2026-08-06T10:42:01.065564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:42:01.244453Z","title":"Does computer vision matter for action?Science Robotics, 4,","venue":null,"work_id":"cee4a538-d740-48b6-8570-501a925a9b4e","year":null},"citing_paper":{"arxiv_id":"2507.23567","last_updated":"2025-09-05T15:41:13Z","snapshot_observed_at":"2026-08-08T01:12:00.953493Z","submitted_at":"2025-07-31T13:56:41Z","title":"3D-MOOD: Lifting 2D to 3D for Monocular Open-Set Object Detection","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T10:42:01.068275Z"},"links":{"citing_paper":"/paper/2507.23567"},"observation_digest":"sha256:5023450bdcb08d751ea981255a11b33a3be607a66c5ec6381001ba80b532089a","observation_id":"bc2ffa97-94c4-4044-9451-5c8e514329b7","resolution":{"observed_at":"2026-08-06T10:42:01.247362Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:42:01.233996Z","title":"Detecting twenty-thousand classes using image-level supervision","venue":null,"work_id":"95952db5-f189-436e-b961-d4f0a31bc68b","year":2022},"citing_paper":{"arxiv_id":"2507.23567","last_updated":"2025-09-05T15:41:13Z","snapshot_observed_at":"2026-08-08T01:12:00.953493Z","submitted_at":"2025-07-31T13:56:41Z","title":"3D-MOOD: Lifting 2D to 3D for Monocular Open-Set Object Detection","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T10:42:01.070679Z"},"links":{"citing_paper":"/paper/2507.23567"},"observation_digest":"sha256:5ca82de90780c37d7c44fc929bed9b1852d64bd6b84a2ad2c2a637dc31416132","observation_id":"d6f695df-b653-40ec-9b11-4705960e95b3","resolution":{"observed_at":"2026-08-06T10:42:01.238701Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.04159","last_updated":"2021-03-18T03:14:26Z","snapshot_observed_at":"2026-07-06T10:02:45.105181Z","submitted_at":"2020-10-08T17:59:21Z","title":"Deformable DETR: Deformable Transformers for End-to-End Object Detection","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.04159","snapshot_observed_at":"2026-08-06T10:42:01.073080Z","title":"Deformable detr: Deformable trans- formers for end-to-end object detection.arXiv preprint arXiv:2010.04159, 2020","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2507.23567","last_updated":"2025-09-05T15:41:13Z","snapshot_observed_at":"2026-08-08T01:12:00.953493Z","submitted_at":"2025-07-31T13:56:41Z","title":"3D-MOOD: Lifting 2D to 3D for Monocular Open-Set Object Detection","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T10:42:01.073080Z"},"links":{"cited_paper":"/paper/2010.04159","citing_paper":"/paper/2507.23567"},"observation_digest":"sha256:816456d3679d31717bf33ae80c185cbe8aa3501d1f64cc2fe1832cd4bce9da28","observation_id":"8c89d1a0-db68-44e3-8f41-3926c9ddab0f","resolution":{"observed_at":"2026-08-06T10:42:01.073080Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.23567","last_updated":"2025-09-05T15:41:13Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T01:12:00.953493Z","submitted_at":"2025-07-31T13:56:41Z","title":"3D-MOOD: Lifting 2D to 3D for Monocular Open-Set Object Detection"},"reference_resolution":{"displayed":67,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":26,"verified_exact":0,"verified_fuzzy":40},"total_outbound_references":67},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 67 of 67 outbound references and 3 inbound Pith citation observations for arXiv:2507.23567."}