{"as_of":"2026-08-22T14:47:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6301bf04db6df8648068e3074b217c10d967e7f5eec7d7f652d99a071ffea025","coverage":[{"denominator":90,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":90,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T22:42:54.362361Z","state":"measured"},{"denominator":90,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":90,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.09147/citation-record","integrity":"/paper/2608.09147/integrity","json":"/paper/2608.09147/citation-record.json","paper":"/paper/2608.09147"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-08-17T13:26:10.378579Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-11T22:42:52.373661Z","title":"Qwen3-vl technical report.arXiv preprint arXiv:2511.21631,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-21T03:43:29.657744Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:52.373661Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:2b5b2b8d0b6042f64e7be17297b1a204bb34b127c41a56145542f7bc0a63d891","observation_id":"78187b37-94e9-4dd8-b4af-ff1488dd0a7c","resolution":{"observed_at":"2026-08-11T22:42:52.373661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-21T16:02:41.546193Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-11T22:42:52.454808Z","title":"Qwen2.5-vl technical report.arXiv preprint arXiv:2502.13923,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-21T03:43:29.657744Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:52.454808Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:6124bd8e449703b432969956532306154e4aa7f19c44fe6245b5a4f73d147e99","observation_id":"a7ac1406-829b-40fc-b1e9-169ad44954c1","resolution":{"observed_at":"2026-08-11T22:42:52.454808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:52.504746Z","title":"Omni3d: A large benchmark and model for 3D object detection in the wild","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-21T03:43:29.657744Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:52.504746Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:0c7a0210ac18150ad1bf7501665d2eebdf40d40d6181e406d980902b327cee4b","observation_id":"c3ad01e8-def6-4e6c-8e24-bc721f91da91","resolution":{"observed_at":"2026-08-11T22:42:52.504746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:52.554749Z","title":"M3D-RPN: Monocular 3D region proposal network for object detection","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-21T03:43:29.657744Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:52.554749Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:39d2cd282d52b9c7c9865474cb934f0c615a6d37f292f0eabb7e537929d6dae1","observation_id":"90a70e41-f54d-47b9-98c3-3f3cd25b3930","resolution":{"observed_at":"2026-08-11T22:42:52.554749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:52.604817Z","title":"Kinematic 3d object detection in monocular video","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-21T03:43:29.657744Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:52.604817Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:27675a64b578b7f197dd7d67c941f2f0ed1988c3b7882ffb6ed86f16f4ebc1c4","observation_id":"3ce193aa-cddf-4f74-8175-91e0ac7532a8","resolution":{"observed_at":"2026-08-11T22:42:52.604817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:52.654732Z","title":"nuscenes: A multimodal dataset for autonomous driving","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-21T03:43:29.657744Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:52.654732Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:3579387de6d960258b0535ca96e5408d4f4a96ab36b00e76f1ac585e4391e1d1","observation_id":"3f1303ee-8007-4af9-bfb5-4c4363cff98c","resolution":{"observed_at":"2026-08-11T22:42:52.654732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:52.724730Z","title":"Vip-llava: Making large multimodal models understand arbitrary visual prompts","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-21T03:43:29.657744Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:52.724730Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:a79a84388feaf9bd6c1396acb486dd2168592a55be21247eb526d1c749c5d4fc","observation_id":"24e6dcf1-8213-4c00-8286-fc3476ad42fc","resolution":{"observed_at":"2026-08-11T22:42:52.724730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:52.793808Z","title":"End-to-end object detection with transformers","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-21T03:43:29.657744Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:52.793808Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:826a2eb8b6356f184806c4463cc67461c0671f00f68a48532ed66e3053daf510","observation_id":"5e130e7f-2d26-456c-baa8-617872a5d2ca","resolution":{"observed_at":"2026-08-11T22:42:52.793808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:52.824736Z","title":"Spatialvlm: Endowing vision-language models with spatial reasoning capabilities","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-21T03:43:29.657744Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:52.824736Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:a3900eac1f4fc3b0293b468bea292e995890a3a743d702a97829cb3be3800d0a","observation_id":"83832680-966a-4a5f-8c4e-db20adbe28da","resolution":{"observed_at":"2026-08-11T22:42:52.824736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:52.874733Z","title":"End-to-end autonomous driving: Challenges and frontiers.TPAMI, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-21T03:43:29.657744Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:52.874733Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:409d43b7971cdd33de41470270d65f4ff32c64e9d3637215bf0a50da7d7ce741","observation_id":"e6c6e7a1-3ae5-4715-be06-b98e34dc481e","resolution":{"observed_at":"2026-08-11T22:42:52.874733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:52.944744Z","title":"Group detr: Fast detr training with group-wise one-to-many assignment","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-21T03:43:29.657744Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:52.944744Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:49d997ded9300d2d4c4a720cf48a35407bc4be3096c4d4ad2a3599c6aad983c8","observation_id":"8330c96b-fc03-4c7e-9145-d3301ba91440","resolution":{"observed_at":"2026-08-11T22:42:52.944744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:57.693459Z","title":"Monocular 3D object detection for autonomous driving","venue":null,"work_id":"53deaa95-ddf7-4e9e-a61e-c3f2e60f348b","year":2016},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-21T03:43:29.657744Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:52.981681Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:16cc12cbebfb525a8c60f911af0d23cdd4972f6db9a9eab7272974a857852dd6","observation_id":"e2417d19-70ef-4c87-bf52-e655c967885d","resolution":{"observed_at":"2026-08-11T22:42:57.700479Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:57.666160Z","title":"Spatialrgpt: Grounded spatial reasoning in vision-language models","venue":null,"work_id":"7638e62e-932b-43d2-8295-cd6ac0d5c7e5","year":2024},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-21T03:43:29.657744Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:52.986671Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:a4042dc19dc7b5569b8927c5a922ceeef7d74fdbf02ce6cc0faec3ac242c5334","observation_id":"dd181c65-09b5-4bea-b858-2538d2300357","resolution":{"observed_at":"2026-08-11T22:42:57.674561Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20279","snapshot_observed_at":"2026-08-11T22:42:53.000772Z","title":"Vlm-3r: Vision-language models augmented with instruction-aligned 3d reconstruction.arXiv preprint arXiv:2505.20279, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-21T03:43:29.657744Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:53.000772Z"},"links":{"cited_paper":"/paper/2505.20279","citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:383c0c88e158f01aed2097b8fff1a3fcd3876b81bef4010958078e5b8db4b6d5","observation_id":"0c82e4ce-98f5-4ea0-a26e-f96ecbe88d26","resolution":{"observed_at":"2026-08-11T22:42:53.000772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:57.643468Z","title":"Are we ready for autonomous driving? the kitti vision benchmark suite","venue":null,"work_id":"f4f9de22-bcdf-4046-82af-bc97dbcd5a4c","year":2012},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-21T03:43:29.657744Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:53.005052Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:56d6853e4c576c16e02eee9abf69c2a33033e80c6a01c01abd6185caf2fcb391","observation_id":"a4f199b9-b3b4-4dc8-a599-45da86db1309","resolution":{"observed_at":"2026-08-11T22:42:57.649205Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:57.613800Z","title":"Omni-rgpt: Unifying image and video region-level understanding via token marks","venue":null,"work_id":"22d6f0c4-2201-417f-95e4-c4a0388540be","year":2025},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-21T03:43:29.657744Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:53.010574Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:57f3a2ace018dd03994a9c7d298849ffb586c79bf40d9a43a28246e0205a317a","observation_id":"2841caaf-7f15-4478-9468-6ef4ea17803c","resolution":{"observed_at":"2026-08-11T22:42:57.628430Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:57.593252Z","title":"3d-llm: Injecting the 3d world into large language models.NeurIPS, 2023","venue":null,"work_id":"170ac61c-dcd4-4db3-812a-aa40b1340495","year":2023},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-21T03:43:29.657744Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:53.073375Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:5b2587438a6415e105b1202aa521e620484103899de98f9026d05cf1c19c47b5","observation_id":"522112df-aa3b-401d-8aee-8c89481b5409","resolution":{"observed_at":"2026-08-11T22:42:57.599219Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:53.174829Z","title":"G 2vlm: Geometry grounded vision language model with unified 3d reconstruction and spatial reasoning.arXiv preprint arXiv:2511.21688, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-21T03:43:29.657744Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:53.174829Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:274414104cfd51eb159bcc2fedf546148282c6d55c1e682838d415c0e258c16b","observation_id":"3881e149-4a7e-4de0-a851-8ce5edee5fcc","resolution":{"observed_at":"2026-08-11T22:42:53.174829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:57.573344Z","title":"Monodtr: Monocular 3D object detection with depth-aware transformer","venue":null,"work_id":"7887bb73-37fb-4951-9d1b-7077b9626043","year":2022},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-21T03:43:29.657744Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:53.262321Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:5303da9cb3d22f915e09cf5a86d0f35d6358f54c9a07e56e7010ad004edf6a6c","observation_id":"18419ca6-7380-4cf1-aff1-ad51f31b019a","resolution":{"observed_at":"2026-08-11T22:42:57.579065Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.23478","last_updated":"2025-07-31T11:59:06Z","snapshot_observed_at":"2026-08-21T10:38:58.404819Z","submitted_at":"2025-07-31T11:59:06Z","title":"3D-R1: Enhancing Reasoning in 3D VLMs for Unified Scene Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.23478","snapshot_observed_at":"2026-08-11T22:42:53.308959Z","title":"3d-r1: Enhancing reasoning in 3d vlms for unified scene understanding.arXiv preprint arXiv:2507.23478, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-21T03:43:29.657744Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:53.308959Z"},"links":{"cited_paper":"/paper/2507.23478","citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:208ff2f3035b046dfb0ca02e49dbb74091255cba619b8f74ebb08aabd82316a9","observation_id":"08e3fa61-7058-4d04-8939-88d2ac4f9c22","resolution":{"observed_at":"2026-08-11T22:42:53.308959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06749","last_updated":"2026-02-28T21:10:52Z","snapshot_observed_at":"2026-08-16T02:03:48.252223Z","submitted_at":"2025-03-09T20:06:45Z","title":"Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06749","snapshot_observed_at":"2026-08-11T22:42:53.321616Z","title":"Vision-r1: Incentivizing reasoning capability in multimodal large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-21T03:43:29.657744Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:53.321616Z"},"links":{"cited_paper":"/paper/2503.06749","citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:38bbc4b9c8b3f3ac63b7890853ae85a7ae5cb63addd7ab94dd8b8df033221a21","observation_id":"9b3aeba7-04ee-4f29-902a-354be8ffe679","resolution":{"observed_at":"2026-08-11T22:42:53.321616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:57.518162Z","title":"MonoMAE: Enhancing monocular 3D detection through depth-aware masked autoencoders","venue":null,"work_id":"8c599833-333b-4d3a-89c2-df25688ba47b","year":2024},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-21T03:43:29.657744Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:53.327359Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:0c873eb0ae9da18452f3506bfa91a2bc679cb765632f6eb64a3f957776cd5e65","observation_id":"e7904973-73c8-45a1-89f2-b77e58085ba8","resolution":{"observed_at":"2026-08-11T22:42:57.526359Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-08-16T21:53:14.144225Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-11T22:42:53.333231Z","title":"Openvla: An open-source vision-language-action model.arXiv preprint arXiv:2406.09246, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-21T03:43:29.657744Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:53.333231Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:50fcb60c11d2c4bd6e7acd06dd191e1c1995ab0ad798467fb8394b855ff41ee6","observation_id":"6a05925d-86a8-43d2-a165-6ff18efb440a","resolution":{"observed_at":"2026-08-11T22:42:53.333231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:57.475017Z","title":"Deviant: Depth equivariant network for monocular 3D object detection","venue":null,"work_id":"aa8a5e85-df34-43e8-a7e0-26fd2907992f","year":2022},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-21T03:43:29.657744Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:53.342029Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:0b07a57c4a299da6b5756c15648f5a6257a3db679a9c4eaaa5fa4c58caaaf8fb","observation_id":"854d2589-ba1f-4f56-8e6f-747c5a5ef5cb","resolution":{"observed_at":"2026-08-11T22:42:57.481595Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:57.366894Z","title":"GrooMeD-NMS: Grouped mathematically differen- tiable nms for monocular 3D object detection","venue":null,"work_id":"387ea8d9-b1be-4852-9da0-e0f9883b8cdd","year":2021},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-21T03:43:29.657744Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:53.346486Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:970f4ac7cecce36708e530f2b518fec08f993a220f59a09b1b4aca13eead2e2e","observation_id":"2fb6ed6b-45af-4bfa-8ef9-154926dcb3a3","resolution":{"observed_at":"2026-08-11T22:42:57.384023Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:53.356112Z","title":"Lisa: Reasoning segmentation via large language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-21T03:43:29.657744Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:53.356112Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:5b3d5f10fa3e2578ea84e5e28f794e553fe1c65da4da397c143ec43b621ccd68","observation_id":"e6c1ab68-4aab-4800-bec9-de66a139910f","resolution":{"observed_at":"2026-08-11T22:42:53.356112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:53.377319Z","title":"Spatial forcing: Implicit spatial representation alignment for vision-language-action model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-21T03:43:29.657744Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:53.377319Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:db6369e0c5f8d2b3f1f68128d62e892134600be273b1f3abc89d8f94004013d7","observation_id":"18000c34-1f1c-4aa3-bfdd-8bcec243e38f","resolution":{"observed_at":"2026-08-11T22:42:53.377319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:57.322317Z","title":"Diversity matters: Fully exploiting depth clues for reliable monocular 3D object detection","venue":null,"work_id":"bb33fa3f-9f6a-4487-9b97-6eb6a6091e03","year":2022},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-21T03:43:29.657744Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:53.384759Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:4f1af9e2aa4414f9c5a98275eb708dd43f49681a4e7708f75ba4dc2ea4239616","observation_id":"cba93358-baad-4f5c-83e3-dfc086a59282","resolution":{"observed_at":"2026-08-11T22:42:57.330239Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:57.273522Z","title":"Unimode: Unified monocular 3d object detection","venue":null,"work_id":"82ae9cf0-9f51-4ccf-9bd6-941c7d697c61","year":2024},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-21T03:43:29.657744Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:53.408946Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:7dd19ebe71ffe19c6ddcb4e2f71c9726f794b9d22d9cf1f7e401fb30801326af","observation_id":"119f86c7-41cd-4bff-8152-1b4cccf1686d","resolution":{"observed_at":"2026-08-11T22:42:57.280631Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20271","last_updated":"2025-02-22T14:02:39Z","snapshot_observed_at":"2026-08-17T12:09:40.331965Z","submitted_at":"2024-03-29T16:26:20Z","title":"Draw-and-Understand: Leveraging Visual Prompts to Enable MLLMs to Comprehend What You Want","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.20271","snapshot_observed_at":"2026-08-11T22:42:53.434907Z","title":"Draw-and-understand: Leveraging visual prompts to enable mllms to comprehend what you want.arXiv preprint arXiv:2403.20271, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-21T03:43:29.657744Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:53.434907Z"},"links":{"cited_paper":"/paper/2403.20271","citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:162fe4b672a81f19c3d2cfbb01abca6900e20277835fc7140549e20800ab13a7","observation_id":"8fa1b647-66f7-4b60-a412-b5f0b4ff52c9","resolution":{"observed_at":"2026-08-11T22:42:53.434907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:57.235169Z","title":"Monotakd: Teaching assistant knowledge distillation for monocular 3d object detection","venue":null,"work_id":"d1aa8796-edb2-4f28-8b44-dce20d0946c9","year":2025},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-21T03:43:29.657744Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:53.458216Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:7aeb4a412483f7ce0f38032548320d999fa27cc0d4221572c3b56777be414d55","observation_id":"9f483add-fae9-40b5-a7c2-0fd6e8f13984","resolution":{"observed_at":"2026-08-11T22:42:57.240456Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:57.187309Z","title":"Edge assisted real-time object detection for mobile augmented reality","venue":null,"work_id":"9783dd33-56f2-41e3-9fe6-d0f2627707e0","year":2019},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-21T03:43:29.657744Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:53.467345Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:92184964aa78cdaffcc34252eaf1233cc05ff62c0f7f36c6a0ed8d5146b89014","observation_id":"eabbbc06-55f9-49f3-8c57-32305fff15f0","resolution":{"observed_at":"2026-08-11T22:42:57.200955Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.05499","last_updated":"2024-07-19T06:00:41Z","snapshot_observed_at":"2026-08-19T16:02:58.628969Z","submitted_at":"2023-03-09T18:52:16Z","title":"Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.05499","snapshot_observed_at":"2026-08-11T22:42:53.483168Z","title":"Grounding dino: Marrying dino with grounded pre-training for open-set object detection.arXiv preprint arXiv:2303.05499, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-21T03:43:29.657744Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:53.483168Z"},"links":{"cited_paper":"/paper/2303.05499","citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:12e155ecaad9f9df5c65e5aeb4a06eea1dc845a89bc8f7f0d93f5c065228bb86","observation_id":"b0bc0143-b102-4693-8248-9b421bbfada8","resolution":{"observed_at":"2026-08-11T22:42:53.483168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:57.144764Z","title":"Monocular 3D object detection with bounding box denoising in 3D by perceiver","venue":null,"work_id":"a90f10f9-40e5-4c61-bf2a-5102f206c9f8","year":2023},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-21T03:43:29.657744Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:53.495442Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:aebf8ebeb67d32fd7cc53273d69e2981a736afb0ce8ed8cbc7fdbd2e7a6d8ade","observation_id":"2a606330-b530-4f66-8ae2-80de9a39a6b7","resolution":{"observed_at":"2026-08-11T22:42:57.151658Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:57.070519Z","title":"SMOKE: Single-stage monocular 3D object detection via keypoint estimation","venue":null,"work_id":"062d240d-6c17-4cf6-9420-b994d60ff0df","year":2020},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-21T03:43:29.657744Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:53.509612Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:0d0a9fca0676d92d12aacac5fae45a0dbd6314c5929328fe509467f90385a5f4","observation_id":"7da3dcbf-0e6a-4bdc-9567-7f86343cfc96","resolution":{"observed_at":"2026-08-11T22:42:57.090921Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:57.040480Z","title":"Geometry uncertainty projection network for monocular 3D object detection","venue":null,"work_id":"9ece853e-6811-44d6-9918-49b8559ff764","year":2021},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-21T03:43:29.657744Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:53.545831Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:ed243e8025908c99f4a80fc9a560c73837bf1785920230f16858dec1d53507d6","observation_id":"879ac075-af12-42e5-bac9-025c6a08f40f","resolution":{"observed_at":"2026-08-11T22:42:57.045583Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:56.998502Z","title":"Delving into localization errors for monocular 3D object detection","venue":null,"work_id":"1f9f7c5a-fbcd-4b7b-a5bc-f83a57efad57","year":2021},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-21T03:43:29.657744Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:53.561955Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:f0461b55b86253d2234292214561858eaafe49694d04e76f1936167e90f2ed7b","observation_id":"aec03b03-f803-4a25-b210-5627b9eb3029","resolution":{"observed_at":"2026-08-11T22:42:57.008203Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:56.964094Z","title":"Spatiallm: Training large language models for structured indoor modeling","venue":null,"work_id":"3bd21451-5a35-4bf3-917d-461719cf8ff6","year":2025},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-21T03:43:29.657744Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:53.577772Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:aeb3e25377faf38dc0afead2a6ccbd140976d8e286f2bd094752470f3a0bf7fb","observation_id":"ee06c864-b72f-4a19-9421-5aadf4f8dd37","resolution":{"observed_at":"2026-08-11T22:42:56.972882Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:56.921993Z","title":"3D bounding box estimation using deep learning and geometry","venue":null,"work_id":"49f25326-3756-4091-b4d7-dda9c2d0d99f","year":2017},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-21T03:43:29.657744Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:53.606345Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:5066de247ec9ff57f2a230a55d76b29854156a37670841e43bf82f547ae0eeb2","observation_id":"de0e65f4-6035-4210-bfc4-513c3c0464cf","resolution":{"observed_at":"2026-08-11T22:42:56.930618Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-17T13:03:40.359628Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-11T22:42:53.654995Z","title":"Dinov2: Learning robust visual features without supervision.arXiv preprint arXiv:2304.07193, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-21T03:43:29.657744Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:53.654995Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:ee0d0b1f99ed47a1a69f7ab774f213f515bc749d180f9d96d723447cf1548335","observation_id":"d2edd1d2-f4b0-4ee1-a4aa-9b64798b99b1","resolution":{"observed_at":"2026-08-11T22:42:53.654995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:56.877266Z","title":"Learning occupancy for monocular 3D object detection","venue":null,"work_id":"87d53ef9-f731-45c7-8b47-7b48beb42e18","year":2024},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-21T03:43:29.657744Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:53.681356Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:dfc5e9747945add5c4bf848000922c4fb38c57a93127079c4d3a06cb1147b9ed","observation_id":"4efcfa78-7ee7-4a20-a2dc-9449d139d4b3","resolution":{"observed_at":"2026-08-11T22:42:56.883468Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:56.842481Z","title":"UniDepthV2: Universal monocular metric depth estimation made simpler, 2025","venue":null,"work_id":"58b7bd4d-ea6b-46f2-8abc-70d762296fca","year":2025},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-21T03:43:29.657744Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:53.704564Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:cd2d80656f430b29692de1bdd47ac746da66d7f13f74e7314dae3a23b20d3946","observation_id":"e5878834-c7d7-4dae-b050-5a6e29c0a0e9","resolution":{"observed_at":"2026-08-11T22:42:56.861742Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.19590","last_updated":"2025-03-12T14:48:22Z","snapshot_observed_at":"2026-08-19T13:03:54.316588Z","submitted_at":"2024-10-25T14:31:43Z","title":"MonoDGP: Monocular 3D Object Detection with Decoupled-Query and Geometry-Error Priors","version":2},"cited_work":{"arxiv_id":"2410.19590","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.19590","snapshot_observed_at":"2026-08-11T22:42:54.768803Z","title":"MonoDGP: Monocular 3D Object Detection with Decoupled-Query and Geometry-Error Priors","venue":"cs.CV","work_id":"e038c34b-bed2-45e4-acdf-e4718286267e","year":2024},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-21T03:43:29.657744Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:53.714226Z"},"links":{"cited_paper":"/paper/2410.19590","citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:16e43dc9ce5261f16046c2ab098558494a4bb838bc43059d14155dd3b83854a4","observation_id":"953e5b24-f537-4c0e-aaec-96d8beb345df","resolution":{"observed_at":"2026-08-11T22:42:54.776140Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:56.796917Z","title":"Monoground: Detecting monocular 3D objects from the ground","venue":null,"work_id":"09f07486-498a-4e8c-9350-bb0c16c12acd","year":2022},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-21T03:43:29.657744Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:53.727980Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:554e2bc5bcb321fcc15851dd2c5c5e1d2f21ddb00324e178c9ed996f4f1a7ee8","observation_id":"1ea534cc-fa1d-4cfd-94df-c0252b11ad62","resolution":{"observed_at":"2026-08-11T22:42:56.804138Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:56.738798Z","title":"Loc3r-vlm: Language- based localization and 3d reasoning with vision-language models, 2026","venue":null,"work_id":"f38e518e-6522-4ab2-8175-d6d8a527d38d","year":2026},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-21T03:43:29.657744Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:53.745953Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:49ee18541995cdc337a58aa3d074cde61aca0405feb75913a746ac2ac901c0ac","observation_id":"16df908f-e0ad-450b-939a-d13e814696af","resolution":{"observed_at":"2026-08-11T22:42:56.756753Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-08-14T23:38:19.973422Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-08-11T22:42:53.802940Z","title":"Vlm-r1: A stable and generalizable r1-style large vision-language model.arXiv preprint arXiv:2504.07615, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-21T03:43:29.657744Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:53.802940Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:91f47efa8aa976a85fcbd1ca290ebd04808d2b9a3f99fc874360a7e2e2cb6d18","observation_id":"bca78183-3112-4a8d-96c9-4d8e2608b023","resolution":{"observed_at":"2026-08-11T22:42:53.802940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:56.706981Z","title":"PointRCNN: 3D object proposal generation and detection from point cloud","venue":null,"work_id":"142f456f-36a6-47b8-9023-b404f63ccc38","year":2019},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-21T03:43:29.657744Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:53.841145Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:05435cac6a1923c519095a80dc59d48e52d18317a911207f4cab05e449ba0f53","observation_id":"7b3fb06e-6f17-4803-91ac-a99841a826c4","resolution":{"observed_at":"2026-08-11T22:42:56.712804Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:56.680900Z","title":"Geometry- based distance decomposition for monocular 3D object detection","venue":null,"work_id":"274f3a1f-7981-48ff-8df9-3a8261a5e840","year":2021},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-21T03:43:29.657744Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:53.871820Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:56654eab07bb616477be4862759fe27fdb5a4708ee3387954a8c030f5c431df1","observation_id":"3cd6c1ee-10c7-48bc-846a-b76ec98288cb","resolution":{"observed_at":"2026-08-11T22:42:56.689327Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:56.659983Z","title":"Geometry- based distance decomposition for monocular 3D object detection","venue":null,"work_id":"21f0ce94-1f7e-4023-ab96-274cc703d175","year":2021},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-21T03:43:29.657744Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:53.909511Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:91722253a2a74dd98c8d11b3db0dafc577d2ed170433a7579498e0aa9cebbcdb","observation_id":"2d0e8530-136e-49d9-bc0b-c832c3f409d0","resolution":{"observed_at":"2026-08-11T22:42:56.664185Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:56.581714Z","title":"What does clip know about a red circle? visual prompt engineering for vlms","venue":null,"work_id":"4371556c-fba6-4463-9d1d-ccdff8828f95","year":2023},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-21T03:43:29.657744Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:53.919487Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:d5915e3cd915448d54da4e0ce230907832ac694fb46de695a63e1782fe79e284","observation_id":"3736ae73-b70a-4964-976f-10b93280fe06","resolution":{"observed_at":"2026-08-11T22:42:56.625339Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-08-20T09:51:02.717471Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-11T22:42:53.929902Z","title":"Eva-clip: Improved training techniques for clip at scale.arXiv preprint arXiv:2303.15389, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-21T03:43:29.657744Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:53.929902Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:ef9d9bb6cf01b643b83f2b3d283138e9ef0d8ab039438c46654d8ff8cdb080ef","observation_id":"5d14ff63-74d3-463f-8b45-db1aa07dab8e","resolution":{"observed_at":"2026-08-11T22:42:53.929902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:56.526678Z","title":"Cambrian-1: A fully open, vision-centric exploration of multimodal llms, 2024","venue":null,"work_id":"b58b3ec9-1ca0-4b1e-abf4-ec777114c690","year":2024},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-21T03:43:29.657744Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:53.936623Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:9ce3e7ccfdbccc08513834d0b8f76f0cde43dcda8db5f80becc922401693b7af","observation_id":"a94ea378-f03e-426e-a421-ac98d58523bf","resolution":{"observed_at":"2026-08-11T22:42:56.533136Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:56.500547Z","title":"Vggt: Visual geometry grounded transformer","venue":null,"work_id":"7921e40e-3b23-44eb-b405-a69eef9f90db","year":2025},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-21T03:43:29.657744Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:53.942526Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:a3bec5e932467c7e9f56a8283c959fb6223dcf03fc7988cff4abfcc3f5569d88","observation_id":"fdf1289f-5f3e-4688-a90a-bdd4fcf1a7a2","resolution":{"observed_at":"2026-08-11T22:42:56.510886Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-11T22:42:53.951768Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution.arXiv preprint arXiv:2409.12191, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-21T03:43:29.657744Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:53.951768Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:dcdc8aa8b486306d128cb1bceca0436207c136e99179a5e41be2ece66e461c8d","observation_id":"9ca04145-97e4-400f-a4e4-0db12d266f7e","resolution":{"observed_at":"2026-08-11T22:42:53.951768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:56.398112Z","title":"Moge-2: Accurate monocular geometry with metric scale and sharp details","venue":null,"work_id":"0dff7c13-57ca-44e5-accd-cc64b57895b5","year":2025},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-21T03:43:29.657744Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:53.974741Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:8a45d2483456156efcaa8d731f63b8795ae28390af871fe30b7d0d1df0fafd60","observation_id":"464d571d-5e91-490f-9035-36f154fe330c","resolution":{"observed_at":"2026-08-11T22:42:56.424408Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:56.333857Z","title":"Embodiedscan: A holistic multi-modal 3d perception suite towards embodied ai","venue":null,"work_id":"fd978d9f-1ce0-49be-8374-cf6fbe97b718","year":2024},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-21T03:43:29.657744Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:54.004744Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:f4dc4b3b861a691a27121ef3ba98ac40264c49811123944d5531d0bba58b6230","observation_id":"264621be-d8a0-4199-98c3-3d909f425a0a","resolution":{"observed_at":"2026-08-11T22:42:56.341262Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:56.262445Z","title":"Probabilistic and geometric depth: Detecting objects in perspective","venue":null,"work_id":"bcfe1592-dfb0-4640-895f-10e2bb6478cf","year":2022},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-21T03:43:29.657744Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:54.064754Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:43171c8f7b48bb4221b8ec6a3907f687f117d06ef27a847465de9d62a17817a5","observation_id":"cdecedf8-bf46-43f3-92fe-1aefe629245a","resolution":{"observed_at":"2026-08-11T22:42:56.294761Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:54.081262Z","title":"N3d-vlm: Native 3d grounding enables accurate spatial reasoning in vision-language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-21T03:43:29.657744Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:54.081262Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:31b94be32236d042496e05225296dbf1edd83b38a2f1f06c951d7898b4a0a3e2","observation_id":"e19fcf69-9e6f-48f5-851e-8e80b33591d3","resolution":{"observed_at":"2026-08-11T22:42:54.081262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:56.189791Z","title":"Ov-uni3detr: Towards unified open-vocabulary 3d object detection via cycle-modality propagation","venue":null,"work_id":"9df83b67-954b-4cf2-9bfa-b5fcbb099c9d","year":2024},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-21T03:43:29.657744Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:54.091079Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:53a4890a9a522222468ca2cbff64d4fd215e3920bd252212a20096792b1ec04f","observation_id":"46524032-23a2-4784-bae8-7f75f1d48cda","resolution":{"observed_at":"2026-08-11T22:42:56.224751Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:56.145791Z","title":"Monopgc: Monocular 3D object detection with pixel geometry contexts","venue":null,"work_id":"9d3f6363-8e9f-4e63-bf4b-65df1de8de1f","year":2023},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-21T03:43:29.657744Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:54.103917Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:f6a93a59dc8640ea0edba898a3247d4cd0ec0e4912f2967a00ccc6fa1c403323","observation_id":"280fb01e-b9ca-4d1e-8300-ce9f1f413955","resolution":{"observed_at":"2026-08-11T22:42:56.164805Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:56.104751Z","title":"FD3D: Exploiting foreground depth map for feature-supervised monocular 3D object detection","venue":null,"work_id":"672ff012-317e-408e-9185-a735bb0f0062","year":2024},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-21T03:43:29.657744Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:54.109578Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:6ebfa81d02a573e9d6e90d8f2f4a0647928b91d38cf049b77a12d49d5adf51cd","observation_id":"5480dcd5-e064-4aa8-9866-feecab4c74cf","resolution":{"observed_at":"2026-08-11T22:42:56.128861Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:56.027203Z","title":"Pointllm: Empower- ing large language models to understand point clouds","venue":null,"work_id":"f88606f2-a3be-4a77-a577-659fd00cbb9b","year":2024},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-21T03:43:29.657744Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:54.114238Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:e3d01c224f90053aa1628289cfc6e086cff12e3bac490e8210d3a4071b26e13b","observation_id":"8f9e0e7d-8bea-491f-939f-0d4de752dd4a","resolution":{"observed_at":"2026-08-11T22:42:56.036818Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:55.997164Z","title":"MonoCD: Monocular 3D object detection with complementary depths","venue":null,"work_id":"abff904b-af99-4188-b9ed-7efc1c70f486","year":2024},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-21T03:43:29.657744Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:54.127214Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:2e2c9895b2b983388708b803c15ef1fdb8d07b34fcb47a57bf2f8da969ff2f13","observation_id":"c64dd527-500d-4641-88e4-5c8dc94b5f5f","resolution":{"observed_at":"2026-08-11T22:42:56.008213Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-11T22:42:54.139970Z","title":"Qwen3 technical report.arXiv preprint arXiv:2505.09388,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-21T03:43:29.657744Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:54.139970Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:0e34adec3f39dd747a045a864e0ac6abab42de7a406a8fa558d9a6360763f9ee","observation_id":"86720c4b-872d-48b3-8306-8fab8ba7e1a6","resolution":{"observed_at":"2026-08-11T22:42:54.139970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11441","last_updated":"2023-11-06T07:39:49Z","snapshot_observed_at":"2026-08-12T21:25:32.312122Z","submitted_at":"2023-10-17T17:51:31Z","title":"Set-of-Mark Prompting Unleashes Extraordinary Visual Grounding in GPT-4V","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11441","snapshot_observed_at":"2026-08-11T22:42:54.156474Z","title":"Set-of-mark prompting unleashes extraordinary visual grounding in gpt-4v.arXiv preprint arXiv:2310.11441, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-21T03:43:29.657744Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:54.156474Z"},"links":{"cited_paper":"/paper/2310.11441","citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:cfef536cba5c521563399926d84914b130b5406060e7538382dbec9e68187a6b","observation_id":"666854ce-4354-4e33-9547-1adc3248a3a9","resolution":{"observed_at":"2026-08-11T22:42:54.156474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.17240","last_updated":"2024-01-22T06:53:23Z","snapshot_observed_at":"2026-08-20T16:03:44.934037Z","submitted_at":"2023-12-28T18:58:33Z","title":"LISA++: An Improved Baseline for Reasoning Segmentation with Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.17240","snapshot_observed_at":"2026-08-11T22:42:54.163754Z","title":"Lisa++: An improved baseline for reasoning segmentation with large language model.arXiv preprint arXiv:2312.17240,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-21T03:43:29.657744Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:54.163754Z"},"links":{"cited_paper":"/paper/2312.17240","citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:5b4b185c8207ac0ddb6c89fcd751d5f05aa699dc9b182de4306adc11330e520a","observation_id":"a210ecc5-89bc-4640-b532-515336f80c78","resolution":{"observed_at":"2026-08-11T22:42:54.163754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:55.934810Z","title":"3d-mood: Lifting 2d to 3d for monocular open-set object detection","venue":null,"work_id":"c276847e-b446-41d9-b8a7-45a09090e4e9","year":null},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-21T03:43:29.657744Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:54.177913Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:9090c8bba2015a77e2d3a07c1abc82d568c86b180a19067e0d3b2afce93f59b5","observation_id":"b6e47b97-ee27-49f9-906d-13d45745190f","resolution":{"observed_at":"2026-08-11T22:42:55.945609Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:55.857585Z","title":"Open vocabulary monocular 3d object detection","venue":null,"work_id":"41f623d5-c275-46ba-9f25-b4e81c2ceba9","year":2026},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-21T03:43:29.657744Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:54.186433Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:5e438796122c5a109ff057ba9cd449bf716454f3960da68e549f535b8aab1c72","observation_id":"caaacff0-c253-4a51-aff0-1cb35087c041","resolution":{"observed_at":"2026-08-11T22:42:55.884809Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:55.781594Z","title":"Dwyer, and Zezhou Cheng","venue":null,"work_id":"d3dc9cc9-fead-410e-bfe0-72d463aad48c","year":2025},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-21T03:43:29.657744Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:54.191594Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:a70bbe6c6312b3a68ad70265ac7761d2e91892cd349faa1e18e1ee9065a3071d","observation_id":"a4526452-68b2-42d3-989d-a256912ba07c","resolution":{"observed_at":"2026-08-11T22:42:55.786661Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:55.761230Z","title":"Center-based 3D object detection and tracking","venue":null,"work_id":"f9aa6936-b6e6-49ff-a1be-ea6db6c6bec2","year":2021},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-21T03:43:29.657744Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:54.197268Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:55d7a872512a147c7b83297279246a900d9c5f29683e1bc76d40e999130af6a0","observation_id":"bae92556-470c-47af-b0b5-9125361f0e94","resolution":{"observed_at":"2026-08-11T22:42:55.767320Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:55.738617Z","title":"Videorefer suite: Advancing spatial-temporal object understanding with video llm","venue":null,"work_id":"32e50ea0-8b45-4226-acb1-7d01a66a6b7c","year":2025},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-21T03:43:29.657744Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:54.217735Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:f35ea5a1daae7bfb6f300a7600b82d0fa10ec610d0209d909bdd41b9c8aece36","observation_id":"f71b29e5-d9df-4b87-922b-94e788bf33e9","resolution":{"observed_at":"2026-08-11T22:42:55.745716Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:54.233876Z","title":"Detect anything 3d in the wild.arXiv preprint arXiv:2504.07958, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-21T03:43:29.657744Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:54.233876Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:c89968463932cd91301fcdc769f632c9e9fec22d7b2c8a37421e375523e31142","observation_id":"265460b4-e427-4e2b-bb7b-22a006fc1663","resolution":{"observed_at":"2026-08-11T22:42:54.233876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:55.706361Z","title":"Monodetr: Depth-guided transformer for monocular 3D object detection","venue":null,"work_id":"cebfcd95-1d01-4588-8df0-b798e99bddb4","year":2023},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-21T03:43:29.657744Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:54.240517Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:88958481f14a43957ac25fe1ebcd46e8cc997a7ed3cb01ca83e7e039e0c19216","observation_id":"68317237-466c-47b3-ba67-da854cbe601c","resolution":{"observed_at":"2026-08-11T22:42:55.713522Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:55.680898Z","title":"Objects are different: Flexible monocular 3D object detection","venue":null,"work_id":"c5803866-73df-43bf-ab54-f01a77e6c4bf","year":2021},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-21T03:43:29.657744Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:54.246579Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:611cba6713dd5e00e0cfef28309b7a96016341154eb21f44537f14aaeeb44629","observation_id":"067c0e06-798b-4c3b-aa8c-2bb5dde42f51","resolution":{"observed_at":"2026-08-11T22:42:55.687279Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:55.650118Z","title":"Unleashing the power of chain-of-prediction for monocular 3d object detection","venue":null,"work_id":"4aa86e36-fd96-46d3-ba62-b739eab307a8","year":2026},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-21T03:43:29.657744Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:54.252044Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:7973a38cb07556768e889b15b3390ac2bfa4cbfe759c63331efe197f2ccdf830","observation_id":"25ffde4e-e80a-4ab3-a81a-fdbdc20ed98a","resolution":{"observed_at":"2026-08-11T22:42:55.656889Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:55.617067Z","title":"Detrs beat yolos on real-time object detection","venue":null,"work_id":"48d5c932-f1a2-4d20-b64e-3ab60f2247ef","year":2024},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-21T03:43:29.657744Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:54.256824Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:a68be22b6f21c832cef0a3c6983df4205dc7986c02bc0b26adef70bae4690473","observation_id":"209120c8-ddd5-4d61-af5d-9a23c15c4629","resolution":{"observed_at":"2026-08-11T22:42:55.623346Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09631","snapshot_observed_at":"2026-08-11T22:42:54.268139Z","title":"3d-vla: 3d vision-language-action generative world model.arXiv preprint arXiv:2403.09631, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-21T03:43:29.657744Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:54.268139Z"},"links":{"cited_paper":"/paper/2403.09631","citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:03b9c61eff4d18b94eeaee2f6e8eb98727887203e9ad659fd834670a27c22019","observation_id":"09ba0257-7335-4fdc-a8f0-51d918e6005e","resolution":{"observed_at":"2026-08-11T22:42:54.268139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:55.586957Z","title":"Monoatt: Online monocular 3D object detection with adaptive token transformer","venue":null,"work_id":"320519dc-c1cc-4783-b6fc-0acd3ea6e212","year":2023},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-21T03:43:29.657744Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:54.273611Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:be6058b945c592e200a48ab130de04121ca493813eab7dc74c817db72c93f7d5","observation_id":"48466a47-025c-463c-abaa-6a85fd4ab12c","resolution":{"observed_at":"2026-08-11T22:42:55.593413Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:55.555097Z","title":"Single image 3d object detection and pose estimation for grasping","venue":null,"work_id":"fbcc070b-cdca-4ba9-9166-e7563942ff89","year":2014},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-21T03:43:29.657744Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:54.279104Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:d8a8e75b2137531929311dc0974071eeba66232d74553573e478ac6a4a73f0e1","observation_id":"78c634d8-8a69-4f21-9457-e6c66febb797","resolution":{"observed_at":"2026-08-11T22:42:55.560087Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:55.520742Z","title":"move closer to camera","venue":null,"work_id":"269ca5e3-64c7-4419-8d25-5852c22c95c4","year":2023},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-21T03:43:29.657744Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:54.283530Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:75e17bc1a17340c697e5b67afbea1e3a6fc5de62458fac0c767aa67eb59365d8","observation_id":"a4b1f79c-a60d-42a6-9eb1-19685acb8aa7","resolution":{"observed_at":"2026-08-11T22:42:55.535717Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:55.449215Z","title":"16 Table 8: Oracle study under the Omni3D evaluation protocol","venue":null,"work_id":"76ac7a59-e6b6-404b-8a10-2c66a24cd779","year":null},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-21T03:43:29.657744Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:54.290234Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:9c05814e21cbc35a03e7d8fbfb9f112c6f3172661ab53a5bb563d36a7601d617","observation_id":"fe137f5a-5526-4908-8936-156107be54eb","resolution":{"observed_at":"2026-08-11T22:42:55.474764Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:55.418013Z","title":null,"venue":null,"work_id":"5fc559d1-677f-4d59-8390-666086a3caa8","year":null},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-21T03:43:29.657744Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:54.298620Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:8b914fd94a87a9081bf1482ba4c88796d80be07df31a10b64691c2d31363efa9","observation_id":"9ce2ca16-51c1-4e81-beb9-a133e672eac4","resolution":{"observed_at":"2026-08-11T22:42:55.424527Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:55.397249Z","title":null,"venue":null,"work_id":"f2876184-be73-435c-9b89-f4a2c7f2f031","year":null},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-21T03:43:29.657744Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:54.306001Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:64625324a409b975b2960c0beed603742ae08c791d58025e8d4b6eaea60e0ad2","observation_id":"cecaa751-2c39-4b7a-8475-e19b7c5e7c95","resolution":{"observed_at":"2026-08-11T22:42:55.402688Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:55.349470Z","title":"We use Tmax = 2 in all experiments","venue":null,"work_id":"05c1d4b6-dfa2-4515-b366-ee13599c9a70","year":null},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-21T03:43:29.657744Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:54.311679Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:bbf0fea1d52f1d1299a584f557ac613a2b84f1ca6fa6cdaab557180dd7d2e713","observation_id":"f375d25c-8e8e-419b-9642-eeb43dda1b2e","resolution":{"observed_at":"2026-08-11T22:42:55.354741Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:55.325230Z","title":"Indoor Scenes","venue":null,"work_id":"2e3f7ae0-63ee-4a6b-a144-0fffbf7cca08","year":null},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-21T03:43:29.657744Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:54.317038Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:57f27713785a78260e0e86750b283a83923e8854e3ce34dc441f165d8534b29c","observation_id":"792b567a-df36-4b27-ba30-44d6946a4c14","resolution":{"observed_at":"2026-08-11T22:42:55.329673Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:55.294457Z","title":null,"venue":null,"work_id":"ea6a2e70-5997-4fc2-a66e-6e48e6887545","year":null},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-21T03:43:29.657744Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:54.325974Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:836f3cbd376d026686e9c0c1b24206480060fa9af94ca2e23aa8f765ce8cfbc4","observation_id":"bd82f07e-8e42-4f5f-9ca6-0f0d5ec7da7a","resolution":{"observed_at":"2026-08-11T22:42:55.311937Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:55.268915Z","title":null,"venue":null,"work_id":"d4193d5f-f54e-454c-b4e9-b8a5721ddf43","year":null},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-21T03:43:29.657744Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:54.332332Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:2ea7882abf319c9b8905c625be06bb7256eaa98eb2f53938639489cbf068c5ed","observation_id":"6d395df3-d3f2-4dce-88e0-920eabc80a69","resolution":{"observed_at":"2026-08-11T22:42:55.273178Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:55.248265Z","title":"a black car viewed from behind on a street","venue":null,"work_id":"2bd328c9-0de3-4272-b1f4-0dc1169c81e1","year":null},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-21T03:43:29.657744Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:54.338960Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:0d1a0750187561a58bd3b8caf6e6c848dc20592994cb5a09ce962ad44f864088","observation_id":"2b7222f0-37fa-4f99-b2a5-68ba5b59e96d","resolution":{"observed_at":"2026-08-11T22:42:55.253604Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:55.210227Z","title":null,"venue":null,"work_id":"8e340b1a-a1d3-4da7-9426-22d9fc5ce23f","year":null},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-21T03:43:29.657744Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:54.362361Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:a61b032c53ecdcbd245ebca3b1827410d821b5857c19ca24918086e3e68a478f","observation_id":"232eaabc-dc06-47de-89f1-54293262a824","resolution":{"observed_at":"2026-08-11T22:42:55.220328Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:42:52.414751Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","snapshot_observed_at":"2026-08-21T03:43:29.657744Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:52.414751Z"},"links":{"citing_paper":"/paper/2608.09147"},"observation_digest":"sha256:bf27d06932cec00052018531203f6dcbee0c0db88701d17df511ffbe1884a259","observation_id":"09cdadc8-5e8d-4111-bacf-209a8e6eda34","resolution":{"observed_at":"2026-08-11T22:42:52.414751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.09147","last_updated":"2026-08-10T05:50:37Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-21T03:43:29.657744Z","submitted_at":"2026-08-10T05:50:37Z","title":"RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection"},"reference_resolution":{"displayed":90,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":36,"verified_exact":1,"verified_fuzzy":52},"total_outbound_references":90},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 90 of 90 outbound references and 0 inbound Pith citation observations for arXiv:2608.09147."}