{"as_of":"2026-08-15T19:01:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0555d45fa9cb0123d7fe8a0ccef1fe74033c435e809dac36c494d80d312e8f1f","coverage":[{"denominator":56,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":56,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T17:13:06.935892Z","state":"measured"},{"denominator":56,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":56,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2508.16812/citation-record","integrity":"/paper/2508.16812/integrity","json":"/paper/2508.16812/citation-record.json","paper":"/paper/2508.16812"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:09.343107Z","title":"TransFusion: Robust LiDAR-camera fusion for 3D object detection with transformers","venue":null,"work_id":"40f5356a-e0f6-407a-a166-32828f3d0727","year":2022},"citing_paper":{"arxiv_id":"2508.16812","last_updated":"2025-08-22T22:02:49Z","snapshot_observed_at":"2026-08-08T13:15:18.737038Z","submitted_at":"2025-08-22T22:02:49Z","title":"Towards Open-Vocabulary Multimodal 3D Object Detection with Attributes","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:01.437631Z"},"links":{"citing_paper":"/paper/2508.16812"},"observation_digest":"sha256:99cd16dba06f5337f2746d82dbbf76289e7bd4b73e081acba58c295bf2770192","observation_id":"840f8725-d2b5-4625-9829-401e7c8370a8","resolution":{"observed_at":"2026-08-05T17:13:09.347860Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.05095","last_updated":"2021-06-09T14:48:13Z","snapshot_observed_at":"2026-08-13T20:17:16.277117Z","submitted_at":"2021-02-09T19:49:33Z","title":"Is Space-Time Attention All You Need for Video Understanding?","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.05095","snapshot_observed_at":"2026-08-05T17:13:01.481907Z","title":"Is space-time attention all you need for video understanding? InInternational Conference on Machine Learning (ICML), 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.16812","last_updated":"2025-08-22T22:02:49Z","snapshot_observed_at":"2026-08-08T13:15:18.737038Z","submitted_at":"2025-08-22T22:02:49Z","title":"Towards Open-Vocabulary Multimodal 3D Object Detection with Attributes","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:01.481907Z"},"links":{"cited_paper":"/paper/2102.05095","citing_paper":"/paper/2508.16812"},"observation_digest":"sha256:8ac32b10fa9f8f7f1caf37d88d970ad88042a6b73d844f52be9aec0fd0978150","observation_id":"d9c232d4-c6b1-404e-8f17-5e6da800d8ae","resolution":{"observed_at":"2026-08-05T17:13:01.481907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:09.326722Z","title":"Lang, Sourabh V ora, V enice Erin Liong, Qiang Xu, Anush Krishnan, Y u Pan, Giancarlo Baldan, and Oscar Beijbom","venue":null,"work_id":"14613caa-74d3-4d25-9439-a21b767b023b","year":2020},"citing_paper":{"arxiv_id":"2508.16812","last_updated":"2025-08-22T22:02:49Z","snapshot_observed_at":"2026-08-08T13:15:18.737038Z","submitted_at":"2025-08-22T22:02:49Z","title":"Towards Open-Vocabulary Multimodal 3D Object Detection with Attributes","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:01.550840Z"},"links":{"citing_paper":"/paper/2508.16812"},"observation_digest":"sha256:d6d05780072834bba76fd2ceaafefaa3f466089e290a7aa39c14c974d6ef9962","observation_id":"0323529f-d181-4656-9e98-f1df76763a63","resolution":{"observed_at":"2026-08-05T17:13:09.331370Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:09.310449Z","title":"CoDA: Collaborative novel box discovery and cross-modal alignment for open-vocabulary 3D object detection","venue":null,"work_id":"45b637d2-750b-4b6b-8df8-1a29c170e891","year":2023},"citing_paper":{"arxiv_id":"2508.16812","last_updated":"2025-08-22T22:02:49Z","snapshot_observed_at":"2026-08-08T13:15:18.737038Z","submitted_at":"2025-08-22T22:02:49Z","title":"Towards Open-Vocabulary Multimodal 3D Object Detection with Attributes","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:01.619614Z"},"links":{"citing_paper":"/paper/2508.16812"},"observation_digest":"sha256:53ffab812bedc3e5b01fdb15510dffd1cb1378b4ea3f06de6642be682e6c785b","observation_id":"92bfde35-7860-4701-81bd-53daddc5e63f","resolution":{"observed_at":"2026-08-05T17:13:09.315917Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.00830","last_updated":"2025-08-03T15:13:12Z","snapshot_observed_at":"2026-08-12T23:52:06.688799Z","submitted_at":"2024-06-02T18:32:37Z","title":"Collaborative Novel Object Discovery and Box-Guided Cross-Modal Alignment for Open-Vocabulary 3D Object Detection","version":2},"cited_work":{"arxiv_id":"2406.00830","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.00830","snapshot_observed_at":"2026-08-05T17:13:08.718629Z","title":"Collaborative Novel Object Discovery and Box-Guided Cross-Modal Alignment for Open-Vocabulary 3D Object Detection","venue":"cs.CV","work_id":"7a668c98-6f7c-4c36-a59a-a782b1b0f679","year":2024},"citing_paper":{"arxiv_id":"2508.16812","last_updated":"2025-08-22T22:02:49Z","snapshot_observed_at":"2026-08-08T13:15:18.737038Z","submitted_at":"2025-08-22T22:02:49Z","title":"Towards Open-Vocabulary Multimodal 3D Object Detection with Attributes","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:01.666088Z"},"links":{"cited_paper":"/paper/2406.00830","citing_paper":"/paper/2508.16812"},"observation_digest":"sha256:daeeb01e5c12106d248a3373858c4e277a4f1ffb5b7c51a7d25d96c8e49ec714","observation_id":"5e6d3ffb-ca94-414c-9c2d-5ae815fbcfda","resolution":{"observed_at":"2026-08-05T17:13:08.748655Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1705.07750","last_updated":"2018-02-12T17:10:11Z","snapshot_observed_at":"2026-08-14T20:59:05.330633Z","submitted_at":"2017-05-22T13:57:53Z","title":"Quo Vadis, Action Recognition? A New Model and the Kinetics Dataset","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.07750","snapshot_observed_at":"2026-08-05T17:13:01.758342Z","title":"Quo vadis, action recognition? A new model and the kinetics dataset","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.16812","last_updated":"2025-08-22T22:02:49Z","snapshot_observed_at":"2026-08-08T13:15:18.737038Z","submitted_at":"2025-08-22T22:02:49Z","title":"Towards Open-Vocabulary Multimodal 3D Object Detection with Attributes","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:01.758342Z"},"links":{"cited_paper":"/paper/1705.07750","citing_paper":"/paper/2508.16812"},"observation_digest":"sha256:a356f9b581ed1a87e956242ba7e29aed426d5c6cab17572761d31ae6a79b46c0","observation_id":"b85c14d1-2749-4e90-94ee-c905dc863425","resolution":{"observed_at":"2026-08-05T17:13:01.758342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.14940","last_updated":"2022-03-28T17:50:26Z","snapshot_observed_at":"2026-08-14T20:06:19.283168Z","submitted_at":"2022-03-28T17:50:26Z","title":"Learning to Prompt for Open-Vocabulary Object Detection with Vision-Language Model","version":1},"cited_work":{"arxiv_id":"2203.14940","doi":null,"metadata_source":"pith","pith_arxiv_id":"2203.14940","snapshot_observed_at":"2026-08-05T17:13:08.418095Z","title":"Learning to Prompt for Open-Vocabulary Object Detection with Vision-Language Model","venue":"cs.CV","work_id":"9f240a4f-8e68-4433-a147-6660f97179e6","year":2022},"citing_paper":{"arxiv_id":"2508.16812","last_updated":"2025-08-22T22:02:49Z","snapshot_observed_at":"2026-08-08T13:15:18.737038Z","submitted_at":"2025-08-22T22:02:49Z","title":"Towards Open-Vocabulary Multimodal 3D Object Detection with Attributes","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:01.824856Z"},"links":{"cited_paper":"/paper/2203.14940","citing_paper":"/paper/2508.16812"},"observation_digest":"sha256:873804fcab26767b376bcf98d4f23068f96f9572fff6a248b7191ac35ed5c72e","observation_id":"103b1be2-881b-4092-a9de-cdf760126ccd","resolution":{"observed_at":"2026-08-05T17:13:08.568522Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13556","last_updated":"2024-07-12T10:42:30Z","snapshot_observed_at":"2026-08-13T00:49:33.321044Z","submitted_at":"2024-03-20T12:51:30Z","title":"Find n' Propagate: Open-Vocabulary 3D Object Detection in Urban Environments","version":2},"cited_work":{"arxiv_id":"2403.13556","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.13556","snapshot_observed_at":"2026-08-05T17:13:08.320157Z","title":"Find n' Propagate: Open-Vocabulary 3D Object Detection in Urban Environments","venue":"cs.CV","work_id":"0893514a-dcd1-44d6-80fc-31e2f2d6a5ec","year":2024},"citing_paper":{"arxiv_id":"2508.16812","last_updated":"2025-08-22T22:02:49Z","snapshot_observed_at":"2026-08-08T13:15:18.737038Z","submitted_at":"2025-08-22T22:02:49Z","title":"Towards Open-Vocabulary Multimodal 3D Object Detection with Attributes","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:01.870710Z"},"links":{"cited_paper":"/paper/2403.13556","citing_paper":"/paper/2508.16812"},"observation_digest":"sha256:fddda9ab4814de0d136139780cb4e8e5fc87220b938d87ac71c011a904e8ead8","observation_id":"fcc17589-f298-479f-9021-265f579e2956","resolution":{"observed_at":"2026-08-05T17:13:08.337877Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:09.292747Z","title":"Fully sparse 3D object detection","venue":null,"work_id":"b0587390-a9d7-4c8d-82d3-417a7d4d126e","year":2022},"citing_paper":{"arxiv_id":"2508.16812","last_updated":"2025-08-22T22:02:49Z","snapshot_observed_at":"2026-08-08T13:15:18.737038Z","submitted_at":"2025-08-22T22:02:49Z","title":"Towards Open-Vocabulary Multimodal 3D Object Detection with Attributes","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:01.958733Z"},"links":{"citing_paper":"/paper/2508.16812"},"observation_digest":"sha256:97c15ac1475fbbbad9531ec88feab089fa53b7a1d6266cb11e2899faa48cf007","observation_id":"b9c0e4d5-992e-4efb-9ce4-80e17e4a012e","resolution":{"observed_at":"2026-08-05T17:13:09.297804Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:09.276834Z","title":"Multi-modal transformer for video retrieval","venue":null,"work_id":"84d8313f-0dcd-416f-b9d4-4e7d2ca266a3","year":2020},"citing_paper":{"arxiv_id":"2508.16812","last_updated":"2025-08-22T22:02:49Z","snapshot_observed_at":"2026-08-08T13:15:18.737038Z","submitted_at":"2025-08-22T22:02:49Z","title":"Towards Open-Vocabulary Multimodal 3D Object Detection with Attributes","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:02.024764Z"},"links":{"citing_paper":"/paper/2508.16812"},"observation_digest":"sha256:987d0916a5065620911af0ee5d83105cb039eb1b00f15d191e6ac736b7a17b7a","observation_id":"65a7e81d-22fa-4f21-9b72-55d7e8009575","resolution":{"observed_at":"2026-08-05T17:13:09.281744Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:02.093300Z","title":"Are we ready for autonomous driving? the KITTI vision benchmark suite","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2508.16812","last_updated":"2025-08-22T22:02:49Z","snapshot_observed_at":"2026-08-08T13:15:18.737038Z","submitted_at":"2025-08-22T22:02:49Z","title":"Towards Open-Vocabulary Multimodal 3D Object Detection with Attributes","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:02.093300Z"},"links":{"citing_paper":"/paper/2508.16812"},"observation_digest":"sha256:e14f896b62835f7fe699e979fe84f67d0866f90d916e6805d2a5bbcdd79b6528","observation_id":"ff00328c-a284-450d-a55a-0bed8daf3e52","resolution":{"observed_at":"2026-08-05T17:13:02.093300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16650","last_updated":"2023-09-28T17:53:38Z","snapshot_observed_at":"2026-08-13T10:02:53.100484Z","submitted_at":"2023-09-28T17:53:38Z","title":"ConceptGraphs: Open-Vocabulary 3D Scene Graphs for Perception and Planning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16650","snapshot_observed_at":"2026-08-05T17:13:02.141605Z","title":"Tenenbaum, Antonio T orralba, Florian Shkurti, and Liam Paull","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.16812","last_updated":"2025-08-22T22:02:49Z","snapshot_observed_at":"2026-08-08T13:15:18.737038Z","submitted_at":"2025-08-22T22:02:49Z","title":"Towards Open-Vocabulary Multimodal 3D Object Detection with Attributes","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:02.141605Z"},"links":{"cited_paper":"/paper/2309.16650","citing_paper":"/paper/2508.16812"},"observation_digest":"sha256:a7935e81cade3d7ec9a65a62fd69c09792ab2aaac191a986c2faf3cfb8c4c49d","observation_id":"5d3e40f7-cc5b-4a84-9b7c-20e5284fab6a","resolution":{"observed_at":"2026-08-05T17:13:02.141605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:09.260903Z","title":"Open-vocabulary object detection via vision and language knowledge distillation","venue":null,"work_id":"81261f6e-0328-4490-9f98-82295a92b7ab","year":2022},"citing_paper":{"arxiv_id":"2508.16812","last_updated":"2025-08-22T22:02:49Z","snapshot_observed_at":"2026-08-08T13:15:18.737038Z","submitted_at":"2025-08-22T22:02:49Z","title":"Towards Open-Vocabulary Multimodal 3D Object Detection with Attributes","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:02.230640Z"},"links":{"citing_paper":"/paper/2508.16812"},"observation_digest":"sha256:a0c57504dedf7ce72ca293e61fdc3e80d1e4b182c0035f1a88bd06c968009d3d","observation_id":"e667cdb0-2ac7-45a1-b463-6f4ee791ac75","resolution":{"observed_at":"2026-08-05T17:13:09.265554Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:09.244886Z","title":"OneLLM: One framework to align all modalities with language","venue":null,"work_id":"fbec4006-7b83-4b2e-9ee0-a8742715929e","year":null},"citing_paper":{"arxiv_id":"2508.16812","last_updated":"2025-08-22T22:02:49Z","snapshot_observed_at":"2026-08-08T13:15:18.737038Z","submitted_at":"2025-08-22T22:02:49Z","title":"Towards Open-Vocabulary Multimodal 3D Object Detection with Attributes","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:02.295762Z"},"links":{"citing_paper":"/paper/2508.16812"},"observation_digest":"sha256:ce43a8aefa23def74d357ccac61f30f44464f48c6086ac072838e3dfe7151d8e","observation_id":"4daed349-6ad7-46ce-8ed6-7562da3577c9","resolution":{"observed_at":"2026-08-05T17:13:09.250070Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:09.226141Z","title":"Jones, and Vishal M","venue":null,"work_id":"fd2b3779-e398-4b90-bcd1-b9320cdbb7e3","year":2025},"citing_paper":{"arxiv_id":"2508.16812","last_updated":"2025-08-22T22:02:49Z","snapshot_observed_at":"2026-08-08T13:15:18.737038Z","submitted_at":"2025-08-22T22:02:49Z","title":"Towards Open-Vocabulary Multimodal 3D Object Detection with Attributes","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:02.472014Z"},"links":{"citing_paper":"/paper/2508.16812"},"observation_digest":"sha256:0c3f65a6268ee96ba3af2098377211f1d018a339515bbef1b55f064c7abfafce","observation_id":"1feac009-2953-4277-953f-eb5175876ced","resolution":{"observed_at":"2026-08-05T17:13:09.231011Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:09.209645Z","title":"Jones, and Vishal M","venue":null,"work_id":"26c067b0-3dfb-4478-acec-00520da23cf6","year":2025},"citing_paper":{"arxiv_id":"2508.16812","last_updated":"2025-08-22T22:02:49Z","snapshot_observed_at":"2026-08-08T13:15:18.737038Z","submitted_at":"2025-08-22T22:02:49Z","title":"Towards Open-Vocabulary Multimodal 3D Object Detection with Attributes","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:02.563889Z"},"links":{"citing_paper":"/paper/2508.16812"},"observation_digest":"sha256:523c70aefd7a60040471a1e63a748db10386a34efcc18e122e561fe053e86810","observation_id":"a42b1dbc-f053-4791-b64e-845761745580","resolution":{"observed_at":"2026-08-05T17:13:09.214938Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:02.655417Z","title":"Long short-term memory.Neural Comput., 9 (8):1735–1780, November 1997","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2508.16812","last_updated":"2025-08-22T22:02:49Z","snapshot_observed_at":"2026-08-08T13:15:18.737038Z","submitted_at":"2025-08-22T22:02:49Z","title":"Towards Open-Vocabulary Multimodal 3D Object Detection with Attributes","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:02.655417Z"},"links":{"citing_paper":"/paper/2508.16812"},"observation_digest":"sha256:678a1331b903b5f952e00a5bbd2c3b507b7077c41acf5b7f1381558c7e7dde01","observation_id":"eb6ac23e-a5bd-4605-8d95-8fc262d9962e","resolution":{"observed_at":"2026-08-05T17:13:02.655417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.07241","last_updated":"2023-10-23T14:56:15Z","snapshot_observed_at":"2026-08-13T12:44:32.987980Z","submitted_at":"2023-02-14T18:40:26Z","title":"ConceptFusion: Open-set Multimodal 3D Mapping","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.07241","snapshot_observed_at":"2026-08-05T17:13:02.731888Z","title":"T enenbaum, Celso Miguel de Melo, Madhava Krishna, Liam Paull, Florian Shkurti, and Antonio T orralba","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.16812","last_updated":"2025-08-22T22:02:49Z","snapshot_observed_at":"2026-08-08T13:15:18.737038Z","submitted_at":"2025-08-22T22:02:49Z","title":"Towards Open-Vocabulary Multimodal 3D Object Detection with Attributes","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:02.731888Z"},"links":{"cited_paper":"/paper/2302.07241","citing_paper":"/paper/2508.16812"},"observation_digest":"sha256:f0f6349bf33588a9013f650b4b9eab6d3f2af622473951e44c1cc437a86a0eac","observation_id":"a27b0254-1bb4-49a8-990b-1cdea1a248cb","resolution":{"observed_at":"2026-08-05T17:13:02.731888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:09.194273Z","title":"Action genome: Actions as composition of spatio-temporal scene graphs","venue":null,"work_id":"a66eff9a-c76a-4d18-987a-b77072b59fb4","year":2020},"citing_paper":{"arxiv_id":"2508.16812","last_updated":"2025-08-22T22:02:49Z","snapshot_observed_at":"2026-08-08T13:15:18.737038Z","submitted_at":"2025-08-22T22:02:49Z","title":"Towards Open-Vocabulary Multimodal 3D Object Detection with Attributes","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:02.811170Z"},"links":{"citing_paper":"/paper/2508.16812"},"observation_digest":"sha256:133030500e1eb689bc570623a4b195c7d13e4757a95153c40355e0510cc568d1","observation_id":"1e0ae063-aee7-4e35-80d7-5e7f021646cb","resolution":{"observed_at":"2026-08-05T17:13:09.198930Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:09.177511Z","title":"PF3Det: A prompted foundation feature assisted visual LiDAR 3D detector","venue":null,"work_id":"bf03a4eb-7ea1-497c-9c7d-28e118802d10","year":2025},"citing_paper":{"arxiv_id":"2508.16812","last_updated":"2025-08-22T22:02:49Z","snapshot_observed_at":"2026-08-08T13:15:18.737038Z","submitted_at":"2025-08-22T22:02:49Z","title":"Towards Open-Vocabulary Multimodal 3D Object Detection with Attributes","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:02.874237Z"},"links":{"citing_paper":"/paper/2508.16812"},"observation_digest":"sha256:9b8a844bfeced2a94d8c28eb6ffeaae5239eb77e41b92696839bcc431cfcc713","observation_id":"81b7e8c8-d47a-4b5b-980c-41e71feb883e","resolution":{"observed_at":"2026-08-05T17:13:09.182991Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:09.160086Z","title":"Grounded language-image pre-training","venue":null,"work_id":"ed4ac06f-34f7-4e2a-a76a-3e43e80b3444","year":2022},"citing_paper":{"arxiv_id":"2508.16812","last_updated":"2025-08-22T22:02:49Z","snapshot_observed_at":"2026-08-08T13:15:18.737038Z","submitted_at":"2025-08-22T22:02:49Z","title":"Towards Open-Vocabulary Multimodal 3D Object Detection with Attributes","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:02.980304Z"},"links":{"citing_paper":"/paper/2508.16812"},"observation_digest":"sha256:87131da9380ef086c2af2b68ddc8adaf132b676ac9ab161c17efa0b1eafe7a04","observation_id":"c734e3c7-3a44-4ebe-b8d5-b10c179ca67a","resolution":{"observed_at":"2026-08-05T17:13:09.165658Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:09.141454Z","title":"OpenShape: Scaling up 3D shape representation towards open-world understanding","venue":null,"work_id":"8c3e21fa-fc7b-4af3-9525-7e4800510771","year":2023},"citing_paper":{"arxiv_id":"2508.16812","last_updated":"2025-08-22T22:02:49Z","snapshot_observed_at":"2026-08-08T13:15:18.737038Z","submitted_at":"2025-08-22T22:02:49Z","title":"Towards Open-Vocabulary Multimodal 3D Object Detection with Attributes","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:03.053531Z"},"links":{"citing_paper":"/paper/2508.16812"},"observation_digest":"sha256:e12bf3c56fe6779d7fd4cfec49de77718ba2f7101b62fe81393356c6fee4cb2c","observation_id":"f5844c12-2d4d-467f-b559-f74bc885388d","resolution":{"observed_at":"2026-08-05T17:13:09.146762Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:09.122824Z","title":"Grounding DINO: Marrying DINO with grounded pre-training for open-set object detection","venue":null,"work_id":"33006aa3-1741-4abe-b640-fc1349185596","year":2024},"citing_paper":{"arxiv_id":"2508.16812","last_updated":"2025-08-22T22:02:49Z","snapshot_observed_at":"2026-08-08T13:15:18.737038Z","submitted_at":"2025-08-22T22:02:49Z","title":"Towards Open-Vocabulary Multimodal 3D Object Detection with Attributes","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:03.160071Z"},"links":{"citing_paper":"/paper/2508.16812"},"observation_digest":"sha256:0ae06232e56eda695b098c2c172aa22eb753f6894c5a110ef4f2c1b971abc567","observation_id":"47339047-0ceb-48aa-be97-d11fc8eb48e5","resolution":{"observed_at":"2026-08-05T17:13:09.127565Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:09.106257Z","title":"Open-vocabulary point-cloud object detection without 3D annotation","venue":null,"work_id":"49187183-9563-4423-b593-d1247e996151","year":2023},"citing_paper":{"arxiv_id":"2508.16812","last_updated":"2025-08-22T22:02:49Z","snapshot_observed_at":"2026-08-08T13:15:18.737038Z","submitted_at":"2025-08-22T22:02:49Z","title":"Towards Open-Vocabulary Multimodal 3D Object Detection with Attributes","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:03.291623Z"},"links":{"citing_paper":"/paper/2508.16812"},"observation_digest":"sha256:7f7616c4d1cfc1d4787ded58cbf4985936495f49f70a92afa90a4f3303527272","observation_id":"a1648445-19ac-4617-ac79-9ebce9000c08","resolution":{"observed_at":"2026-08-05T17:13:09.111280Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.08141","last_updated":"2021-09-16T17:57:37Z","snapshot_observed_at":"2026-08-13T18:10:00.787919Z","submitted_at":"2021-09-16T17:57:37Z","title":"An End-to-End Transformer Model for 3D Object Detection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.08141","snapshot_observed_at":"2026-08-05T17:13:03.369392Z","title":"An end-to-end transformer model for 3D object detection","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.16812","last_updated":"2025-08-22T22:02:49Z","snapshot_observed_at":"2026-08-08T13:15:18.737038Z","submitted_at":"2025-08-22T22:02:49Z","title":"Towards Open-Vocabulary Multimodal 3D Object Detection with Attributes","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:03.369392Z"},"links":{"cited_paper":"/paper/2109.08141","citing_paper":"/paper/2508.16812"},"observation_digest":"sha256:889ca63341401798e0324d23eaadfe7f629ae836ea0d946ecc6b7418d6512fca","observation_id":"7f458115-3bbd-44f3-ab37-2168437dc4ee","resolution":{"observed_at":"2026-08-05T17:13:03.369392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:09.088969Z","title":"Modeling temporal structure of decomposable motion segments for activity classification","venue":null,"work_id":"04b7d43f-9b97-43db-9a72-db8b8d953f54","year":2010},"citing_paper":{"arxiv_id":"2508.16812","last_updated":"2025-08-22T22:02:49Z","snapshot_observed_at":"2026-08-08T13:15:18.737038Z","submitted_at":"2025-08-22T22:02:49Z","title":"Towards Open-Vocabulary Multimodal 3D Object Detection with Attributes","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:03.471688Z"},"links":{"citing_paper":"/paper/2508.16812"},"observation_digest":"sha256:c3e513cc79e91ed50afb5e04e582c8b5b324e85249bdd743a15e24c08e0fd93c","observation_id":"b0c79d08-7717-4a79-a1ee-1dd63bd53f09","resolution":{"observed_at":"2026-08-05T17:13:09.094901Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:09.069516Z","title":"PyT orch: An imperative style, high-performance deep learning library","venue":null,"work_id":"c4c2233e-9129-4aa6-a9f8-91294300a29e","year":2019},"citing_paper":{"arxiv_id":"2508.16812","last_updated":"2025-08-22T22:02:49Z","snapshot_observed_at":"2026-08-08T13:15:18.737038Z","submitted_at":"2025-08-22T22:02:49Z","title":"Towards Open-Vocabulary Multimodal 3D Object Detection with Attributes","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:03.583519Z"},"links":{"citing_paper":"/paper/2508.16812"},"observation_digest":"sha256:18f60fb42407882ae158dc044012abddce8cd1d19f436ba12f1f5a9c2df74561","observation_id":"dabae4fa-8546-48ee-8e6e-dc06fcded168","resolution":{"observed_at":"2026-08-05T17:13:09.076037Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:09.054137Z","title":"OpenScene: 3D scene understanding with open vocabularies","venue":null,"work_id":"c506874f-6059-48c8-91fb-c29995c7e733","year":2023},"citing_paper":{"arxiv_id":"2508.16812","last_updated":"2025-08-22T22:02:49Z","snapshot_observed_at":"2026-08-08T13:15:18.737038Z","submitted_at":"2025-08-22T22:02:49Z","title":"Towards Open-Vocabulary Multimodal 3D Object Detection with Attributes","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:03.686010Z"},"links":{"citing_paper":"/paper/2508.16812"},"observation_digest":"sha256:c2baa27a5e84def4935a3e272095b21638827a935fb6dc838c3ae09069be23f6","observation_id":"1bd61506-50b3-4391-9cd5-498424ec4d70","resolution":{"observed_at":"2026-08-05T17:13:09.058826Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:09.034730Z","title":"Qi, Hao Su, Kaichun Mo, and Leonidas J","venue":null,"work_id":"aac78c4b-6786-4a86-986d-b5f823b7992d","year":2017},"citing_paper":{"arxiv_id":"2508.16812","last_updated":"2025-08-22T22:02:49Z","snapshot_observed_at":"2026-08-08T13:15:18.737038Z","submitted_at":"2025-08-22T22:02:49Z","title":"Towards Open-Vocabulary Multimodal 3D Object Detection with Attributes","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:03.788184Z"},"links":{"citing_paper":"/paper/2508.16812"},"observation_digest":"sha256:8ad657cd71cb0637a491f2ac484f4ae48be6e7b9d65f91ab7bc31b7962010538","observation_id":"166f1343-26ab-447c-9b6d-14a5b9b70c69","resolution":{"observed_at":"2026-08-05T17:13:09.042963Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.08488","last_updated":"2018-04-13T00:30:24Z","snapshot_observed_at":"2026-08-14T20:10:55.429095Z","submitted_at":"2017-11-22T19:52:18Z","title":"Frustum PointNets for 3D Object Detection from RGB-D Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.08488","snapshot_observed_at":"2026-08-05T17:13:03.886207Z","title":"Qi, W ei Liu, Chenxia Wu, Hao Su, and Leonidas J","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2508.16812","last_updated":"2025-08-22T22:02:49Z","snapshot_observed_at":"2026-08-08T13:15:18.737038Z","submitted_at":"2025-08-22T22:02:49Z","title":"Towards Open-Vocabulary Multimodal 3D Object Detection with Attributes","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:03.886207Z"},"links":{"cited_paper":"/paper/1711.08488","citing_paper":"/paper/2508.16812"},"observation_digest":"sha256:e8f6cbcdc83cf29a843718c28ef9416d9a3d683f551e679b55ae4b1711d94b99","observation_id":"2f536505-b225-487c-a519-1c9ef552fcc6","resolution":{"observed_at":"2026-08-05T17:13:03.886207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.09664","last_updated":"2019-08-22T20:54:40Z","snapshot_observed_at":"2026-08-15T13:24:02.258540Z","submitted_at":"2019-04-21T21:36:36Z","title":"Deep Hough Voting for 3D Object Detection in Point Clouds","version":2},"cited_work":{"arxiv_id":"1904.09664","doi":null,"metadata_source":"pith","pith_arxiv_id":"1904.09664","snapshot_observed_at":"2026-08-05T17:13:08.078320Z","title":"Deep Hough Voting for 3D Object Detection in Point Clouds","venue":"cs.CV","work_id":"303891d2-0fcb-455b-ba3c-c1e59ba6bc53","year":2019},"citing_paper":{"arxiv_id":"2508.16812","last_updated":"2025-08-22T22:02:49Z","snapshot_observed_at":"2026-08-08T13:15:18.737038Z","submitted_at":"2025-08-22T22:02:49Z","title":"Towards Open-Vocabulary Multimodal 3D Object Detection with Attributes","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:03.987522Z"},"links":{"cited_paper":"/paper/1904.09664","citing_paper":"/paper/2508.16812"},"observation_digest":"sha256:73a9d75497b291051dc788a24e00b76810d8662e5fab75246b602aacedd92ac1","observation_id":"0303b28b-8ef5-4362-897b-8707f7336768","resolution":{"observed_at":"2026-08-05T17:13:08.084109Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.00020","last_updated":"2021-02-26T19:04:58Z","snapshot_observed_at":"2026-07-06T10:45:03.059688Z","submitted_at":"2021-02-26T19:04:58Z","title":"Learning Transferable Visual Models From Natural Language Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.00020","snapshot_observed_at":"2026-08-05T17:13:04.056417Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.16812","last_updated":"2025-08-22T22:02:49Z","snapshot_observed_at":"2026-08-08T13:15:18.737038Z","submitted_at":"2025-08-22T22:02:49Z","title":"Towards Open-Vocabulary Multimodal 3D Object Detection with Attributes","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:04.056417Z"},"links":{"cited_paper":"/paper/2103.00020","citing_paper":"/paper/2508.16812"},"observation_digest":"sha256:cc516fbfe392707e61f5b8b670990f5000c7107736227ed8da7b74fa0605abc9","observation_id":"6d60b02a-280e-4cea-8201-22b4b411d242","resolution":{"observed_at":"2026-08-05T17:13:04.056417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.04244","last_updated":"2019-05-16T15:50:01Z","snapshot_observed_at":"2026-08-14T17:45:31.870838Z","submitted_at":"2018-12-11T07:27:56Z","title":"PointRCNN: 3D Object Proposal Generation and Detection from Point Cloud","version":2},"cited_work":{"arxiv_id":"1812.04244","doi":null,"metadata_source":"pith","pith_arxiv_id":"1812.04244","snapshot_observed_at":"2026-08-05T17:13:08.028958Z","title":"PointRCNN: 3D Object Proposal Generation and Detection from Point Cloud","venue":"cs.CV","work_id":"1c97675c-039c-47c2-9596-7d786996170f","year":2018},"citing_paper":{"arxiv_id":"2508.16812","last_updated":"2025-08-22T22:02:49Z","snapshot_observed_at":"2026-08-08T13:15:18.737038Z","submitted_at":"2025-08-22T22:02:49Z","title":"Towards Open-Vocabulary Multimodal 3D Object Detection with Attributes","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:04.157255Z"},"links":{"cited_paper":"/paper/1812.04244","citing_paper":"/paper/2508.16812"},"observation_digest":"sha256:f8a551da6f56abf347826d7ea016a0419c242be34796fff1ad906d9e907b43ea","observation_id":"70bcaecc-0c36-41b1-9450-c0d54195480f","resolution":{"observed_at":"2026-08-05T17:13:08.034757Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:09.016870Z","title":"PV -RCNN: Point-voxel feature set abstraction for 3D object detection","venue":null,"work_id":"4fea7fd1-f994-4153-a81c-b89df2b5db8d","year":2020},"citing_paper":{"arxiv_id":"2508.16812","last_updated":"2025-08-22T22:02:49Z","snapshot_observed_at":"2026-08-08T13:15:18.737038Z","submitted_at":"2025-08-22T22:02:49Z","title":"Towards Open-Vocabulary Multimodal 3D Object Detection with Attributes","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:04.256401Z"},"links":{"citing_paper":"/paper/2508.16812"},"observation_digest":"sha256:207a5e501b9e33319b44ebce433782b3434e9a3a06c75eaa10ca5ec8b53bc543","observation_id":"cd9525d2-b4da-4dea-9189-e38ee5217e14","resolution":{"observed_at":"2026-08-05T17:13:09.021635Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:09.000081Z","title":"VideoBERT: A joint model for video and language representation learning","venue":null,"work_id":"45e1effa-6bc5-4c69-9f23-cf3cddc0c137","year":2019},"citing_paper":{"arxiv_id":"2508.16812","last_updated":"2025-08-22T22:02:49Z","snapshot_observed_at":"2026-08-08T13:15:18.737038Z","submitted_at":"2025-08-22T22:02:49Z","title":"Towards Open-Vocabulary Multimodal 3D Object Detection with Attributes","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:04.338428Z"},"links":{"citing_paper":"/paper/2508.16812"},"observation_digest":"sha256:8ffd5b2fb36f25eecb3fc6e44e7ba24a024e3195b06c409c3fc4d50de392d305","observation_id":"75bf4426-3b0a-45c4-98d4-8e737839456c","resolution":{"observed_at":"2026-08-05T17:13:09.005712Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:08.979660Z","title":"Scalability in perception for autonomous driving: W aymo open dataset, 2020","venue":null,"work_id":"a65fe1ac-ef05-4893-a68b-ae0209044bcc","year":2020},"citing_paper":{"arxiv_id":"2508.16812","last_updated":"2025-08-22T22:02:49Z","snapshot_observed_at":"2026-08-08T13:15:18.737038Z","submitted_at":"2025-08-22T22:02:49Z","title":"Towards Open-Vocabulary Multimodal 3D Object Detection with Attributes","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:04.558032Z"},"links":{"citing_paper":"/paper/2508.16812"},"observation_digest":"sha256:af696a81ef5d64dd946e1309324778c402d6a5e4ca4b6895cb6461c31c3088f1","observation_id":"9536a125-4495-40da-9be9-6671aa89b29a","resolution":{"observed_at":"2026-08-05T17:13:08.986709Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:08.950211Z","title":"Learning spatiotemporal features with 3D convolutional networks","venue":null,"work_id":"e19b1dd1-c088-46a4-9a61-dd05bfd92b0e","year":2015},"citing_paper":{"arxiv_id":"2508.16812","last_updated":"2025-08-22T22:02:49Z","snapshot_observed_at":"2026-08-08T13:15:18.737038Z","submitted_at":"2025-08-22T22:02:49Z","title":"Towards Open-Vocabulary Multimodal 3D Object Detection with Attributes","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:04.735453Z"},"links":{"citing_paper":"/paper/2508.16812"},"observation_digest":"sha256:14f5ff5425633127d64d9cec1339cb639ee4314731c916972d4b15520b07ae7f","observation_id":"ca3ff166-92f1-495c-ac5c-aa2b4d7e419f","resolution":{"observed_at":"2026-08-05T17:13:08.956623Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:08.929946Z","title":"DSVT: Dynamic sparse voxel transformer with rotated sets","venue":null,"work_id":"634701ad-9174-4fd8-b75c-d4e5478cd57b","year":2023},"citing_paper":{"arxiv_id":"2508.16812","last_updated":"2025-08-22T22:02:49Z","snapshot_observed_at":"2026-08-08T13:15:18.737038Z","submitted_at":"2025-08-22T22:02:49Z","title":"Towards Open-Vocabulary Multimodal 3D Object Detection with Attributes","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:04.934308Z"},"links":{"citing_paper":"/paper/2508.16812"},"observation_digest":"sha256:7e17887ea6545ecd094c99fc7b11d247844f8c94de2ca27bc648bc05a9ffa38e","observation_id":"a3914318-82fa-4337-b98e-878381f55c9f","resolution":{"observed_at":"2026-08-05T17:13:08.935947Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:05.358512Z","title":"Hierarchical open-vocabulary 3D scene graphs for language-grounded robot navigation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.16812","last_updated":"2025-08-22T22:02:49Z","snapshot_observed_at":"2026-08-08T13:15:18.737038Z","submitted_at":"2025-08-22T22:02:49Z","title":"Towards Open-Vocabulary Multimodal 3D Object Detection with Attributes","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:05.358512Z"},"links":{"citing_paper":"/paper/2508.16812"},"observation_digest":"sha256:437fe946fcd2bb5b88a7c55a30426246d6256989bc64d6b110e158f86880a060","observation_id":"76edf698-e339-4015-b383-1b7c9cfd170c","resolution":{"observed_at":"2026-08-05T17:13:05.358512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:08.908348Z","title":"Argoverse 2: Next generation datasets for self-driving perception and forecasting","venue":null,"work_id":"24b4adaf-ae34-4ba5-937b-70f617148314","year":2024},"citing_paper":{"arxiv_id":"2508.16812","last_updated":"2025-08-22T22:02:49Z","snapshot_observed_at":"2026-08-08T13:15:18.737038Z","submitted_at":"2025-08-22T22:02:49Z","title":"Towards Open-Vocabulary Multimodal 3D Object Detection with Attributes","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:05.456330Z"},"links":{"citing_paper":"/paper/2508.16812"},"observation_digest":"sha256:fc18bf923a5d6a35ec658a3777621d5da28ac1e8a43cd42b1a3f4ce922ca75e2","observation_id":"5f9d2efa-63c2-4004-8447-bccd567f0af8","resolution":{"observed_at":"2026-08-05T17:13:08.914171Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:08.890339Z","title":"Transformation- equivariant 3D object detection for autonomous driving","venue":null,"work_id":"72554450-f084-460e-b39a-1c3b62fe2b16","year":2023},"citing_paper":{"arxiv_id":"2508.16812","last_updated":"2025-08-22T22:02:49Z","snapshot_observed_at":"2026-08-08T13:15:18.737038Z","submitted_at":"2025-08-22T22:02:49Z","title":"Towards Open-Vocabulary Multimodal 3D Object Detection with Attributes","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:05.555846Z"},"links":{"citing_paper":"/paper/2508.16812"},"observation_digest":"sha256:053cae1fa38beb298c45a3c6ada7f222b24aaecb4f06b1fa2ba6633686244d76","observation_id":"6e6596de-4638-4dfd-90ba-f7288e8a3ee8","resolution":{"observed_at":"2026-08-05T17:13:08.895793Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15880","last_updated":"2024-02-01T08:31:59Z","snapshot_observed_at":"2026-08-13T11:07:58.964675Z","submitted_at":"2023-06-28T02:33:06Z","title":"Towards Open Vocabulary Learning: A Survey","version":4},"cited_work":{"arxiv_id":"2306.15880","doi":null,"metadata_source":"pith","pith_arxiv_id":"2306.15880","snapshot_observed_at":"2026-08-05T17:13:08.000099Z","title":"Towards Open Vocabulary Learning: A Survey","venue":"cs.CV","work_id":"d852334c-978e-4c83-82b3-7373281243aa","year":2023},"citing_paper":{"arxiv_id":"2508.16812","last_updated":"2025-08-22T22:02:49Z","snapshot_observed_at":"2026-08-08T13:15:18.737038Z","submitted_at":"2025-08-22T22:02:49Z","title":"Towards Open-Vocabulary Multimodal 3D Object Detection with Attributes","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:05.638687Z"},"links":{"cited_paper":"/paper/2306.15880","citing_paper":"/paper/2508.16812"},"observation_digest":"sha256:ac2a909674c3b5b2aed48dec089beb15992edd578085769b6228fecec307f804","observation_id":"74593d27-35fd-4cd5-be04-5504b25e89aa","resolution":{"observed_at":"2026-08-05T17:13:08.006377Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03620","last_updated":"2023-11-07T00:12:01Z","snapshot_observed_at":"2026-08-15T01:49:20.674017Z","submitted_at":"2023-11-07T00:12:01Z","title":"FusionViT: Hierarchical 3D Object Detection via LiDAR-Camera Vision Transformer Fusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03620","snapshot_observed_at":"2026-08-05T17:13:05.763277Z","title":"FusionViT: Hierarchical 3D object detection via LiDAR- camera vision transformer fusion.arXiv preprint arXiv:2311.03620, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.16812","last_updated":"2025-08-22T22:02:49Z","snapshot_observed_at":"2026-08-08T13:15:18.737038Z","submitted_at":"2025-08-22T22:02:49Z","title":"Towards Open-Vocabulary Multimodal 3D Object Detection with Attributes","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:05.763277Z"},"links":{"cited_paper":"/paper/2311.03620","citing_paper":"/paper/2508.16812"},"observation_digest":"sha256:cde46bc469c91314b6cf75e7a1c167f5815109c85ffc0cf8d52717bf574d95b3","observation_id":"7e732a7a-114b-4d1f-b7be-a104fda0f275","resolution":{"observed_at":"2026-08-05T17:13:05.763277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2311.0374","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:07.883591Z","title":"3DifFusionDet: Diffusion model for 3D object detection with robust LiDAR-camera fusion.arXiv preprint arXiv:2311.0374, 2023","venue":null,"work_id":"b7fbb4aa-3cce-48ac-b066-5ae4dea726e4","year":2023},"citing_paper":{"arxiv_id":"2508.16812","last_updated":"2025-08-22T22:02:49Z","snapshot_observed_at":"2026-08-08T13:15:18.737038Z","submitted_at":"2025-08-22T22:02:49Z","title":"Towards Open-Vocabulary Multimodal 3D Object Detection with Attributes","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:05.930584Z"},"links":{"citing_paper":"/paper/2508.16812"},"observation_digest":"sha256:4659d46a92609e0f4e872dd3dbdd434cb7cbf8a0d6474f86430f267cd354bf30","observation_id":"d4098634-ae30-4531-82c2-b551b1eddb60","resolution":{"observed_at":"2026-08-05T17:13:07.953455Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12317","last_updated":"2024-03-18T23:22:37Z","snapshot_observed_at":"2026-08-13T00:50:47.444823Z","submitted_at":"2024-03-18T23:22:37Z","title":"EffiPerception: an Efficient Framework for Various Perception Tasks","version":1},"cited_work":{"arxiv_id":"2403.12317","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.12317","snapshot_observed_at":"2026-08-05T17:13:07.613586Z","title":"EffiPerception: an Efficient Framework for Various Perception Tasks","venue":"cs.CV","work_id":"2e1b149c-c63b-4de0-adde-3474eb5e66cf","year":2024},"citing_paper":{"arxiv_id":"2508.16812","last_updated":"2025-08-22T22:02:49Z","snapshot_observed_at":"2026-08-08T13:15:18.737038Z","submitted_at":"2025-08-22T22:02:49Z","title":"Towards Open-Vocabulary Multimodal 3D Object Detection with Attributes","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:06.036014Z"},"links":{"cited_paper":"/paper/2403.12317","citing_paper":"/paper/2508.16812"},"observation_digest":"sha256:21063115ec66172ba6cda4c225d5ed50523debd26638733b376c9bca0256b139","observation_id":"6c5b56a5-94f0-4a35-af10-38ab6e6203b0","resolution":{"observed_at":"2026-08-05T17:13:07.702417Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1808.00191","last_updated":"2018-08-01T06:50:19Z","snapshot_observed_at":"2026-08-15T02:43:32.664500Z","submitted_at":"2018-08-01T06:50:19Z","title":"Graph R-CNN for Scene Graph Generation","version":1},"cited_work":{"arxiv_id":"1808.00191","doi":null,"metadata_source":"pith","pith_arxiv_id":"1808.00191","snapshot_observed_at":"2026-08-05T17:13:07.445481Z","title":"Graph R-CNN for Scene Graph Generation","venue":"cs.CV","work_id":"76567201-4ea1-41f4-8a09-18129e169881","year":2018},"citing_paper":{"arxiv_id":"2508.16812","last_updated":"2025-08-22T22:02:49Z","snapshot_observed_at":"2026-08-08T13:15:18.737038Z","submitted_at":"2025-08-22T22:02:49Z","title":"Towards Open-Vocabulary Multimodal 3D Object Detection with Attributes","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:06.116837Z"},"links":{"cited_paper":"/paper/1808.00191","citing_paper":"/paper/2508.16812"},"observation_digest":"sha256:2cf2bbced9d7ec2d5e7be2758c96962cf46f030afe7d693b37eb7fd4932fae5f","observation_id":"91b533a6-5f6e-4b49-86d4-4fb4a3360e09","resolution":{"observed_at":"2026-08-05T17:13:07.519380Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/978-3-031-20077-9_7","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"Open-vocabulary DETR with conditional matching","venue":"Lecture notes in computer science","work_id":"f6d7ee93-1048-4285-9a62-8ccf00b491b6","year":2022},"citing_paper":{"arxiv_id":"2508.16812","last_updated":"2025-08-22T22:02:49Z","snapshot_observed_at":"2026-08-08T13:15:18.737038Z","submitted_at":"2025-08-22T22:02:49Z","title":"Towards Open-Vocabulary Multimodal 3D Object Detection with Attributes","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:06.198543Z"},"links":{"citing_paper":"/paper/2508.16812"},"observation_digest":"sha256:c67cff59e03ed8d9e797f77231c3e979c83538146b5dd276b98a13e8328e24ed","observation_id":"d37adc28-e3b3-44ff-ba67-1b6365d0cabd","resolution":{"observed_at":"2026-08-05T17:13:07.148949Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2011.10678","last_updated":"2021-03-14T18:45:04Z","snapshot_observed_at":"2026-08-13T20:59:21.324767Z","submitted_at":"2020-11-20T23:05:46Z","title":"Open-Vocabulary Object Detection Using Captions","version":2},"cited_work":{"arxiv_id":"2011.10678","doi":null,"metadata_source":"pith","pith_arxiv_id":"2011.10678","snapshot_observed_at":"2026-08-05T17:13:07.259985Z","title":"Open-Vocabulary Object Detection Using Captions","venue":"cs.CV","work_id":"ac048c50-3c92-4877-a8f9-688b2cf1062d","year":2020},"citing_paper":{"arxiv_id":"2508.16812","last_updated":"2025-08-22T22:02:49Z","snapshot_observed_at":"2026-08-08T13:15:18.737038Z","submitted_at":"2025-08-22T22:02:49Z","title":"Towards Open-Vocabulary Multimodal 3D Object Detection with Attributes","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:06.300876Z"},"links":{"cited_paper":"/paper/2011.10678","citing_paper":"/paper/2508.16812"},"observation_digest":"sha256:39936cd72c2979b993f4a0f77a26a93753148af8567c3ebd4d925051d0675382","observation_id":"32c79f97-0f4c-4abb-9c36-4cfb103414ca","resolution":{"observed_at":"2026-08-05T17:13:07.337789Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:08.872897Z","title":"FM-OV3D: Foundation model-based cross-modal knowledge blending for open-vocabulary 3D detection","venue":null,"work_id":"e3de7a9f-df99-4f57-9793-2a13c9d5926b","year":2024},"citing_paper":{"arxiv_id":"2508.16812","last_updated":"2025-08-22T22:02:49Z","snapshot_observed_at":"2026-08-08T13:15:18.737038Z","submitted_at":"2025-08-22T22:02:49Z","title":"Towards Open-Vocabulary Multimodal 3D Object Detection with Attributes","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:06.391908Z"},"links":{"citing_paper":"/paper/2508.16812"},"observation_digest":"sha256:3a7332e7449b720daba0f30fa4d8b96f825068845ad940990fa2db1269ec234d","observation_id":"f02b52ce-72b7-4aed-9ed4-519b2f9548b2","resolution":{"observed_at":"2026-08-05T17:13:08.878591Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:08.854997Z","title":"OpenSight: A simple open-vocabulary framework for LiDAR-based object detection","venue":null,"work_id":"6805f5bd-15aa-48cb-be90-3add140fb8d0","year":2024},"citing_paper":{"arxiv_id":"2508.16812","last_updated":"2025-08-22T22:02:49Z","snapshot_observed_at":"2026-08-08T13:15:18.737038Z","submitted_at":"2025-08-22T22:02:49Z","title":"Towards Open-Vocabulary Multimodal 3D Object Detection with Attributes","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:06.478801Z"},"links":{"citing_paper":"/paper/2508.16812"},"observation_digest":"sha256:0b64f12746f0dffbe0d1aa47575372c322a66761abe6f8a7b4c8f6153de82b2a","observation_id":"0ffd2678-aa19-4326-be4b-169e30a6c3a8","resolution":{"observed_at":"2026-08-05T17:13:08.860512Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:08.832600Z","title":"G, Anastasis Stathopoulos, Manmohan Chandraker, and Dimitris Metaxas","venue":null,"work_id":"e4d742e0-99ad-4bf8-91bc-453b24a14e41","year":2022},"citing_paper":{"arxiv_id":"2508.16812","last_updated":"2025-08-22T22:02:49Z","snapshot_observed_at":"2026-08-08T13:15:18.737038Z","submitted_at":"2025-08-22T22:02:49Z","title":"Towards Open-Vocabulary Multimodal 3D Object Detection with Attributes","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:06.561654Z"},"links":{"citing_paper":"/paper/2508.16812"},"observation_digest":"sha256:01b2ef6ddb092606f2a660d865ef47ff0a6cde1c8f7531ce46de870f7a4eed15","observation_id":"c38fb163-4d80-43bf-ba6d-f93513cef3f2","resolution":{"observed_at":"2026-08-05T17:13:08.839413Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:08.811888Z","title":"OcTr: Octree-based transformer for 3D object detection","venue":null,"work_id":"4085e152-770b-46a2-ae0c-923cc68c640f","year":2023},"citing_paper":{"arxiv_id":"2508.16812","last_updated":"2025-08-22T22:02:49Z","snapshot_observed_at":"2026-08-08T13:15:18.737038Z","submitted_at":"2025-08-22T22:02:49Z","title":"Towards Open-Vocabulary Multimodal 3D Object Detection with Attributes","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:06.650142Z"},"links":{"citing_paper":"/paper/2508.16812"},"observation_digest":"sha256:bf6a1065eea57cd1c69bd08cffc67ae2a71c798d1bc58ceaa028a3fa909df679","observation_id":"8fd75d1e-f795-4927-90fd-bd099936e1de","resolution":{"observed_at":"2026-08-05T17:13:08.816793Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-05T17:13:06.743796Z","title":"Object2Scene: Putting objects in context for open-vocabulary 3D detection.arXiv preprint arXiv:2311.03079, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.16812","last_updated":"2025-08-22T22:02:49Z","snapshot_observed_at":"2026-08-08T13:15:18.737038Z","submitted_at":"2025-08-22T22:02:49Z","title":"Towards Open-Vocabulary Multimodal 3D Object Detection with Attributes","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:06.743796Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2508.16812"},"observation_digest":"sha256:e3d92c467629c5a0af3b077fddc593cc29a2972261a5f380faba06c773209d98","observation_id":"e84cafae-c49f-4a74-b668-7d794db8d9da","resolution":{"observed_at":"2026-08-05T17:13:06.743796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:08.794888Z","title":"PointCLIP V2: Prompting CLIP and GPT for powerful 3D open-world learning","venue":null,"work_id":"d088bdb0-10b4-4d34-bb01-ea1669065195","year":2023},"citing_paper":{"arxiv_id":"2508.16812","last_updated":"2025-08-22T22:02:49Z","snapshot_observed_at":"2026-08-08T13:15:18.737038Z","submitted_at":"2025-08-22T22:02:49Z","title":"Towards Open-Vocabulary Multimodal 3D Object Detection with Attributes","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:06.857653Z"},"links":{"citing_paper":"/paper/2508.16812"},"observation_digest":"sha256:98ee920a6c24cd02f421e8867e9d00d63659149b6c67d8597c12d7e16a09636f","observation_id":"af50caab-0370-43a9-b0b5-631aea67a62b","resolution":{"observed_at":"2026-08-05T17:13:08.799818Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:08.779516Z","title":"Then, the model continues to be trained for 20 epochs","venue":null,"work_id":"b1362bc2-8b23-4c27-b1a4-40790f5801d9","year":null},"citing_paper":{"arxiv_id":"2508.16812","last_updated":"2025-08-22T22:02:49Z","snapshot_observed_at":"2026-08-08T13:15:18.737038Z","submitted_at":"2025-08-22T22:02:49Z","title":"Towards Open-Vocabulary Multimodal 3D Object Detection with Attributes","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:06.935892Z"},"links":{"citing_paper":"/paper/2508.16812"},"observation_digest":"sha256:fb53ff6c4daf6ea3ba4474acba2d5825684ae27a8444b829b98637fb097e1c29","observation_id":"f4e88895-2b6d-422c-95bc-46b5a19585ec","resolution":{"observed_at":"2026-08-05T17:13:08.784314Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.03700","last_updated":"2025-01-09T09:12:06Z","snapshot_observed_at":"2026-08-13T05:08:29.655523Z","submitted_at":"2023-12-06T18:59:19Z","title":"OneLLM: One Framework to Align All Modalities with Language","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.03700","snapshot_observed_at":"2026-08-05T17:13:02.378508Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.16812","last_updated":"2025-08-22T22:02:49Z","snapshot_observed_at":"2026-08-08T13:15:18.737038Z","submitted_at":"2025-08-22T22:02:49Z","title":"Towards Open-Vocabulary Multimodal 3D Object Detection with Attributes","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:02.378508Z"},"links":{"cited_paper":"/paper/2312.03700","citing_paper":"/paper/2508.16812"},"observation_digest":"sha256:d4ba20bab486fb3113dcd130bc2f6a02f19844fcfb7a71caa0118da954d97c31","observation_id":"3a331ea2-4e45-46c3-b90b-5d7b8e65f565","resolution":{"observed_at":"2026-08-05T17:13:02.378508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2508.16812","last_updated":"2025-08-22T22:02:49Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T13:15:18.737038Z","submitted_at":"2025-08-22T22:02:49Z","title":"Towards Open-Vocabulary Multimodal 3D Object Detection with Attributes"},"reference_resolution":{"displayed":56,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":13,"verified_exact":11,"verified_fuzzy":32},"total_outbound_references":56},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 56 of 56 outbound references and 0 inbound Pith citation observations for arXiv:2508.16812."}