{"as_of":"2026-08-18T12:30:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c363fd581a6b06c645fa9f5f852a5f3ecf8f63dc62f9496886bf42468e0dfdba","coverage":[{"denominator":63,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":63,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T11:13:36.729314Z","state":"measured"},{"denominator":63,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":63,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2411.18666/citation-record","integrity":"/paper/2411.18666/integrity","json":"/paper/2411.18666/citation-record.json","paper":"/paper/2411.18666"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:13:38.926892Z","title":"Referit3D: Neural listeners for fine-grained 3D object identification in real-world scenes","venue":null,"work_id":"a6a7e3c1-2907-4153-898a-07d415b7705a","year":2020},"citing_paper":{"arxiv_id":"2411.18666","last_updated":"2024-11-27T16:10:44Z","snapshot_observed_at":"2026-08-17T23:31:17.689410Z","submitted_at":"2024-11-27T16:10:44Z","title":"3D Scene Graph Guided Vision-Language Pre-training","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T11:13:36.067631Z"},"links":{"citing_paper":"/paper/2411.18666"},"observation_digest":"sha256:10d4723dfeb0ecfd3b4cfc7a54418a5f2e6d90ea67a0715ad9d0852bb17337a8","observation_id":"d904d31c-8ce4-418e-9f95-364ff0aa5bd3","resolution":{"observed_at":"2026-08-12T11:13:38.941437Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:13:38.899798Z","title":"Scanqa: 3D question answering for spatial scene understanding","venue":null,"work_id":"74b9d5c2-b7a1-48ad-b288-f58ca70cce3d","year":2022},"citing_paper":{"arxiv_id":"2411.18666","last_updated":"2024-11-27T16:10:44Z","snapshot_observed_at":"2026-08-17T23:31:17.689410Z","submitted_at":"2024-11-27T16:10:44Z","title":"3D Scene Graph Guided Vision-Language Pre-training","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T11:13:36.075948Z"},"links":{"citing_paper":"/paper/2411.18666"},"observation_digest":"sha256:422edcc2334c02126a0a39520c71a63965ad8df494b21edb19d8f8e8160ba076","observation_id":"be7fb37e-cab9-46f4-9462-15f2ac409ff0","resolution":{"observed_at":"2026-08-12T11:13:38.911304Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:13:38.872574Z","title":"Meteor: An automatic metric for mt evaluation with improved correlation with hu- man judgments","venue":null,"work_id":"5fc9179e-69bd-4421-8e6d-fcd60dd72f4e","year":2005},"citing_paper":{"arxiv_id":"2411.18666","last_updated":"2024-11-27T16:10:44Z","snapshot_observed_at":"2026-08-17T23:31:17.689410Z","submitted_at":"2024-11-27T16:10:44Z","title":"3D Scene Graph Guided Vision-Language Pre-training","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T11:13:36.090937Z"},"links":{"citing_paper":"/paper/2411.18666"},"observation_digest":"sha256:747e67d0eeded616e9dde088ea1233b7eb1c65570776d78ac38de0ec9951f77b","observation_id":"9256b3a2-a057-4bea-9edd-a959b4aeb8bf","resolution":{"observed_at":"2026-08-12T11:13:38.879255Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:13:38.849373Z","title":"3DJCG: A unified framework for joint dense captioning and visual grounding on 3D point clouds","venue":null,"work_id":"d378a61a-7e55-412c-9918-61d64b6e2396","year":2022},"citing_paper":{"arxiv_id":"2411.18666","last_updated":"2024-11-27T16:10:44Z","snapshot_observed_at":"2026-08-17T23:31:17.689410Z","submitted_at":"2024-11-27T16:10:44Z","title":"3D Scene Graph Guided Vision-Language Pre-training","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T11:13:36.098706Z"},"links":{"citing_paper":"/paper/2411.18666"},"observation_digest":"sha256:423edff19a8f4b40e30dbf1fef514a600c7358284fa258c3992503be7dd8427d","observation_id":"e1a35ee1-bbbc-4f12-ad66-ecba3a64f95b","resolution":{"observed_at":"2026-08-12T11:13:38.855501Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:13:38.818318Z","title":"Scanrefer: 3D object localization in RGB-D scans using natural language","venue":null,"work_id":"ae37bc24-0aff-4149-b406-0640ff9a0e98","year":null},"citing_paper":{"arxiv_id":"2411.18666","last_updated":"2024-11-27T16:10:44Z","snapshot_observed_at":"2026-08-17T23:31:17.689410Z","submitted_at":"2024-11-27T16:10:44Z","title":"3D Scene Graph Guided Vision-Language Pre-training","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T11:13:36.105899Z"},"links":{"citing_paper":"/paper/2411.18666"},"observation_digest":"sha256:b08d0d29d542c7e6367bb8bfb9c2c64efe0422756223bae2a0e5234ee0bfab68","observation_id":"54ee0b72-a096-4a8e-a3a1-09e805387cb3","resolution":{"observed_at":"2026-08-12T11:13:38.828887Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.00836","last_updated":"2022-12-01T19:45:09Z","snapshot_observed_at":"2026-08-17T05:00:32.344694Z","submitted_at":"2022-12-01T19:45:09Z","title":"UniT3D: A Unified Transformer for 3D Dense Captioning and Visual Grounding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.00836","snapshot_observed_at":"2026-08-12T11:13:36.119765Z","title":"UniT3D: A unified trans- former for 3D dense captioning and visual grounding","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.18666","last_updated":"2024-11-27T16:10:44Z","snapshot_observed_at":"2026-08-17T23:31:17.689410Z","submitted_at":"2024-11-27T16:10:44Z","title":"3D Scene Graph Guided Vision-Language Pre-training","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T11:13:36.119765Z"},"links":{"cited_paper":"/paper/2212.00836","citing_paper":"/paper/2411.18666"},"observation_digest":"sha256:d82ea9e347b1cd80d4a9056a8add674ad6294d019fb406fcb577339e981fef2a","observation_id":"e0553d85-eb06-498a-a401-b7fe7060acf6","resolution":{"observed_at":"2026-08-12T11:13:36.119765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:13:38.779074Z","title":"D 3net: A unified speaker-listener architec- ture for 3D dense captioning and visual grounding","venue":null,"work_id":"266ed44e-6391-4b61-820d-846dc449312f","year":2022},"citing_paper":{"arxiv_id":"2411.18666","last_updated":"2024-11-27T16:10:44Z","snapshot_observed_at":"2026-08-17T23:31:17.689410Z","submitted_at":"2024-11-27T16:10:44Z","title":"3D Scene Graph Guided Vision-Language Pre-training","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T11:13:36.132167Z"},"links":{"citing_paper":"/paper/2411.18666"},"observation_digest":"sha256:d0cb15050bcf2bdbbed459e39a963658bb921795e0d49e9c2b042108a81be0bf","observation_id":"482814b2-9443-4391-b56c-45ebf84c4f28","resolution":{"observed_at":"2026-08-12T11:13:38.787228Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09646","last_updated":"2022-11-17T16:42:39Z","snapshot_observed_at":"2026-08-16T16:15:20.821801Z","submitted_at":"2022-11-17T16:42:39Z","title":"Language Conditioned Spatial Relation Reasoning for 3D Object Grounding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09646","snapshot_observed_at":"2026-08-12T11:13:36.142026Z","title":"Language conditioned spatial relation reasoning for 3D object grounding","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.18666","last_updated":"2024-11-27T16:10:44Z","snapshot_observed_at":"2026-08-17T23:31:17.689410Z","submitted_at":"2024-11-27T16:10:44Z","title":"3D Scene Graph Guided Vision-Language Pre-training","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T11:13:36.142026Z"},"links":{"cited_paper":"/paper/2211.09646","citing_paper":"/paper/2411.18666"},"observation_digest":"sha256:4285a26e27e2a0bc2cc09c57bc32d8c502fa6bfdf5a5375136cdb2eeaf995a93","observation_id":"cdc9c32c-7958-482a-8728-3b504033a28e","resolution":{"observed_at":"2026-08-12T11:13:36.142026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02508","last_updated":"2023-01-06T13:46:45Z","snapshot_observed_at":"2026-08-16T16:04:01.930412Z","submitted_at":"2023-01-06T13:46:45Z","title":"End-to-End 3D Dense Captioning with Vote2Cap-DETR","version":1},"cited_work":{"arxiv_id":"2301.02508","doi":null,"metadata_source":"pith","pith_arxiv_id":"2301.02508","snapshot_observed_at":"2026-08-12T11:13:37.165775Z","title":"End-to-End 3D Dense Captioning with Vote2Cap-DETR","venue":"cs.CV","work_id":"65a6bc63-b714-496f-b74e-7b2b4af85ae7","year":2023},"citing_paper":{"arxiv_id":"2411.18666","last_updated":"2024-11-27T16:10:44Z","snapshot_observed_at":"2026-08-17T23:31:17.689410Z","submitted_at":"2024-11-27T16:10:44Z","title":"3D Scene Graph Guided Vision-Language Pre-training","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T11:13:36.148543Z"},"links":{"cited_paper":"/paper/2301.02508","citing_paper":"/paper/2411.18666"},"observation_digest":"sha256:7a55fc5f65d3c99e62b0c0d21eeb2e1abfb60dde94352cfb534085aa607ac7a1","observation_id":"645089ad-5419-4f2b-8c07-12326b1c8259","resolution":{"observed_at":"2026-08-12T11:13:37.175474Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:13:38.742432Z","title":"Simclr: A simple framework for contrastive learning of visual representations","venue":null,"work_id":"a538147c-34ac-427e-a3cb-a794f43333f4","year":2023},"citing_paper":{"arxiv_id":"2411.18666","last_updated":"2024-11-27T16:10:44Z","snapshot_observed_at":"2026-08-17T23:31:17.689410Z","submitted_at":"2024-11-27T16:10:44Z","title":"3D Scene Graph Guided Vision-Language Pre-training","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T11:13:36.164142Z"},"links":{"citing_paper":"/paper/2411.18666"},"observation_digest":"sha256:6c3b1780004c9becc79d9746958e76afc0f9f0c003b64c2531de482b0c44717b","observation_id":"1eae4423-c0f7-440f-8270-d92e8eede3d9","resolution":{"observed_at":"2026-08-12T11:13:38.748738Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:13:38.710059Z","title":"Scan2cap: Context-aware dense captioning in RGB- D scans","venue":null,"work_id":"1c16577e-3efc-4864-9216-4f5664bb36d5","year":2021},"citing_paper":{"arxiv_id":"2411.18666","last_updated":"2024-11-27T16:10:44Z","snapshot_observed_at":"2026-08-17T23:31:17.689410Z","submitted_at":"2024-11-27T16:10:44Z","title":"3D Scene Graph Guided Vision-Language Pre-training","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T11:13:36.177460Z"},"links":{"citing_paper":"/paper/2411.18666"},"observation_digest":"sha256:86b92c089add04569c5fd2b6c9435a15569424ce7c271059f1d716dacde306cb","observation_id":"9c04a5c1-edd0-450b-9aab-bb5b3a831654","resolution":{"observed_at":"2026-08-12T11:13:38.717928Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.3555","last_updated":"2014-12-11T06:46:53Z","snapshot_observed_at":"2026-08-13T10:35:27.214652Z","submitted_at":"2014-12-11T06:46:53Z","title":"Empirical Evaluation of Gated Recurrent Neural Networks on Sequence Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.3555","snapshot_observed_at":"2026-08-12T11:13:36.186265Z","title":"Empirical evaluation of gated recurrent neural networks on sequence modeling","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2411.18666","last_updated":"2024-11-27T16:10:44Z","snapshot_observed_at":"2026-08-17T23:31:17.689410Z","submitted_at":"2024-11-27T16:10:44Z","title":"3D Scene Graph Guided Vision-Language Pre-training","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T11:13:36.186265Z"},"links":{"cited_paper":"/paper/1412.3555","citing_paper":"/paper/2411.18666"},"observation_digest":"sha256:d6f6dcb80c9bb4ca64dee6f8604b8efd5ec81ff47a1f77989e8084849547607f","observation_id":"06d9a5d4-d9d6-4a16-a87b-242937f7b853","resolution":{"observed_at":"2026-08-12T11:13:36.186265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:13:38.678387Z","title":"Scannet: Richly-annotated 3D reconstructions of indoor scenes","venue":null,"work_id":"02fec10e-47d7-40ed-b16e-3cc3efb40340","year":2017},"citing_paper":{"arxiv_id":"2411.18666","last_updated":"2024-11-27T16:10:44Z","snapshot_observed_at":"2026-08-17T23:31:17.689410Z","submitted_at":"2024-11-27T16:10:44Z","title":"3D Scene Graph Guided Vision-Language Pre-training","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T11:13:36.192424Z"},"links":{"citing_paper":"/paper/2411.18666"},"observation_digest":"sha256:250fe69b44d721ff5eed78a8f14f0b12fa3432d27e92bfb5ef6f97923c84ab44","observation_id":"2ca348ef-f9d4-4bee-a0fb-a2895c547056","resolution":{"observed_at":"2026-08-12T11:13:38.688778Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02329","last_updated":"2023-06-04T11:08:53Z","snapshot_observed_at":"2026-08-16T15:26:48.033888Z","submitted_at":"2023-06-04T11:08:53Z","title":"Multi-CLIP: Contrastive Vision-Language Pre-training for Question Answering tasks in 3D Scenes","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02329","snapshot_observed_at":"2026-08-12T11:13:36.201254Z","title":"Multi-clip: Contrastive vision-language pre-training for question answering tasks in 3D scenes.arXiv preprint arXiv:2306.02329, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18666","last_updated":"2024-11-27T16:10:44Z","snapshot_observed_at":"2026-08-17T23:31:17.689410Z","submitted_at":"2024-11-27T16:10:44Z","title":"3D Scene Graph Guided Vision-Language Pre-training","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T11:13:36.201254Z"},"links":{"cited_paper":"/paper/2306.02329","citing_paper":"/paper/2411.18666"},"observation_digest":"sha256:b87838a316bac05abee1015ab2b9611bafd38c91611edc990603831b1a2f62e5","observation_id":"6148387c-a619-43d0-b9ce-9d56e1a5d581","resolution":{"observed_at":"2026-08-12T11:13:36.201254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-08-14T18:16:28.847993Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-12T11:13:36.208235Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.18666","last_updated":"2024-11-27T16:10:44Z","snapshot_observed_at":"2026-08-17T23:31:17.689410Z","submitted_at":"2024-11-27T16:10:44Z","title":"3D Scene Graph Guided Vision-Language Pre-training","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T11:13:36.208235Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2411.18666"},"observation_digest":"sha256:a7e14db4fc692b19be85de61427060afd30beec60d1c1e64642e77986b4b4056","observation_id":"6e037ebd-0304-4fea-be66-fe391167025e","resolution":{"observed_at":"2026-08-12T11:13:36.208235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:13:38.653884Z","title":"Multi-modal align- ment using representation codebook","venue":null,"work_id":"c5e599c9-c1f9-48ae-9b77-dc85eaa99eb0","year":2022},"citing_paper":{"arxiv_id":"2411.18666","last_updated":"2024-11-27T16:10:44Z","snapshot_observed_at":"2026-08-17T23:31:17.689410Z","submitted_at":"2024-11-27T16:10:44Z","title":"3D Scene Graph Guided Vision-Language Pre-training","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T11:13:36.216194Z"},"links":{"citing_paper":"/paper/2411.18666"},"observation_digest":"sha256:1099ecd68c81a68b62eb9be263515a61cf02b40df824c7c643f01932621e5203","observation_id":"46c911d3-3f83-4605-b491-89e16ab45a50","resolution":{"observed_at":"2026-08-12T11:13:38.661247Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:13:38.625913Z","title":"Free-form description guided 3D visual graph network for object grounding in point cloud","venue":null,"work_id":"c9aab56a-99b7-4741-9f5c-42a7027eda34","year":2021},"citing_paper":{"arxiv_id":"2411.18666","last_updated":"2024-11-27T16:10:44Z","snapshot_observed_at":"2026-08-17T23:31:17.689410Z","submitted_at":"2024-11-27T16:10:44Z","title":"3D Scene Graph Guided Vision-Language Pre-training","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T11:13:36.227686Z"},"links":{"citing_paper":"/paper/2411.18666"},"observation_digest":"sha256:760411a45f66431dd15140f79d5ece2d16f65b71eb41b252530deb1ab8e0eb24","observation_id":"35ecd526-1ac5-4141-9a44-49c7922836c0","resolution":{"observed_at":"2026-08-12T11:13:38.636225Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.16894","last_updated":"2023-12-05T05:34:18Z","snapshot_observed_at":"2026-08-16T15:44:18.843905Z","submitted_at":"2023-03-29T17:59:10Z","title":"ViewRefer: Grasp the Multi-view Knowledge for 3D Visual Grounding with GPT and Prototype Guidance","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.16894","snapshot_observed_at":"2026-08-12T11:13:36.245100Z","title":"Viewrefer: Grasp the multi-view knowledge for 3D visual grounding with gpt and prototype guidance","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.18666","last_updated":"2024-11-27T16:10:44Z","snapshot_observed_at":"2026-08-17T23:31:17.689410Z","submitted_at":"2024-11-27T16:10:44Z","title":"3D Scene Graph Guided Vision-Language Pre-training","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T11:13:36.245100Z"},"links":{"cited_paper":"/paper/2303.16894","citing_paper":"/paper/2411.18666"},"observation_digest":"sha256:1a18667d0c74045b2fc533cc4b2f9153b5b7eb6ed2557cfcfb5d9759bb2665a6","observation_id":"89e366f2-9e98-47b9-922b-6467d7e3e23c","resolution":{"observed_at":"2026-08-12T11:13:36.245100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:13:36.264686Z","title":"Masked autoencoders are scalable vision learners","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.18666","last_updated":"2024-11-27T16:10:44Z","snapshot_observed_at":"2026-08-17T23:31:17.689410Z","submitted_at":"2024-11-27T16:10:44Z","title":"3D Scene Graph Guided Vision-Language Pre-training","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T11:13:36.264686Z"},"links":{"citing_paper":"/paper/2411.18666"},"observation_digest":"sha256:8597029a8fefcf0c8d7829bd285238bf407a92909233454bc8b7b07a771d4942","observation_id":"0a7836a0-ad93-4bc4-9554-f6f8d85d3038","resolution":{"observed_at":"2026-08-12T11:13:36.264686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:13:38.544789Z","title":"Text-guided graph neural networks for refer- ring 3D instance segmentation","venue":null,"work_id":"35dbf17c-7587-41b9-a141-bfa4e9a52f1a","year":2021},"citing_paper":{"arxiv_id":"2411.18666","last_updated":"2024-11-27T16:10:44Z","snapshot_observed_at":"2026-08-17T23:31:17.689410Z","submitted_at":"2024-11-27T16:10:44Z","title":"3D Scene Graph Guided Vision-Language Pre-training","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T11:13:36.275054Z"},"links":{"citing_paper":"/paper/2411.18666"},"observation_digest":"sha256:7df56ba43b23cb55200c43c8510dfa4e51c5bcd1eab972ef5ea18dd43b3e9625","observation_id":"3b84bbb6-3d71-4fbc-b32b-defdf2e8dc1d","resolution":{"observed_at":"2026-08-12T11:13:38.559829Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:13:38.508624Z","title":"Multi- view transformer for 3D visual grounding","venue":null,"work_id":"5d720dce-932f-454c-add3-f9f6f26ff60e","year":2022},"citing_paper":{"arxiv_id":"2411.18666","last_updated":"2024-11-27T16:10:44Z","snapshot_observed_at":"2026-08-17T23:31:17.689410Z","submitted_at":"2024-11-27T16:10:44Z","title":"3D Scene Graph Guided Vision-Language Pre-training","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T11:13:36.290301Z"},"links":{"citing_paper":"/paper/2411.18666"},"observation_digest":"sha256:0fe4647f05fa0d31f3d7c4e0903252b91096b0bc12c060519408fe80e2c14f45","observation_id":"d703c403-646a-40e8-b776-484f3a84121a","resolution":{"observed_at":"2026-08-12T11:13:38.519069Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:13:38.478001Z","title":"Clip2point: Transfer clip to point cloud classifica- tion with image-depth pre-training","venue":null,"work_id":"ce493621-ad26-4c6f-996e-bfbb83ec9dd3","year":2023},"citing_paper":{"arxiv_id":"2411.18666","last_updated":"2024-11-27T16:10:44Z","snapshot_observed_at":"2026-08-17T23:31:17.689410Z","submitted_at":"2024-11-27T16:10:44Z","title":"3D Scene Graph Guided Vision-Language Pre-training","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T11:13:36.299677Z"},"links":{"citing_paper":"/paper/2411.18666"},"observation_digest":"sha256:11229c95da87e78ec5a88ba3a2840f8ebfe3058a3ee72436aacbdf7b3ee96704","observation_id":"dc79bff9-a612-41e8-806b-6d6231baab9e","resolution":{"observed_at":"2026-08-12T11:13:38.488174Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:13:38.441348Z","title":"Bottom up top down detection transform- ers for language grounding in images and point clouds","venue":null,"work_id":"b79d926b-dcc7-4819-8aa6-5b754e56727f","year":2022},"citing_paper":{"arxiv_id":"2411.18666","last_updated":"2024-11-27T16:10:44Z","snapshot_observed_at":"2026-08-17T23:31:17.689410Z","submitted_at":"2024-11-27T16:10:44Z","title":"3D Scene Graph Guided Vision-Language Pre-training","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T11:13:36.307834Z"},"links":{"citing_paper":"/paper/2411.18666"},"observation_digest":"sha256:2891e67531a8af19f3aa45c69c7cfa5968626bdbd035370f9a9d4593f639e3aa","observation_id":"80f76758-69ec-477c-a06e-b42c95b9799a","resolution":{"observed_at":"2026-08-12T11:13:38.454472Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:13:38.403297Z","title":"Scaling up visual and vision-language representa- tion learning with noisy text supervision","venue":null,"work_id":"9e73c070-8e90-4408-af2f-00d1ecc5849a","year":2021},"citing_paper":{"arxiv_id":"2411.18666","last_updated":"2024-11-27T16:10:44Z","snapshot_observed_at":"2026-08-17T23:31:17.689410Z","submitted_at":"2024-11-27T16:10:44Z","title":"3D Scene Graph Guided Vision-Language Pre-training","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T11:13:36.316408Z"},"links":{"citing_paper":"/paper/2411.18666"},"observation_digest":"sha256:19adf2f19995b38cc92ab641881f9c5adb25c947ae4159bb6426d72dc1a4dee5","observation_id":"3d2c4fcc-275b-4085-85de-12e4066ecb49","resolution":{"observed_at":"2026-08-12T11:13:38.414822Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:13:38.372974Z","title":"More: Multi-order relation mining for dense captioning in 3D scenes","venue":null,"work_id":"39671d12-a224-4a6c-a8d1-1ce78b60d03e","year":null},"citing_paper":{"arxiv_id":"2411.18666","last_updated":"2024-11-27T16:10:44Z","snapshot_observed_at":"2026-08-17T23:31:17.689410Z","submitted_at":"2024-11-27T16:10:44Z","title":"3D Scene Graph Guided Vision-Language Pre-training","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T11:13:36.329853Z"},"links":{"citing_paper":"/paper/2411.18666"},"observation_digest":"sha256:1ce9ae5aabf72dd800378cc816025ac4d13896a8b0d006710fde935e0ff5aaf7","observation_id":"d5ce4dcf-1918-435f-a60f-b404bfceaabc","resolution":{"observed_at":"2026-08-12T11:13:38.384467Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:13:38.305026Z","title":"Context-aware alignment and mutual masking for 3D-language pre-training","venue":null,"work_id":"4a178c5b-1d16-488a-a311-05ba89b8fe0f","year":2023},"citing_paper":{"arxiv_id":"2411.18666","last_updated":"2024-11-27T16:10:44Z","snapshot_observed_at":"2026-08-17T23:31:17.689410Z","submitted_at":"2024-11-27T16:10:44Z","title":"3D Scene Graph Guided Vision-Language Pre-training","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T11:13:36.363821Z"},"links":{"citing_paper":"/paper/2411.18666"},"observation_digest":"sha256:74ab976e8a4b680c90b129e5bba91f89ba942670801e8d60476d8c89a6102544","observation_id":"f806a9a1-4cc2-4bae-b76e-e3f58be63352","resolution":{"observed_at":"2026-08-12T11:13:38.317360Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.16494","last_updated":"2023-10-25T09:26:16Z","snapshot_observed_at":"2026-08-16T14:49:02.502064Z","submitted_at":"2023-10-25T09:26:16Z","title":"Lang3DSG: Language-based contrastive pre-training for 3D Scene Graph prediction","version":1},"cited_work":{"arxiv_id":"2310.16494","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.16494","snapshot_observed_at":"2026-08-12T11:13:36.952415Z","title":"Lang3DSG: Language-based contrastive pre-training for 3D Scene Graph prediction","venue":"cs.CV","work_id":"659afee5-8094-4018-965c-c5f0a1b59be5","year":2023},"citing_paper":{"arxiv_id":"2411.18666","last_updated":"2024-11-27T16:10:44Z","snapshot_observed_at":"2026-08-17T23:31:17.689410Z","submitted_at":"2024-11-27T16:10:44Z","title":"3D Scene Graph Guided Vision-Language Pre-training","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T11:13:36.375827Z"},"links":{"cited_paper":"/paper/2310.16494","citing_paper":"/paper/2411.18666"},"observation_digest":"sha256:55356d1768891cf390a3fb55544ed9a58cf655ab65c1d0d957128ed095a181d8","observation_id":"d952bcfe-9492-4d7d-8cd3-870011cc3b07","resolution":{"observed_at":"2026-08-12T11:13:36.965742Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:13:36.386569Z","title":"Rouge: A package for automatic evaluation of summaries","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2411.18666","last_updated":"2024-11-27T16:10:44Z","snapshot_observed_at":"2026-08-17T23:31:17.689410Z","submitted_at":"2024-11-27T16:10:44Z","title":"3D Scene Graph Guided Vision-Language Pre-training","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T11:13:36.386569Z"},"links":{"citing_paper":"/paper/2411.18666"},"observation_digest":"sha256:d91bb998c3725493523f1c6257317445789feb72d027d959f45b88b8e9887393","observation_id":"93031e7c-7f48-4ca6-8c0a-6c4c58a0c5b5","resolution":{"observed_at":"2026-08-12T11:13:36.386569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:13:38.245215Z","title":"3D-SPS: Single- stage 3D visual grounding via referred point progressive se- lection","venue":null,"work_id":"86c743ab-806a-444f-8488-4d1428b45b9f","year":2022},"citing_paper":{"arxiv_id":"2411.18666","last_updated":"2024-11-27T16:10:44Z","snapshot_observed_at":"2026-08-17T23:31:17.689410Z","submitted_at":"2024-11-27T16:10:44Z","title":"3D Scene Graph Guided Vision-Language Pre-training","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T11:13:36.393540Z"},"links":{"citing_paper":"/paper/2411.18666"},"observation_digest":"sha256:f10f2e3b73ef7153ce0995a6473210b263bddc9c0c485cd8c825a507653901ed","observation_id":"a96efaeb-f091-42ea-8ad6-0bf0c82b7355","resolution":{"observed_at":"2026-08-12T11:13:38.252235Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:13:38.216798Z","title":"Sgformer: Semantic graph transformer for point cloud-based 3D scene graph generation","venue":null,"work_id":"636db8a0-260f-4f26-b1f7-6df1c4c46344","year":2024},"citing_paper":{"arxiv_id":"2411.18666","last_updated":"2024-11-27T16:10:44Z","snapshot_observed_at":"2026-08-17T23:31:17.689410Z","submitted_at":"2024-11-27T16:10:44Z","title":"3D Scene Graph Guided Vision-Language Pre-training","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T11:13:36.403331Z"},"links":{"citing_paper":"/paper/2411.18666"},"observation_digest":"sha256:42e28c613baef7f7495e5a1c134263fcb44087c9ea2ffbe6032b693daf23bf25","observation_id":"daad1910-59d8-48ae-aed0-8cba1f351a42","resolution":{"observed_at":"2026-08-12T11:13:38.228351Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:13:38.180735Z","title":"Heterogeneous graph learning for scene graph prediction in 3d point clouds","venue":null,"work_id":"2ee003a7-1999-4abc-842f-77fec2cae4e7","year":2025},"citing_paper":{"arxiv_id":"2411.18666","last_updated":"2024-11-27T16:10:44Z","snapshot_observed_at":"2026-08-17T23:31:17.689410Z","submitted_at":"2024-11-27T16:10:44Z","title":"3D Scene Graph Guided Vision-Language Pre-training","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T11:13:36.409952Z"},"links":{"citing_paper":"/paper/2411.18666"},"observation_digest":"sha256:e9501a35fc2a1df9a1b5c4683595a683c8b6f20410e3cbe15453028815b087b0","observation_id":"f53f8afe-8753-45ca-955c-3c2fe18e140f","resolution":{"observed_at":"2026-08-12T11:13:38.187707Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:13:38.152762Z","title":"Complete 3D relationships extraction modality align- ment network for 3D dense captioning","venue":null,"work_id":"401b6b32-acee-4f7a-86a6-de3d52d26f36","year":2023},"citing_paper":{"arxiv_id":"2411.18666","last_updated":"2024-11-27T16:10:44Z","snapshot_observed_at":"2026-08-17T23:31:17.689410Z","submitted_at":"2024-11-27T16:10:44Z","title":"3D Scene Graph Guided Vision-Language Pre-training","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T11:13:36.419632Z"},"links":{"citing_paper":"/paper/2411.18666"},"observation_digest":"sha256:cf54899dffacc4bcbec263c97d342805eb18b034294c6b7ad23857416f41a8ea","observation_id":"f2fef0cf-69cc-43bf-ba2f-1c2b0ffa5488","resolution":{"observed_at":"2026-08-12T11:13:38.161343Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:13:38.118795Z","title":"An end-to- end transformer model for 3d object detection","venue":null,"work_id":"6eeb13d4-4b23-4744-9422-a8a8a2113a4e","year":2021},"citing_paper":{"arxiv_id":"2411.18666","last_updated":"2024-11-27T16:10:44Z","snapshot_observed_at":"2026-08-17T23:31:17.689410Z","submitted_at":"2024-11-27T16:10:44Z","title":"3D Scene Graph Guided Vision-Language Pre-training","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T11:13:36.427835Z"},"links":{"citing_paper":"/paper/2411.18666"},"observation_digest":"sha256:f282389c4d974f8ee0d41fef8d12e46d827169b82f14fbf9744d47fa1ab8069c","observation_id":"90d7c137-08f4-455e-8419-9246f79f905e","resolution":{"observed_at":"2026-08-12T11:13:38.126738Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:13:38.089185Z","title":"Bleu: a method for automatic evaluation of machine translation","venue":null,"work_id":"0c46b069-0224-4c13-9ffd-14372b5aea6e","year":2002},"citing_paper":{"arxiv_id":"2411.18666","last_updated":"2024-11-27T16:10:44Z","snapshot_observed_at":"2026-08-17T23:31:17.689410Z","submitted_at":"2024-11-27T16:10:44Z","title":"3D Scene Graph Guided Vision-Language Pre-training","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T11:13:36.433566Z"},"links":{"citing_paper":"/paper/2411.18666"},"observation_digest":"sha256:d55168fd7c469146e2e0f30ed15db023e4bfe9d7111b5bc027b80af5d803d779","observation_id":"2f28da01-60c4-4736-bdc0-7dbb32a1651d","resolution":{"observed_at":"2026-08-12T11:13:38.099631Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:13:38.059953Z","title":"Clip-guided vision-language pre-training for question answering in 3D scenes","venue":null,"work_id":"656df93a-849b-426d-a3c3-66532c0baf36","year":2023},"citing_paper":{"arxiv_id":"2411.18666","last_updated":"2024-11-27T16:10:44Z","snapshot_observed_at":"2026-08-17T23:31:17.689410Z","submitted_at":"2024-11-27T16:10:44Z","title":"3D Scene Graph Guided Vision-Language Pre-training","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T11:13:36.439474Z"},"links":{"citing_paper":"/paper/2411.18666"},"observation_digest":"sha256:e741c7a2e18c885b128deb13bdfa2ba3eee41d627ffe6d5c9dcf86c7086313c5","observation_id":"ec56fba2-5f36-4b63-bb68-0ddc2c83501c","resolution":{"observed_at":"2026-08-12T11:13:38.069425Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:13:38.022289Z","title":"Pytorch: An im- perative style, high-performance deep learning library","venue":null,"work_id":"c0c5f53a-3d2d-47bc-a903-9a548c1f4cdb","year":2019},"citing_paper":{"arxiv_id":"2411.18666","last_updated":"2024-11-27T16:10:44Z","snapshot_observed_at":"2026-08-17T23:31:17.689410Z","submitted_at":"2024-11-27T16:10:44Z","title":"3D Scene Graph Guided Vision-Language Pre-training","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T11:13:36.452029Z"},"links":{"citing_paper":"/paper/2411.18666"},"observation_digest":"sha256:4c20bdd2b93f40ea474b5997b17f56da5b5467cc219d2778dd82a451ce948f35","observation_id":"742e42e4-e2b4-48bf-abdc-1e281c67cc51","resolution":{"observed_at":"2026-08-12T11:13:38.031479Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:13:37.983341Z","title":"Glove: Global vectors for word representation","venue":null,"work_id":"d9e65ff8-7e45-4af6-978a-e12c9d99426c","year":2014},"citing_paper":{"arxiv_id":"2411.18666","last_updated":"2024-11-27T16:10:44Z","snapshot_observed_at":"2026-08-17T23:31:17.689410Z","submitted_at":"2024-11-27T16:10:44Z","title":"3D Scene Graph Guided Vision-Language Pre-training","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T11:13:36.468658Z"},"links":{"citing_paper":"/paper/2411.18666"},"observation_digest":"sha256:e454ecf42eb4c806461db8f71d2b45c9d6fa308756ba90a87307811671c83b1c","observation_id":"945f0afd-6094-4cd5-80b9-154dc8648ea0","resolution":{"observed_at":"2026-08-12T11:13:37.995167Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:13:37.960824Z","title":"PointNet: Deep learning on point sets for 3D classification and segmentation","venue":null,"work_id":"555e1f6a-4871-4089-a081-170659d43ef7","year":2017},"citing_paper":{"arxiv_id":"2411.18666","last_updated":"2024-11-27T16:10:44Z","snapshot_observed_at":"2026-08-17T23:31:17.689410Z","submitted_at":"2024-11-27T16:10:44Z","title":"3D Scene Graph Guided Vision-Language Pre-training","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T11:13:36.477527Z"},"links":{"citing_paper":"/paper/2411.18666"},"observation_digest":"sha256:cfb77899419444f9c287197af1d44deacdef6f6f771b3c6f6d657b34f73e0f5a","observation_id":"2e0cbfa8-531e-4385-8f5f-79eb676a4e87","resolution":{"observed_at":"2026-08-12T11:13:37.968465Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:13:37.925805Z","title":"PointNet++: Deep hierarchical feature learning on point sets in a metric space","venue":null,"work_id":"48349209-1796-4b77-90f0-1daf7f73362a","year":2017},"citing_paper":{"arxiv_id":"2411.18666","last_updated":"2024-11-27T16:10:44Z","snapshot_observed_at":"2026-08-17T23:31:17.689410Z","submitted_at":"2024-11-27T16:10:44Z","title":"3D Scene Graph Guided Vision-Language Pre-training","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T11:13:36.486896Z"},"links":{"citing_paper":"/paper/2411.18666"},"observation_digest":"sha256:e30e58e50a1be56860bd61eabc8b5783c157e08d97f10d258357f4de54669113","observation_id":"8238dd07-accd-4a70-972b-1ffa67a82a56","resolution":{"observed_at":"2026-08-12T11:13:37.936699Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:13:37.872784Z","title":"Qi, Or Litany, Kaiming He, and Leonidas J","venue":null,"work_id":"e936a2e6-a66b-4703-8a99-3fe1c7f7fefb","year":2019},"citing_paper":{"arxiv_id":"2411.18666","last_updated":"2024-11-27T16:10:44Z","snapshot_observed_at":"2026-08-17T23:31:17.689410Z","submitted_at":"2024-11-27T16:10:44Z","title":"3D Scene Graph Guided Vision-Language Pre-training","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T11:13:36.495368Z"},"links":{"citing_paper":"/paper/2411.18666"},"observation_digest":"sha256:976b8a4ddeb34ed5b14af745cd0bb8a15b3594824a5fb95f4bccd0b22617dd67","observation_id":"a65fc4c1-120f-4427-8298-6b69357c270f","resolution":{"observed_at":"2026-08-12T11:13:37.888364Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:13:36.508319Z","title":"Improving language understanding by gen- erative pre-training","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.18666","last_updated":"2024-11-27T16:10:44Z","snapshot_observed_at":"2026-08-17T23:31:17.689410Z","submitted_at":"2024-11-27T16:10:44Z","title":"3D Scene Graph Guided Vision-Language Pre-training","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T11:13:36.508319Z"},"links":{"citing_paper":"/paper/2411.18666"},"observation_digest":"sha256:0704fa2b859e18c2955f737fccecbe82f81fb77be5a58228d56683f0571f7133","observation_id":"60169241-a941-4d23-95e7-6676998543c8","resolution":{"observed_at":"2026-08-12T11:13:36.508319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:13:37.824672Z","title":"Learn- ing transferable visual models from natural language super- vision","venue":null,"work_id":"f57df996-e04c-4dcf-8a2d-8a7a07551591","year":2021},"citing_paper":{"arxiv_id":"2411.18666","last_updated":"2024-11-27T16:10:44Z","snapshot_observed_at":"2026-08-17T23:31:17.689410Z","submitted_at":"2024-11-27T16:10:44Z","title":"3D Scene Graph Guided Vision-Language Pre-training","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T11:13:36.521458Z"},"links":{"citing_paper":"/paper/2411.18666"},"observation_digest":"sha256:f76d67061d55b875b6c428c8bb10e0ff39f4e2c5dfcd6bf318a6185ec700b0a4","observation_id":"beb3ef1a-8106-4f14-9b6b-4425e5b13a0f","resolution":{"observed_at":"2026-08-12T11:13:37.830923Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:13:37.793111Z","title":"Mask3D: Mask trans- former for 3D semantic instance segmentation","venue":null,"work_id":"8fa76add-d243-4131-bf2b-896144d1949d","year":2023},"citing_paper":{"arxiv_id":"2411.18666","last_updated":"2024-11-27T16:10:44Z","snapshot_observed_at":"2026-08-17T23:31:17.689410Z","submitted_at":"2024-11-27T16:10:44Z","title":"3D Scene Graph Guided Vision-Language Pre-training","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T11:13:36.536173Z"},"links":{"citing_paper":"/paper/2411.18666"},"observation_digest":"sha256:255bce1e7baa82c142fe1eb25841918e8028fa299cee844a9e10621ca7a81a39","observation_id":"9c700dbd-8fea-4789-aab8-76fcf5bc6ca6","resolution":{"observed_at":"2026-08-12T11:13:37.801646Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.08530","last_updated":"2020-02-18T02:59:17Z","snapshot_observed_at":"2026-08-15T04:23:02.210168Z","submitted_at":"2019-08-22T17:59:30Z","title":"VL-BERT: Pre-training of Generic Visual-Linguistic Representations","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.08530","snapshot_observed_at":"2026-08-12T11:13:36.545186Z","title":"Vl-bert: Pre-training of generic visual- linguistic representations","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2411.18666","last_updated":"2024-11-27T16:10:44Z","snapshot_observed_at":"2026-08-17T23:31:17.689410Z","submitted_at":"2024-11-27T16:10:44Z","title":"3D Scene Graph Guided Vision-Language Pre-training","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T11:13:36.545186Z"},"links":{"cited_paper":"/paper/1908.08530","citing_paper":"/paper/2411.18666"},"observation_digest":"sha256:4edbd057f43035de964c1f2b8d00f8403f00241af46cbdbd3b3af1b2e0825e51","observation_id":"f32d1a60-7929-4f51-a895-82975aa858dc","resolution":{"observed_at":"2026-08-12T11:13:36.545186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:13:36.554591Z","title":"Cider: Consensus-based image description evalua- tion","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.18666","last_updated":"2024-11-27T16:10:44Z","snapshot_observed_at":"2026-08-17T23:31:17.689410Z","submitted_at":"2024-11-27T16:10:44Z","title":"3D Scene Graph Guided Vision-Language Pre-training","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T11:13:36.554591Z"},"links":{"citing_paper":"/paper/2411.18666"},"observation_digest":"sha256:98b600fa8748aaec2df4db59a92a454eff433da1c4f2b90d33181599da24382a","observation_id":"4bbadab6-a8a5-4c20-ae13-f7d8e9a51c01","resolution":{"observed_at":"2026-08-12T11:13:36.554591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:13:37.740147Z","title":"Learning 3D semantic scene graphs from 3D indoor reconstructions","venue":null,"work_id":"3cc99c5e-8b46-4575-b54c-6b1e9651334f","year":2020},"citing_paper":{"arxiv_id":"2411.18666","last_updated":"2024-11-27T16:10:44Z","snapshot_observed_at":"2026-08-17T23:31:17.689410Z","submitted_at":"2024-11-27T16:10:44Z","title":"3D Scene Graph Guided Vision-Language Pre-training","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T11:13:36.565038Z"},"links":{"citing_paper":"/paper/2411.18666"},"observation_digest":"sha256:e0ca24af02e14348c96e113e65ee07a998c1ab778b822ae1837702f44818bd7e","observation_id":"e85005a0-7a23-434d-9c1a-0e7bf4e854a9","resolution":{"observed_at":"2026-08-12T11:13:37.746357Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.10688","last_updated":"2022-04-22T13:07:37Z","snapshot_observed_at":"2026-08-17T01:11:42.292456Z","submitted_at":"2022-04-22T13:07:37Z","title":"Spatiality-guided Transformer for 3D Dense Captioning on Point Clouds","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.10688","snapshot_observed_at":"2026-08-12T11:13:36.575391Z","title":"Spatiality-guided transformer for 3D dense captioning on point clouds","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.18666","last_updated":"2024-11-27T16:10:44Z","snapshot_observed_at":"2026-08-17T23:31:17.689410Z","submitted_at":"2024-11-27T16:10:44Z","title":"3D Scene Graph Guided Vision-Language Pre-training","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T11:13:36.575391Z"},"links":{"cited_paper":"/paper/2204.10688","citing_paper":"/paper/2411.18666"},"observation_digest":"sha256:f9a65ab20875c5822bdb81d45af13f4d7acb5f0037b3cb47fd2869372461eb0e","observation_id":"592bafb9-5d43-4280-9f7b-3e9d4e1d3d66","resolution":{"observed_at":"2026-08-12T11:13:36.575391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:13:37.707092Z","title":"Vl-sat: visual-linguistic semantics assisted training for 3D semantic scene graph prediction in point cloud","venue":null,"work_id":"1f9f3869-ed2a-4950-b88b-5cc5a8a2e176","year":2023},"citing_paper":{"arxiv_id":"2411.18666","last_updated":"2024-11-27T16:10:44Z","snapshot_observed_at":"2026-08-17T23:31:17.689410Z","submitted_at":"2024-11-27T16:10:44Z","title":"3D Scene Graph Guided Vision-Language Pre-training","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T11:13:36.587490Z"},"links":{"citing_paper":"/paper/2411.18666"},"observation_digest":"sha256:7fe720ebef257a5f092a310142b558dca47de000f6e0f26ff5f1b0e4a8e6c46b","observation_id":"9f91b276-cfd1-4b6a-8521-a2fbc03c2abf","resolution":{"observed_at":"2026-08-12T11:13:37.715574Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14941","last_updated":"2023-04-24T13:16:57Z","snapshot_observed_at":"2026-08-17T19:06:58.842683Z","submitted_at":"2022-09-29T17:00:22Z","title":"EDA: Explicit Text-Decoupling and Dense Alignment for 3D Visual Grounding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14941","snapshot_observed_at":"2026-08-12T11:13:36.597094Z","title":"Eda: Explicit text-decoupling and dense alignment for 3D visual and language learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.18666","last_updated":"2024-11-27T16:10:44Z","snapshot_observed_at":"2026-08-17T23:31:17.689410Z","submitted_at":"2024-11-27T16:10:44Z","title":"3D Scene Graph Guided Vision-Language Pre-training","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T11:13:36.597094Z"},"links":{"cited_paper":"/paper/2209.14941","citing_paper":"/paper/2411.18666"},"observation_digest":"sha256:473948a9f1fc9eb66aa3ef043b692c3ccceac151ba331d68c165e24a67862047","observation_id":"2336401d-5b95-4b6b-95f0-c4171c7dabad","resolution":{"observed_at":"2026-08-12T11:13:36.597094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:13:37.675861Z","title":"Vision-language pre-training with triple contrastive learning","venue":null,"work_id":"6a294394-fcdf-4717-af8c-2bbfaa4f7f06","year":2022},"citing_paper":{"arxiv_id":"2411.18666","last_updated":"2024-11-27T16:10:44Z","snapshot_observed_at":"2026-08-17T23:31:17.689410Z","submitted_at":"2024-11-27T16:10:44Z","title":"3D Scene Graph Guided Vision-Language Pre-training","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T11:13:36.605670Z"},"links":{"citing_paper":"/paper/2411.18666"},"observation_digest":"sha256:b47165c9140ff79e69f753b30a8a6a3c23c967d2bb1386045d76c5c63888d480","observation_id":"81e19616-fc70-4b3a-a2f2-5ca0e21e3f8d","resolution":{"observed_at":"2026-08-12T11:13:37.685199Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:13:37.645398Z","title":"Sat: 2D semantics assisted training for 3D visual grounding","venue":null,"work_id":"10f3a36e-515c-4d48-8923-e688251386b1","year":null},"citing_paper":{"arxiv_id":"2411.18666","last_updated":"2024-11-27T16:10:44Z","snapshot_observed_at":"2026-08-17T23:31:17.689410Z","submitted_at":"2024-11-27T16:10:44Z","title":"3D Scene Graph Guided Vision-Language Pre-training","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T11:13:36.617166Z"},"links":{"citing_paper":"/paper/2411.18666"},"observation_digest":"sha256:33fffd9f7eb08850f7fa0edf4d012cd393c25bcb31203c241861545037d524b8","observation_id":"0827a075-662e-4da7-8d6e-f29b3d33139a","resolution":{"observed_at":"2026-08-12T11:13:37.652600Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:13:37.617979Z","title":"Deep modular co-attention networks for visual question an- swering","venue":null,"work_id":"2ae3c464-6c4e-4b3b-a7bc-5bca132eb652","year":2019},"citing_paper":{"arxiv_id":"2411.18666","last_updated":"2024-11-27T16:10:44Z","snapshot_observed_at":"2026-08-17T23:31:17.689410Z","submitted_at":"2024-11-27T16:10:44Z","title":"3D Scene Graph Guided Vision-Language Pre-training","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T11:13:36.623795Z"},"links":{"citing_paper":"/paper/2411.18666"},"observation_digest":"sha256:ef024dfe3d3ec92475d4832458c93fe3ed1c1683697e8a55e44c5dc21568f27f","observation_id":"d319560b-93fa-44d1-95ff-4b01c1fe1c08","resolution":{"observed_at":"2026-08-12T11:13:37.624968Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:13:37.581064Z","title":"Instancerefer: Cooperative holistic understanding for visual grounding on point clouds through instance multi-level contextual refer- ring","venue":null,"work_id":"d9f22ccf-e539-4989-bd9b-dc8e924249ba","year":2021},"citing_paper":{"arxiv_id":"2411.18666","last_updated":"2024-11-27T16:10:44Z","snapshot_observed_at":"2026-08-17T23:31:17.689410Z","submitted_at":"2024-11-27T16:10:44Z","title":"3D Scene Graph Guided Vision-Language Pre-training","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T11:13:36.631511Z"},"links":{"citing_paper":"/paper/2411.18666"},"observation_digest":"sha256:056154a69883ffcb1d24c945e4970d83d9774d60fb936802236b7376c37ddc49","observation_id":"f8d960d7-c1ee-41cf-8919-c7a6636a089c","resolution":{"observed_at":"2026-08-12T11:13:37.593057Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:13:37.547816Z","title":"X-trans2cap: Cross-modal knowledge transfer using transformer for 3D dense caption- ing","venue":null,"work_id":"348449b3-d329-45fe-88fd-61f04cbaacfb","year":2022},"citing_paper":{"arxiv_id":"2411.18666","last_updated":"2024-11-27T16:10:44Z","snapshot_observed_at":"2026-08-17T23:31:17.689410Z","submitted_at":"2024-11-27T16:10:44Z","title":"3D Scene Graph Guided Vision-Language Pre-training","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T11:13:36.639579Z"},"links":{"citing_paper":"/paper/2411.18666"},"observation_digest":"sha256:aec54272e919e93322e550317fcd1bcbddda313b60a6fa4a55d8b1fc76a33cf0","observation_id":"81c79412-2899-4c42-93f5-6d4138ddf27d","resolution":{"observed_at":"2026-08-12T11:13:37.554651Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:13:37.509743Z","title":"Exploiting edge-oriented reasoning for 3D point-based scene graph analysis","venue":null,"work_id":"ec171103-68af-4171-9307-5034cde8a648","year":2021},"citing_paper":{"arxiv_id":"2411.18666","last_updated":"2024-11-27T16:10:44Z","snapshot_observed_at":"2026-08-17T23:31:17.689410Z","submitted_at":"2024-11-27T16:10:44Z","title":"3D Scene Graph Guided Vision-Language Pre-training","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T11:13:36.652096Z"},"links":{"citing_paper":"/paper/2411.18666"},"observation_digest":"sha256:5a312e1bbc29001c8c268a29a4bedd61f397603e8a6d182f577d10c610fd2a16","observation_id":"018b2df1-9eb0-4195-bf05-63c3cbfa76a9","resolution":{"observed_at":"2026-08-12T11:13:37.522722Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:13:36.670122Z","title":"Pointclip: Point cloud understanding by clip","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.18666","last_updated":"2024-11-27T16:10:44Z","snapshot_observed_at":"2026-08-17T23:31:17.689410Z","submitted_at":"2024-11-27T16:10:44Z","title":"3D Scene Graph Guided Vision-Language Pre-training","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-12T11:13:36.670122Z"},"links":{"citing_paper":"/paper/2411.18666"},"observation_digest":"sha256:4214c72a7c954768b92df134d347d4fac5a32d7b64bc3a5f267d7ba6829f20a9","observation_id":"3f647af2-0f9f-46d1-bbea-603f5937e669","resolution":{"observed_at":"2026-08-12T11:13:36.670122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:13:37.443297Z","title":"Vision-language pre-training with object con- trastive learning for 3D scene understanding","venue":null,"work_id":"a4720107-2aef-4d76-888f-043eab7b4597","year":2024},"citing_paper":{"arxiv_id":"2411.18666","last_updated":"2024-11-27T16:10:44Z","snapshot_observed_at":"2026-08-17T23:31:17.689410Z","submitted_at":"2024-11-27T16:10:44Z","title":"3D Scene Graph Guided Vision-Language Pre-training","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-12T11:13:36.681011Z"},"links":{"citing_paper":"/paper/2411.18666"},"observation_digest":"sha256:2c54b54e9261ad7bdb3244bcc12e95eb36e5b94f76a6ae47c0929346e5198081","observation_id":"667b6665-a768-4f13-8b0c-b287402c671c","resolution":{"observed_at":"2026-08-12T11:13:37.450236Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:13:37.408142Z","title":"3DVG- Transformer: Relation modeling for visual grounding on point clouds","venue":null,"work_id":"ec0dc840-1dcc-41d3-baca-3b15957b7d51","year":null},"citing_paper":{"arxiv_id":"2411.18666","last_updated":"2024-11-27T16:10:44Z","snapshot_observed_at":"2026-08-17T23:31:17.689410Z","submitted_at":"2024-11-27T16:10:44Z","title":"3D Scene Graph Guided Vision-Language Pre-training","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-12T11:13:36.687868Z"},"links":{"citing_paper":"/paper/2411.18666"},"observation_digest":"sha256:32d4b8710b48f5a35d78dd9e7fcb7058c03bc4ec600fcd2802d814dd285600bd","observation_id":"c6572169-f869-47a6-b384-75e071c1701d","resolution":{"observed_at":"2026-08-12T11:13:37.421331Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:13:37.371783Z","title":"Towards explainable 3D grounded visual question answer- ing: A new benchmark and strong baseline","venue":null,"work_id":"6a4b1965-da8a-4141-97b7-ccf6e4c8b25b","year":null},"citing_paper":{"arxiv_id":"2411.18666","last_updated":"2024-11-27T16:10:44Z","snapshot_observed_at":"2026-08-17T23:31:17.689410Z","submitted_at":"2024-11-27T16:10:44Z","title":"3D Scene Graph Guided Vision-Language Pre-training","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-12T11:13:36.700903Z"},"links":{"citing_paper":"/paper/2411.18666"},"observation_digest":"sha256:1b257f7b05b9f05f6e7a0cca8f0ab54f009ba00a73e8fa9fc11b1d1ea0145356","observation_id":"83364dbb-1be1-4fd3-a251-2fbb110d3df6","resolution":{"observed_at":"2026-08-12T11:13:37.382388Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03925","last_updated":"2022-10-08T05:33:00Z","snapshot_observed_at":"2026-08-16T16:25:57.515398Z","submitted_at":"2022-10-08T05:33:00Z","title":"Contextual Modeling for 3D Dense Captioning on Point Clouds","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.03925","snapshot_observed_at":"2026-08-12T11:13:36.711134Z","title":"Contextual modeling for 3D dense captioning on point clouds","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.18666","last_updated":"2024-11-27T16:10:44Z","snapshot_observed_at":"2026-08-17T23:31:17.689410Z","submitted_at":"2024-11-27T16:10:44Z","title":"3D Scene Graph Guided Vision-Language Pre-training","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-12T11:13:36.711134Z"},"links":{"cited_paper":"/paper/2210.03925","citing_paper":"/paper/2411.18666"},"observation_digest":"sha256:3c2e76d616f34e50460ec4dfd034d7bdb929d5d025e39de16521e4109ead75a5","observation_id":"effb4dd5-c393-4efc-b84e-89a983b5065d","resolution":{"observed_at":"2026-08-12T11:13:36.711134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:13:37.332189Z","title":"Point- clip v2: Prompting clip and gpt for powerful 3D open-world learning","venue":null,"work_id":"e579392d-f7d1-4405-a786-f538accc86bc","year":null},"citing_paper":{"arxiv_id":"2411.18666","last_updated":"2024-11-27T16:10:44Z","snapshot_observed_at":"2026-08-17T23:31:17.689410Z","submitted_at":"2024-11-27T16:10:44Z","title":"3D Scene Graph Guided Vision-Language Pre-training","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-12T11:13:36.722077Z"},"links":{"citing_paper":"/paper/2411.18666"},"observation_digest":"sha256:1d4bc51c203345c5612710998f69cc098850f997cb20e2a1093cb87002c7deab","observation_id":"9ee57161-b2fc-41df-826c-c257492387c4","resolution":{"observed_at":"2026-08-12T11:13:37.343863Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:13:37.304613Z","title":"3d-vista: Pre-trained transformer for 3D vision and text alignment","venue":null,"work_id":"5d6c36e0-70bb-4124-88db-b3015ebdba7d","year":2023},"citing_paper":{"arxiv_id":"2411.18666","last_updated":"2024-11-27T16:10:44Z","snapshot_observed_at":"2026-08-17T23:31:17.689410Z","submitted_at":"2024-11-27T16:10:44Z","title":"3D Scene Graph Guided Vision-Language Pre-training","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-12T11:13:36.729314Z"},"links":{"citing_paper":"/paper/2411.18666"},"observation_digest":"sha256:b6f86a8b004d3899e2dc3e91a34e14245174319cccc312c0133628020eaafe1c","observation_id":"7db195e7-147b-4288-8c5a-e034a489808c","resolution":{"observed_at":"2026-08-12T11:13:37.313045Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:13:36.344522Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.18666","last_updated":"2024-11-27T16:10:44Z","snapshot_observed_at":"2026-08-17T23:31:17.689410Z","submitted_at":"2024-11-27T16:10:44Z","title":"3D Scene Graph Guided Vision-Language Pre-training","version":1},"reference_index":545,"source":"pdf_text","source_observed_at":"2026-08-12T11:13:36.344522Z"},"links":{"citing_paper":"/paper/2411.18666"},"observation_digest":"sha256:033a0af483663cd43328483c04dda98770ab57bde2b982872a2fbc987e007bfe","observation_id":"6251aefd-8e42-42d6-aaf2-bfdafc7408d0","resolution":{"observed_at":"2026-08-12T11:13:36.344522Z","resolver_source":null,"status":"parse_uncertain"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2411.18666","last_updated":"2024-11-27T16:10:44Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-17T23:31:17.689410Z","submitted_at":"2024-11-27T16:10:44Z","title":"3D Scene Graph Guided Vision-Language Pre-training"},"reference_resolution":{"displayed":63,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":15,"verified_exact":2,"verified_fuzzy":45},"total_outbound_references":63},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 63 of 63 outbound references and 0 inbound Pith citation observations for arXiv:2411.18666."}