{"as_of":"2026-08-09T20:25:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a4674cb1e4596de52ac94c938bb405a4e492355e7188bb7f2c9844819bf4ecf3","coverage":[{"denominator":132,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T19:24:18.126915Z","state":"measured"},{"denominator":103,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":103,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:46:14.341180Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-17T20:30:11.608435Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.00342","last_updated":"2025-08-08T07:24:11Z","snapshot_observed_at":"2026-08-09T19:19:13.983577Z","submitted_at":"2025-02-01T07:01:33Z","title":"Embodied Intelligence for 3D Understanding: A Survey on 3D Scene Question Answering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.00342","snapshot_observed_at":"2026-08-07T13:46:14.341180Z","title":"Embodied intelligence for 3d understanding: A survey on 3d scene question answering","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21079","last_updated":"2025-05-27T12:03:30Z","snapshot_observed_at":"2026-08-08T23:14:14.149778Z","submitted_at":"2025-05-27T12:03:30Z","title":"Uni3D-MoE: Scalable Multimodal 3D Scene Understanding via Mixture of Experts","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:14.341180Z"},"links":{"cited_paper":"/paper/2502.00342","citing_paper":"/paper/2505.21079"},"observation_digest":"sha256:867d556e1bad9f00a40d7793f42afb09bf333544e9f283f5bedf24653e79c7d5","observation_id":"dfa2a3c7-da90-4b0f-a8a3-343e810bad04","resolution":{"observed_at":"2026-08-07T13:46:14.341180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.00342","last_updated":"2025-08-08T07:24:11Z","snapshot_observed_at":"2026-08-09T19:19:13.983577Z","submitted_at":"2025-02-01T07:01:33Z","title":"Embodied Intelligence for 3D Understanding: A Survey on 3D Scene Question Answering","version":2},"cited_work":{"arxiv_id":"2502.00342","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.00342","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Embodied intelligence for 3d under- standing: A survey on 3d scene question answering","venue":null,"work_id":"eb9492b1-de62-4e1a-a458-3f86895787e7","year":2025},"citing_paper":{"arxiv_id":"2511.16567","last_updated":"2026-05-06T15:47:48Z","snapshot_observed_at":"2026-07-06T22:36:30.947164Z","submitted_at":"2025-11-20T17:22:51Z","title":"POMA-3D: The Point Map Way to 3D Scene Understanding","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-17T20:27:27.347592Z"},"links":{"cited_paper":"/paper/2502.00342","citing_paper":"/paper/2511.16567"},"observation_digest":"sha256:4a801e6e953c2210eb0acf3e522d89014d7cc9d858ddd58fc44eb0f5b1fd8e3f","observation_id":"3943a55d-6f90-4551-beb5-39eca2afddb8","resolution":{"observed_at":"2026-05-17T20:30:11.610268Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.00342","last_updated":"2025-08-08T07:24:11Z","snapshot_observed_at":"2026-08-09T19:19:13.983577Z","submitted_at":"2025-02-01T07:01:33Z","title":"Embodied Intelligence for 3D Understanding: A Survey on 3D Scene Question Answering","version":2},"cited_work":{"arxiv_id":"2502.00342","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.00342","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Embodied intelligence for 3d under- standing: A survey on 3d scene question answering","venue":null,"work_id":"eb9492b1-de62-4e1a-a458-3f86895787e7","year":2025},"citing_paper":{"arxiv_id":"2604.02546","last_updated":"2026-07-02T01:57:06Z","snapshot_observed_at":"2026-08-02T20:00:32.514238Z","submitted_at":"2026-04-02T21:54:43Z","title":"RGB-Pointmap Pretraining for Unified 3D Scene Understanding","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-13T21:19:49.421653Z"},"links":{"cited_paper":"/paper/2502.00342","citing_paper":"/paper/2604.02546"},"observation_digest":"sha256:e4ec7f4608fbbd9db7c9bbe2f34a597d132d5be5844f1fd9f6e426a0cfd78418","observation_id":"1633c144-0855-4c72-932e-4ee62c5586ca","resolution":{"observed_at":"2026-05-13T21:23:17.935190Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2502.00342/citation-record","integrity":"/paper/2502.00342/integrity","json":"/paper/2502.00342/citation-record.json","paper":"/paper/2502.00342"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:24:17.183064Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.00342","last_updated":"2025-08-08T07:24:11Z","snapshot_observed_at":"2026-08-09T19:19:13.983577Z","submitted_at":"2025-02-01T07:01:33Z","title":"Embodied Intelligence for 3D Understanding: A Survey on 3D Scene Question Answering","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-09T19:24:17.183064Z"},"links":{"citing_paper":"/paper/2502.00342"},"observation_digest":"sha256:b0dbea39bfae80d67679ab9c299de6773e6c4f3b84df12d9dbdd513c0772a9e9","observation_id":"70d23fbd-d842-4de4-a65b-46e7eb36c2a1","resolution":{"observed_at":"2026-08-09T19:24:17.183064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:24:17.194824Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.00342","last_updated":"2025-08-08T07:24:11Z","snapshot_observed_at":"2026-08-09T19:19:13.983577Z","submitted_at":"2025-02-01T07:01:33Z","title":"Embodied Intelligence for 3D Understanding: A Survey on 3D Scene Question Answering","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-09T19:24:17.194824Z"},"links":{"citing_paper":"/paper/2502.00342"},"observation_digest":"sha256:9201213e9f32442876acfb9ab46cb5dd5bc04843a3ac89f7d19e4f322382af7e","observation_id":"54b6e8f3-17c4-40a4-a222-f3ffc0d03c45","resolution":{"observed_at":"2026-08-09T19:24:17.194824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:24:17.200835Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.00342","last_updated":"2025-08-08T07:24:11Z","snapshot_observed_at":"2026-08-09T19:19:13.983577Z","submitted_at":"2025-02-01T07:01:33Z","title":"Embodied Intelligence for 3D Understanding: A Survey on 3D Scene Question Answering","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-09T19:24:17.200835Z"},"links":{"citing_paper":"/paper/2502.00342"},"observation_digest":"sha256:d0f67cab0fb04474f448344bf7f1f39324b5d0681b1b571bf11c708506b98a7f","observation_id":"942209e0-0db5-4783-b096-2471d72e78bd","resolution":{"observed_at":"2026-08-09T19:24:17.200835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:24:17.206308Z","title":"Vqa: Visual question answering, in: Proceedings of the IEEE international conference on computer vision, pp","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2502.00342","last_updated":"2025-08-08T07:24:11Z","snapshot_observed_at":"2026-08-09T19:19:13.983577Z","submitted_at":"2025-02-01T07:01:33Z","title":"Embodied Intelligence for 3D Understanding: A Survey on 3D Scene Question Answering","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-09T19:24:17.206308Z"},"links":{"citing_paper":"/paper/2502.00342"},"observation_digest":"sha256:16aea3788a334ea37824bb98f0bf0da633d49c6be41379d35eedb96d5fd82fc4","observation_id":"62c83fb3-28f7-49ff-9c7f-7258bbb05153","resolution":{"observed_at":"2026-08-09T19:24:17.206308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:24:17.211674Z","title":"Circle: Capture in rich contextual environments, in: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pp","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.00342","last_updated":"2025-08-08T07:24:11Z","snapshot_observed_at":"2026-08-09T19:19:13.983577Z","submitted_at":"2025-02-01T07:01:33Z","title":"Embodied Intelligence for 3D Understanding: A Survey on 3D Scene Question Answering","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-09T19:24:17.211674Z"},"links":{"citing_paper":"/paper/2502.00342"},"observation_digest":"sha256:e8a1a2b43746849a7ab167bd4dfb63a8ad000fdf4103e5b4dfa93d04b962531e","observation_id":"95ae9a82-bc37-4ade-b610-17a73c773f54","resolution":{"observed_at":"2026-08-09T19:24:17.211674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:24:17.217404Z","title":"Scanqa: 3d question answering for spatial scene understanding, in: proceed- ings of the IEEE/CVF conference on computer vision and pattern recognition, pp","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.00342","last_updated":"2025-08-08T07:24:11Z","snapshot_observed_at":"2026-08-09T19:19:13.983577Z","submitted_at":"2025-02-01T07:01:33Z","title":"Embodied Intelligence for 3D Understanding: A Survey on 3D Scene Question Answering","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-09T19:24:17.217404Z"},"links":{"citing_paper":"/paper/2502.00342"},"observation_digest":"sha256:483a9f3ddfd9652607dd4627fcbddafc9b8b9bfa4bff54dc8a58429a462b8aec","observation_id":"5d9e4135-bd41-472d-9de3-37310d84dd14","resolution":{"observed_at":"2026-08-09T19:24:17.217404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:24:17.222917Z","title":"Surgical-vqla++: Adversarial contrastive learning for calibrated robust visual question-localized answering in robotic surgery","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.00342","last_updated":"2025-08-08T07:24:11Z","snapshot_observed_at":"2026-08-09T19:19:13.983577Z","submitted_at":"2025-02-01T07:01:33Z","title":"Embodied Intelligence for 3D Understanding: A Survey on 3D Scene Question Answering","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-09T19:24:17.222917Z"},"links":{"citing_paper":"/paper/2502.00342"},"observation_digest":"sha256:a096a60aa732437187fcfd793ac3e4eb9ec8702ac785ba8d68c490c7ce65919c","observation_id":"d0828396-d8b8-43c9-9f28-b485ea0f4e6c","resolution":{"observed_at":"2026-08-09T19:24:17.222917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:24:17.228472Z","title":null,"venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2502.00342","last_updated":"2025-08-08T07:24:11Z","snapshot_observed_at":"2026-08-09T19:19:13.983577Z","submitted_at":"2025-02-01T07:01:33Z","title":"Embodied Intelligence for 3D Understanding: A Survey on 3D Scene Question Answering","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-09T19:24:17.228472Z"},"links":{"citing_paper":"/paper/2502.00342"},"observation_digest":"sha256:932ea83baaf067c2f2e157e17d027b1694905fbd1493322db29a88c5154e0fe1","observation_id":"58c7dd4a-8cac-415f-ab02-8d02dc927460","resolution":{"observed_at":"2026-08-09T19:24:17.228472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.08897","last_updated":"2022-01-12T08:19:29Z","snapshot_observed_at":"2026-07-06T12:09:19.763667Z","submitted_at":"2021-11-17T04:27:01Z","title":"ARKitScenes: A Diverse Real-World Dataset For 3D Indoor Scene Understanding Using Mobile RGB-D Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.08897","snapshot_observed_at":"2026-08-09T19:24:17.251847Z","title":"Arkitscenes: A diverse real-world dataset for 3d indoor scene under- standing using mobile rgb-d data","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.00342","last_updated":"2025-08-08T07:24:11Z","snapshot_observed_at":"2026-08-09T19:19:13.983577Z","submitted_at":"2025-02-01T07:01:33Z","title":"Embodied Intelligence for 3D Understanding: A Survey on 3D Scene Question Answering","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-09T19:24:17.251847Z"},"links":{"cited_paper":"/paper/2111.08897","citing_paper":"/paper/2502.00342"},"observation_digest":"sha256:ae84240767b79069aa318f435da8f62385324cabe9edffb4d1a8eac8fe5b151a","observation_id":"1872f29e-ae7a-44aa-8de5-9f8d2e4590c4","resolution":{"observed_at":"2026-08-09T19:24:17.251847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:24:17.280301Z","title":"Models for multiparty engagement in open-worlddialog,in:ProceedingsoftheSIGDIAL2009conference, the 10th annual meeting of the special interest group on discourse and dialogue, p","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2502.00342","last_updated":"2025-08-08T07:24:11Z","snapshot_observed_at":"2026-08-09T19:19:13.983577Z","submitted_at":"2025-02-01T07:01:33Z","title":"Embodied Intelligence for 3D Understanding: A Survey on 3D Scene Question Answering","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-09T19:24:17.280301Z"},"links":{"citing_paper":"/paper/2502.00342"},"observation_digest":"sha256:39afc3aeeba8614a240a84ad0ab13053167a32c7bec0741b0e19654beb3b6d4b","observation_id":"36245d22-d728-4b3a-8da3-bfe70f1a3c7f","resolution":{"observed_at":"2026-08-09T19:24:17.280301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-09T19:24:17.328533Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.00342","last_updated":"2025-08-08T07:24:11Z","snapshot_observed_at":"2026-08-09T19:19:13.983577Z","submitted_at":"2025-02-01T07:01:33Z","title":"Embodied Intelligence for 3D Understanding: A Survey on 3D Scene Question Answering","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-09T19:24:17.328533Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2502.00342"},"observation_digest":"sha256:ad045846e00cf92e1fd729ab3e5b5f4bb0393d56af4de32a06fe922238c48a1b","observation_id":"d1fcc83f-a521-49f7-832c-13153b8991ad","resolution":{"observed_at":"2026-08-09T19:24:17.328533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:24:17.351180Z","title":"Scanrefer: 3d object localization in rgb-d scans using natural language, in: European conference on computer vision, Springer","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.00342","last_updated":"2025-08-08T07:24:11Z","snapshot_observed_at":"2026-08-09T19:19:13.983577Z","submitted_at":"2025-02-01T07:01:33Z","title":"Embodied Intelligence for 3D Understanding: A Survey on 3D Scene Question Answering","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-09T19:24:17.351180Z"},"links":{"citing_paper":"/paper/2502.00342"},"observation_digest":"sha256:ac70225dd5a722deee435c4b73784b91bf5a9a12b5d2d7e515793d4389ff6e59","observation_id":"55af83d5-ae2f-4339-bf0a-4ef3e1216bd1","resolution":{"observed_at":"2026-08-09T19:24:17.351180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:24:17.356602Z","title":"Ll3da: Visual interactive instruction tuning for omni-3dunderstandingreasoningandplanning,in:Proceedingsofthe IEEE/CVFConferenceonComputerVisionandPatternRecognition, pp","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00342","last_updated":"2025-08-08T07:24:11Z","snapshot_observed_at":"2026-08-09T19:19:13.983577Z","submitted_at":"2025-02-01T07:01:33Z","title":"Embodied Intelligence for 3D Understanding: A Survey on 3D Scene Question Answering","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-09T19:24:17.356602Z"},"links":{"citing_paper":"/paper/2502.00342"},"observation_digest":"sha256:73af6fcad3ea50cf3cb01acf7ab3dc616b313aa4efbc9e9c32ad71bf65a00a7c","observation_id":"a2df58f7-2892-4d84-940c-b79308b9d3ff","resolution":{"observed_at":"2026-08-09T19:24:17.356602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:24:17.361165Z","title":"Lan- guage conditioned spatial relation reasoning for 3d object grounding","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.00342","last_updated":"2025-08-08T07:24:11Z","snapshot_observed_at":"2026-08-09T19:19:13.983577Z","submitted_at":"2025-02-01T07:01:33Z","title":"Embodied Intelligence for 3D Understanding: A Survey on 3D Scene Question Answering","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-09T19:24:17.361165Z"},"links":{"citing_paper":"/paper/2502.00342"},"observation_digest":"sha256:08abea1d01d03b2dcc89452f9b32bea8dcc27847f80221e85dd4dfc0ca49fabe","observation_id":"460349e1-c418-4f34-b4b0-100fea5d91dc","resolution":{"observed_at":"2026-08-09T19:24:17.361165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:24:17.366419Z","title":"End-to- end 3d dense captioning with vote2cap-detr, in: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition, pp","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.00342","last_updated":"2025-08-08T07:24:11Z","snapshot_observed_at":"2026-08-09T19:19:13.983577Z","submitted_at":"2025-02-01T07:01:33Z","title":"Embodied Intelligence for 3D Understanding: A Survey on 3D Scene Question Answering","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-09T19:24:17.366419Z"},"links":{"citing_paper":"/paper/2502.00342"},"observation_digest":"sha256:ac8b935386a7703688ee9c971dc2a69d0b7909d3f6842ba690332b71404bab3a","observation_id":"b5baedf3-7d99-4864-997e-cb71562b3929","resolution":{"observed_at":"2026-08-09T19:24:17.366419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:24:17.371311Z","title":"Scan2cap: Context-awaredensecaptioninginrgb-dscans,in:Proceedingsofthe IEEE/CVF conference on computer vision and pattern recognition, pp","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.00342","last_updated":"2025-08-08T07:24:11Z","snapshot_observed_at":"2026-08-09T19:19:13.983577Z","submitted_at":"2025-02-01T07:01:33Z","title":"Embodied Intelligence for 3D Understanding: A Survey on 3D Scene Question Answering","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-09T19:24:17.371311Z"},"links":{"citing_paper":"/paper/2502.00342"},"observation_digest":"sha256:23033434fde4deae73ce71c0012c997e8d3b6fe674c3cbc1f1a73fd9d8b01d8f","observation_id":"399a2083-abf1-4944-9d15-e54f4930ca75","resolution":{"observed_at":"2026-08-09T19:24:17.371311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:24:17.376771Z","title":"Vicuna: An open-sourcechatbotimpressinggpt-4with90%*chatgptquality","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.00342","last_updated":"2025-08-08T07:24:11Z","snapshot_observed_at":"2026-08-09T19:19:13.983577Z","submitted_at":"2025-02-01T07:01:33Z","title":"Embodied Intelligence for 3D Understanding: A Survey on 3D Scene Question Answering","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-09T19:24:17.376771Z"},"links":{"citing_paper":"/paper/2502.00342"},"observation_digest":"sha256:9b2e32bd8ea512ab6dc64b433bdbd804aeebed87faf6298232d2764fcd6acfde","observation_id":"8d1917cd-0b08-455d-96f4-afe8c01f069f","resolution":{"observed_at":"2026-08-09T19:24:17.376771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:24:17.381656Z","title":"Scannet: Richly-annotated 3d reconstructions of indoor scenes, in: Proceedings of the IEEE conference on computer vision and pattern recognition, pp","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.00342","last_updated":"2025-08-08T07:24:11Z","snapshot_observed_at":"2026-08-09T19:19:13.983577Z","submitted_at":"2025-02-01T07:01:33Z","title":"Embodied Intelligence for 3D Understanding: A Survey on 3D Scene Question Answering","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-09T19:24:17.381656Z"},"links":{"citing_paper":"/paper/2502.00342"},"observation_digest":"sha256:6cec92c0627030b381b6b73373bdae52450b0a8ba73d4db73c0045f83870d29a","observation_id":"9376e65e-9f53-47f3-b08c-96dbb702b48a","resolution":{"observed_at":"2026-08-09T19:24:17.381656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:24:17.387211Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.00342","last_updated":"2025-08-08T07:24:11Z","snapshot_observed_at":"2026-08-09T19:19:13.983577Z","submitted_at":"2025-02-01T07:01:33Z","title":"Embodied Intelligence for 3D Understanding: A Survey on 3D Scene Question Answering","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-09T19:24:17.387211Z"},"links":{"citing_paper":"/paper/2502.00342"},"observation_digest":"sha256:673034993e98023dd5ee74b61217c03399e0a4a19457bb2bfd287c09bba77553","observation_id":"08f626b6-ed15-4e81-8005-8f7587b644ec","resolution":{"observed_at":"2026-08-09T19:24:17.387211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:24:17.397068Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.00342","last_updated":"2025-08-08T07:24:11Z","snapshot_observed_at":"2026-08-09T19:19:13.983577Z","submitted_at":"2025-02-01T07:01:33Z","title":"Embodied Intelligence for 3D Understanding: A Survey on 3D Scene Question Answering","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-09T19:24:17.397068Z"},"links":{"citing_paper":"/paper/2502.00342"},"observation_digest":"sha256:9ed2671c4204583a3195ccd4ce13a7f1734f700e9f8a6356428aace59870f8b3","observation_id":"03f42869-94da-4364-ac63-8d3ea5716903","resolution":{"observed_at":"2026-08-09T19:24:17.397068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02329","last_updated":"2023-06-04T11:08:53Z","snapshot_observed_at":"2026-08-04T06:06:16.303733Z","submitted_at":"2023-06-04T11:08:53Z","title":"Multi-CLIP: Contrastive Vision-Language Pre-training for Question Answering tasks in 3D Scenes","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02329","snapshot_observed_at":"2026-08-09T19:24:17.408439Z","title":"Multi-clip: Contrastive vision- languagepre-trainingforquestionansweringtasksin3dscenes.arXiv preprint arXiv:2306.02329","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.00342","last_updated":"2025-08-08T07:24:11Z","snapshot_observed_at":"2026-08-09T19:19:13.983577Z","submitted_at":"2025-02-01T07:01:33Z","title":"Embodied Intelligence for 3D Understanding: A Survey on 3D Scene Question Answering","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-09T19:24:17.408439Z"},"links":{"cited_paper":"/paper/2306.02329","citing_paper":"/paper/2502.00342"},"observation_digest":"sha256:9668575a58692f9e3b57e905d11d02d742f8c1a97372cca28dd206b9110ea307","observation_id":"3594b23b-b802-4e45-826e-28eac4984134","resolution":{"observed_at":"2026-08-09T19:24:17.408439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:24:17.414063Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00342","last_updated":"2025-08-08T07:24:11Z","snapshot_observed_at":"2026-08-09T19:19:13.983577Z","submitted_at":"2025-02-01T07:01:33Z","title":"Embodied Intelligence for 3D Understanding: A Survey on 3D Scene Question Answering","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-09T19:24:17.414063Z"},"links":{"citing_paper":"/paper/2502.00342"},"observation_digest":"sha256:f854dbce63cc832f563d693c9a380b97f0576ac3ded2de04d8fb1ebebe8c8681","observation_id":"4f38fffc-246b-4034-9930-77a253c8c086","resolution":{"observed_at":"2026-08-09T19:24:17.414063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:24:17.402751Z","title":"13142–13153","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.00342","last_updated":"2025-08-08T07:24:11Z","snapshot_observed_at":"2026-08-09T19:19:13.983577Z","submitted_at":"2025-02-01T07:01:33Z","title":"Embodied Intelligence for 3D Understanding: A Survey on 3D Scene Question Answering","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-09T19:24:17.402751Z"},"links":{"citing_paper":"/paper/2502.00342"},"observation_digest":"sha256:46d342e93d068d160f7f1a750573449fec9bee9021bec0faf0ea03bd865b335c","observation_id":"5c27add2-0984-4c01-836d-dc3e635fcf39","resolution":{"observed_at":"2026-08-09T19:24:17.402751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:24:17.424306Z","title":"1billion: A large-scale benchmark for general object grasping","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.00342","last_updated":"2025-08-08T07:24:11Z","snapshot_observed_at":"2026-08-09T19:19:13.983577Z","submitted_at":"2025-02-01T07:01:33Z","title":"Embodied Intelligence for 3D Understanding: A Survey on 3D Scene Question Answering","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-09T19:24:17.424306Z"},"links":{"citing_paper":"/paper/2502.00342"},"observation_digest":"sha256:d589a8b6a151ef346f2988e0e1a2061caa2c2891a5f27065605ad7a387ff9747","observation_id":"29c94ed9-1f01-4783-acf8-2ce0d30e9fba","resolution":{"observed_at":"2026-08-09T19:24:17.424306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11401","last_updated":"2024-03-22T18:52:51Z","snapshot_observed_at":"2026-08-06T11:39:56.281668Z","submitted_at":"2024-03-18T01:18:48Z","title":"Scene-LLM: Extending Language Model for 3D Visual Understanding and Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.11401","snapshot_observed_at":"2026-08-09T19:24:17.429259Z","title":"Scene-llm: Extendinglanguagemodelfor3dvisualunderstandingandreasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00342","last_updated":"2025-08-08T07:24:11Z","snapshot_observed_at":"2026-08-09T19:19:13.983577Z","submitted_at":"2025-02-01T07:01:33Z","title":"Embodied Intelligence for 3D Understanding: A Survey on 3D Scene Question Answering","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-09T19:24:17.429259Z"},"links":{"cited_paper":"/paper/2403.11401","citing_paper":"/paper/2502.00342"},"observation_digest":"sha256:ecd35d1257a1fd1eb723c28f954c6843ab969b88f5e9870e412586945a5f37ab","observation_id":"19ef5905-3ec6-477c-a1eb-36f824b37983","resolution":{"observed_at":"2026-08-09T19:24:17.429259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:24:19.411708Z","title":"3dvqa: Visual question answering for 3d environments, in: 2022 19th Conference on Robots and Vision (CRV), pp","venue":null,"work_id":"8ebb5300-4e09-4942-bb76-ae58543ef238","year":2022},"citing_paper":{"arxiv_id":"2502.00342","last_updated":"2025-08-08T07:24:11Z","snapshot_observed_at":"2026-08-09T19:19:13.983577Z","submitted_at":"2025-02-01T07:01:33Z","title":"Embodied Intelligence for 3D Understanding: A Survey on 3D Scene Question Answering","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-09T19:24:17.419316Z"},"links":{"citing_paper":"/paper/2502.00342"},"observation_digest":"sha256:a8957eb213a8c97d6ad30e216e4dc9c0b0bcbfb14930f0c124ca6fc4564fe8f0","observation_id":"f0bff6a9-dfff-438d-a643-3a3fde851008","resolution":{"observed_at":"2026-08-09T19:24:19.418916Z","resolver_source":"arxiv_id_nonexistent","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:24:17.439965Z","title":"Long short-term memory","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2502.00342","last_updated":"2025-08-08T07:24:11Z","snapshot_observed_at":"2026-08-09T19:19:13.983577Z","submitted_at":"2025-02-01T07:01:33Z","title":"Embodied Intelligence for 3D Understanding: A Survey on 3D Scene Question Answering","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-09T19:24:17.439965Z"},"links":{"citing_paper":"/paper/2502.00342"},"observation_digest":"sha256:0257e905ee0b0cbd1cc6e5a47779051147ae546656b191bfff5f61558d4407b6","observation_id":"f967d846-56d6-4966-987f-8f151ee4f9ea","resolution":{"observed_at":"2026-08-09T19:24:17.439965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:24:17.444583Z","title":"Deep learning for 3d point clouds: A survey","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.00342","last_updated":"2025-08-08T07:24:11Z","snapshot_observed_at":"2026-08-09T19:19:13.983577Z","submitted_at":"2025-02-01T07:01:33Z","title":"Embodied Intelligence for 3D Understanding: A Survey on 3D Scene Question Answering","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-09T19:24:17.444583Z"},"links":{"citing_paper":"/paper/2502.00342"},"observation_digest":"sha256:45a18a248670a804793499e4d7bbe9ebc3b44c8c910c62a955f4625b9433c947","observation_id":"a049acd6-2159-4f38-abfa-8f88fe71d9a6","resolution":{"observed_at":"2026-08-09T19:24:17.444583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:24:17.435118Z","title":"Iqa: Visual question answering in interactive environments, in: Proceedings of the IEEE conference on computer vision and pattern recognition, pp","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.00342","last_updated":"2025-08-08T07:24:11Z","snapshot_observed_at":"2026-08-09T19:19:13.983577Z","submitted_at":"2025-02-01T07:01:33Z","title":"Embodied Intelligence for 3D Understanding: A Survey on 3D Scene Question Answering","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-09T19:24:17.435118Z"},"links":{"citing_paper":"/paper/2502.00342"},"observation_digest":"sha256:904b6c607bb344b1b42d22ac37574e8d5a5a3a1f67bd17a91a10a7b77e530c41","observation_id":"05ae10cf-944b-4b54-9c80-f102398baa2b","resolution":{"observed_at":"2026-08-09T19:24:17.435118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:24:17.454260Z","title":"Stochastic scene-aware motion prediction, in: ProceedingsoftheIEEE/CVFInternationalConferenceonComputer Vision, pp","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.00342","last_updated":"2025-08-08T07:24:11Z","snapshot_observed_at":"2026-08-09T19:19:13.983577Z","submitted_at":"2025-02-01T07:01:33Z","title":"Embodied Intelligence for 3D Understanding: A Survey on 3D Scene Question Answering","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-09T19:24:17.454260Z"},"links":{"citing_paper":"/paper/2502.00342"},"observation_digest":"sha256:8ed38191270b98d2434ca84c64ceb858f6b7386e330087fea76518296fdae5f9","observation_id":"b0911f5d-1bdb-4156-939e-1d6a3ac76104","resolution":{"observed_at":"2026-08-09T19:24:17.454260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:24:17.459249Z","title":"Resolving 3dhumanposeambiguitieswith3dsceneconstraints,in:Proceedings of the IEEE/CVF international conference on computer vision, pp","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.00342","last_updated":"2025-08-08T07:24:11Z","snapshot_observed_at":"2026-08-09T19:19:13.983577Z","submitted_at":"2025-02-01T07:01:33Z","title":"Embodied Intelligence for 3D Understanding: A Survey on 3D Scene Question Answering","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-09T19:24:17.459249Z"},"links":{"citing_paper":"/paper/2502.00342"},"observation_digest":"sha256:aadfc80dda23caffeabdd76af0dffac77df5e7840d8a7f794ad5080dc995a144","observation_id":"810e9e81-9094-42d8-a5aa-f81905b1ebb5","resolution":{"observed_at":"2026-08-09T19:24:17.459249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:24:17.449717Z","title":"A review of algorithms for filtering the 3d point cloud","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.00342","last_updated":"2025-08-08T07:24:11Z","snapshot_observed_at":"2026-08-09T19:19:13.983577Z","submitted_at":"2025-02-01T07:01:33Z","title":"Embodied Intelligence for 3D Understanding: A Survey on 3D Scene Question Answering","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-09T19:24:17.449717Z"},"links":{"citing_paper":"/paper/2502.00342"},"observation_digest":"sha256:2e176e02751833f519982e05250c7362d95d26d5536b218d5bfa132cfb46a442","observation_id":"e12b5f64-5bca-4850-9abe-a2c708a73eb6","resolution":{"observed_at":"2026-08-09T19:24:17.449717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:24:17.492801Z","title":"Mask r-cnn, in: ProceedingsoftheIEEEinternationalconferenceoncomputervision, pp","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.00342","last_updated":"2025-08-08T07:24:11Z","snapshot_observed_at":"2026-08-09T19:19:13.983577Z","submitted_at":"2025-02-01T07:01:33Z","title":"Embodied Intelligence for 3D Understanding: A Survey on 3D Scene Question Answering","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-09T19:24:17.492801Z"},"links":{"citing_paper":"/paper/2502.00342"},"observation_digest":"sha256:3e46110fe36569a0610bf11317ffea78e6e478cc51025937cbd9fd49b86db041","observation_id":"8bb0bd13-9232-4514-b069-22ccf4c855a3","resolution":{"observed_at":"2026-08-09T19:24:17.492801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:24:17.519144Z","title":"Deep residual learning for image recognition, in: Proceedings of the IEEE conference on computer vision and pattern recognition, pp","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.00342","last_updated":"2025-08-08T07:24:11Z","snapshot_observed_at":"2026-08-09T19:19:13.983577Z","submitted_at":"2025-02-01T07:01:33Z","title":"Embodied Intelligence for 3D Understanding: A Survey on 3D Scene Question Answering","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-09T19:24:17.519144Z"},"links":{"citing_paper":"/paper/2502.00342"},"observation_digest":"sha256:c1f54fd09ff2bd7391b20e1c7bfc20757255abc70f892159d2eeee95f3066587","observation_id":"95692027-649a-465d-9170-a4fc77d6099f","resolution":{"observed_at":"2026-08-09T19:24:17.519144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:24:17.464174Z","title":"Transrefer3d: Entity-and-relation aware transformer for fine-grained 3d visual grounding, in: Proceedings of the 29th ACM International Conference on Multimedia, pp","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.00342","last_updated":"2025-08-08T07:24:11Z","snapshot_observed_at":"2026-08-09T19:19:13.983577Z","submitted_at":"2025-02-01T07:01:33Z","title":"Embodied Intelligence for 3D Understanding: A Survey on 3D Scene Question Answering","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-09T19:24:17.464174Z"},"links":{"citing_paper":"/paper/2502.00342"},"observation_digest":"sha256:6c269715225b65a6c5ede8f670b18990c5c0521acedaff8595a0a32f7ffd021e","observation_id":"738f1f3f-8a2a-4c51-9b9a-5eaf850f2bfe","resolution":{"observed_at":"2026-08-09T19:24:17.464174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:24:17.572933Z","title":"Long short-term memory","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2502.00342","last_updated":"2025-08-08T07:24:11Z","snapshot_observed_at":"2026-08-09T19:19:13.983577Z","submitted_at":"2025-02-01T07:01:33Z","title":"Embodied Intelligence for 3D Understanding: A Survey on 3D Scene Question Answering","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-09T19:24:17.572933Z"},"links":{"citing_paper":"/paper/2502.00342"},"observation_digest":"sha256:e9f835b98393015e7f4ef0393ab0dcb15d8621bcf094082e9e7d36a039cb8a2b","observation_id":"a50ea0db-3c77-4091-9499-c4eb0b3df067","resolution":{"observed_at":"2026-08-09T19:24:17.572933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:24:17.597230Z","title":"3d concept learning and reasoning from multi-view images, in: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pp","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.00342","last_updated":"2025-08-08T07:24:11Z","snapshot_observed_at":"2026-08-09T19:19:13.983577Z","submitted_at":"2025-02-01T07:01:33Z","title":"Embodied Intelligence for 3D Understanding: A Survey on 3D Scene Question Answering","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-09T19:24:17.597230Z"},"links":{"citing_paper":"/paper/2502.00342"},"observation_digest":"sha256:eebda060fdec080755910bbcf273c498b8f28454ad6c5fab7f8541d87aebba17","observation_id":"0c2ca99c-c36e-4b7c-8667-92527f6f645c","resolution":{"observed_at":"2026-08-09T19:24:17.597230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:24:17.544576Z","title":"Deep learning based 3d segmentation in computer vision: A survey","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.00342","last_updated":"2025-08-08T07:24:11Z","snapshot_observed_at":"2026-08-09T19:19:13.983577Z","submitted_at":"2025-02-01T07:01:33Z","title":"Embodied Intelligence for 3D Understanding: A Survey on 3D Scene Question Answering","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-09T19:24:17.544576Z"},"links":{"citing_paper":"/paper/2502.00342"},"observation_digest":"sha256:554ed983aca15614905b61f84ba7b665cd0749208608fcae5fa8bdda7b055b70","observation_id":"05180ece-d3ed-4883-9ef5-49394ec39af5","resolution":{"observed_at":"2026-08-09T19:24:17.544576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:24:17.606269Z","title":"Chat-scene: Bridging 3d scene and large language models with object identifiers, in: The Thirty-eighth Annual Conference on Neural Information Processing Systems","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00342","last_updated":"2025-08-08T07:24:11Z","snapshot_observed_at":"2026-08-09T19:19:13.983577Z","submitted_at":"2025-02-01T07:01:33Z","title":"Embodied Intelligence for 3D Understanding: A Survey on 3D Scene Question Answering","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-09T19:24:17.606269Z"},"links":{"citing_paper":"/paper/2502.00342"},"observation_digest":"sha256:bfb2746d579f1b111dcc76830033bd5310ccd23ab477a3e35f9abdd07d3c47ee","observation_id":"83b04d9b-96e5-4569-b047-132e7fed3dfd","resolution":{"observed_at":"2026-08-09T19:24:17.606269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12871","last_updated":"2024-05-09T17:35:44Z","snapshot_observed_at":"2026-08-05T10:01:43.401012Z","submitted_at":"2023-11-18T01:21:38Z","title":"An Embodied Generalist Agent in 3D World","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12871","snapshot_observed_at":"2026-08-09T19:24:17.611071Z","title":"An embodied generalist agent in 3d world","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.00342","last_updated":"2025-08-08T07:24:11Z","snapshot_observed_at":"2026-08-09T19:19:13.983577Z","submitted_at":"2025-02-01T07:01:33Z","title":"Embodied Intelligence for 3D Understanding: A Survey on 3D Scene Question Answering","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-09T19:24:17.611071Z"},"links":{"cited_paper":"/paper/2311.12871","citing_paper":"/paper/2502.00342"},"observation_digest":"sha256:5e65f371c614588f28354f87e4938e5624bfa26e34ddf88b02bf73ea4eca9eff","observation_id":"6dcb2c80-9a8c-402b-9ca3-a23c8a3547a2","resolution":{"observed_at":"2026-08-09T19:24:17.611071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:24:17.601645Z","title":"3d-llm: Injecting the 3d world into large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.00342","last_updated":"2025-08-08T07:24:11Z","snapshot_observed_at":"2026-08-09T19:19:13.983577Z","submitted_at":"2025-02-01T07:01:33Z","title":"Embodied Intelligence for 3D Understanding: A Survey on 3D Scene Question Answering","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-09T19:24:17.601645Z"},"links":{"citing_paper":"/paper/2502.00342"},"observation_digest":"sha256:622b2805504d688d67e76e1ff35decc62299c83d009e1a1ebae2cfa7870d05e1","observation_id":"dbe06fa9-2b03-4478-9163-e0c1406bf99c","resolution":{"observed_at":"2026-08-09T19:24:17.601645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:24:17.621384Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.00342","last_updated":"2025-08-08T07:24:11Z","snapshot_observed_at":"2026-08-09T19:19:13.983577Z","submitted_at":"2025-02-01T07:01:33Z","title":"Embodied Intelligence for 3D Understanding: A Survey on 3D Scene Question Answering","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-09T19:24:17.621384Z"},"links":{"citing_paper":"/paper/2502.00342"},"observation_digest":"sha256:99af49c762e4a7babe89e2b2f9d0022a31287d3335580f81e525686993e18602","observation_id":"328ca192-d5b5-4264-89dc-11055a38dca7","resolution":{"observed_at":"2026-08-09T19:24:17.621384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:24:17.631066Z","title":"Clevr:Adiagnosticdataset for compositional language and elementary visual reasoning, in: Proceedings of the IEEE conference on computer vision and pattern recognition, pp","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.00342","last_updated":"2025-08-08T07:24:11Z","snapshot_observed_at":"2026-08-09T19:19:13.983577Z","submitted_at":"2025-02-01T07:01:33Z","title":"Embodied Intelligence for 3D Understanding: A Survey on 3D Scene Question Answering","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-09T19:24:17.631066Z"},"links":{"citing_paper":"/paper/2502.00342"},"observation_digest":"sha256:6bde25c794b8826fc0c5584053d9f31611382f3b17e6586de82107af90c92e79","observation_id":"c08760af-071b-45af-8053-183cf4dcf0bd","resolution":{"observed_at":"2026-08-09T19:24:17.631066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:24:17.616432Z","title":"From image to language: A critical analysis of visual question answering (vqa) approaches, challenges, and opportunities","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00342","last_updated":"2025-08-08T07:24:11Z","snapshot_observed_at":"2026-08-09T19:19:13.983577Z","submitted_at":"2025-02-01T07:01:33Z","title":"Embodied Intelligence for 3D Understanding: A Survey on 3D Scene Question Answering","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-09T19:24:17.616432Z"},"links":{"citing_paper":"/paper/2502.00342"},"observation_digest":"sha256:054fd08f827d94e41f559d45be881dd4bfb9c3e095b24017f27a83c27ffbe6c4","observation_id":"fe8e1fc7-8bf5-4926-9440-7b9fcfa46a4e","resolution":{"observed_at":"2026-08-09T19:24:17.616432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1712.05474","last_updated":"2022-08-26T17:12:17Z","snapshot_observed_at":"2026-07-06T06:14:28.435222Z","submitted_at":"2017-12-14T23:17:24Z","title":"AI2-THOR: An Interactive 3D Environment for Visual AI","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.05474","snapshot_observed_at":"2026-08-09T19:24:17.640967Z","title":"Ai2- thor: An interactive 3d environment for visual ai","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.00342","last_updated":"2025-08-08T07:24:11Z","snapshot_observed_at":"2026-08-09T19:19:13.983577Z","submitted_at":"2025-02-01T07:01:33Z","title":"Embodied Intelligence for 3D Understanding: A Survey on 3D Scene Question Answering","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-09T19:24:17.640967Z"},"links":{"cited_paper":"/paper/1712.05474","citing_paper":"/paper/2502.00342"},"observation_digest":"sha256:0e50ca86dfb03c05ea080d8011cd01aac93cc1eb4a576916a506e62ca7188222","observation_id":"30a559e7-2bf1-478c-853b-a462c84f49e3","resolution":{"observed_at":"2026-08-09T19:24:17.640967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1808.06226","last_updated":"2018-08-19T16:49:06Z","snapshot_observed_at":"2026-07-06T06:56:20.935388Z","submitted_at":"2018-08-19T16:49:06Z","title":"SentencePiece: A simple and language independent subword tokenizer and detokenizer for Neural Text Processing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1808.06226","snapshot_observed_at":"2026-08-09T19:24:17.647894Z","title":"Sentencepiece: A simple and language independent subword tokenizer and detokenizer for neural text processing","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.00342","last_updated":"2025-08-08T07:24:11Z","snapshot_observed_at":"2026-08-09T19:19:13.983577Z","submitted_at":"2025-02-01T07:01:33Z","title":"Embodied Intelligence for 3D Understanding: A Survey on 3D Scene Question Answering","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-09T19:24:17.647894Z"},"links":{"cited_paper":"/paper/1808.06226","citing_paper":"/paper/2502.00342"},"observation_digest":"sha256:41dd31b7bf43664a2b8128376a49c381cbc6259ace5f39c31256bf05a2c496ce","observation_id":"8f9cbe6d-9475-418c-b98b-a3e166acf154","resolution":{"observed_at":"2026-08-09T19:24:17.647894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:24:17.704008Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.00342","last_updated":"2025-08-08T07:24:11Z","snapshot_observed_at":"2026-08-09T19:19:13.983577Z","submitted_at":"2025-02-01T07:01:33Z","title":"Embodied Intelligence for 3D Understanding: A Survey on 3D Scene Question Answering","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-09T19:24:17.704008Z"},"links":{"citing_paper":"/paper/2502.00342"},"observation_digest":"sha256:2f69c3c407eab28c4d10f4212790216f65b8a9a43a19dbb5562ff6548c2e8bc5","observation_id":"faae1030-4bc9-4f4a-abee-82d6a14190f5","resolution":{"observed_at":"2026-08-09T19:24:17.704008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:24:17.636135Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding, in: Proceedings of naacL-HLT, Minneapolis, Minnesota","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.00342","last_updated":"2025-08-08T07:24:11Z","snapshot_observed_at":"2026-08-09T19:19:13.983577Z","submitted_at":"2025-02-01T07:01:33Z","title":"Embodied Intelligence for 3D Understanding: A Survey on 3D Scene Question Answering","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-09T19:24:17.636135Z"},"links":{"citing_paper":"/paper/2502.00342"},"observation_digest":"sha256:8a02120750d2a0b763b9a7cb417efc82526738e6276e2c2bbb6e90e096b9c33a","observation_id":"90ea8b41-51f2-4a23-927d-c3a02a80d9a9","resolution":{"observed_at":"2026-08-09T19:24:17.636135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.10763","last_updated":"2023-12-17T16:53:30Z","snapshot_observed_at":"2026-08-02T02:02:01.525485Z","submitted_at":"2023-12-17T16:53:30Z","title":"M3DBench: Let's Instruct Large Models with Multi-modal 3D Prompts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.10763","snapshot_observed_at":"2026-08-09T19:24:17.739557Z","title":"M3dbench: Let’s instruct large models with multi-modal 3d prompts","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.00342","last_updated":"2025-08-08T07:24:11Z","snapshot_observed_at":"2026-08-09T19:19:13.983577Z","submitted_at":"2025-02-01T07:01:33Z","title":"Embodied Intelligence for 3D Understanding: A Survey on 3D Scene Question Answering","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-09T19:24:17.739557Z"},"links":{"cited_paper":"/paper/2312.10763","citing_paper":"/paper/2502.00342"},"observation_digest":"sha256:446b925b5a6546c9c03eee6ebf41ed0bf0839ab979e06d099cd5d94bb408cc81","observation_id":"4efc0c83-5b3f-4efa-8c3d-00d290f0dc75","resolution":{"observed_at":"2026-08-09T19:24:17.739557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:24:17.745097Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.00342","last_updated":"2025-08-08T07:24:11Z","snapshot_observed_at":"2026-08-09T19:19:13.983577Z","submitted_at":"2025-02-01T07:01:33Z","title":"Embodied Intelligence for 3D Understanding: A Survey on 3D Scene Question Answering","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-09T19:24:17.745097Z"},"links":{"citing_paper":"/paper/2502.00342"},"observation_digest":"sha256:b8fedffecf41fa3b064b51d2082da6ce83565a51c3bf9378539d9105f94ba51c","observation_id":"702a733b-b62a-48cb-ae7d-995e5335a206","resolution":{"observed_at":"2026-08-09T19:24:17.745097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:24:17.750006Z","title":"Rouge: A package for automatic evaluation of summaries, in: Text summarization branches out, pp","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2502.00342","last_updated":"2025-08-08T07:24:11Z","snapshot_observed_at":"2026-08-09T19:19:13.983577Z","submitted_at":"2025-02-01T07:01:33Z","title":"Embodied Intelligence for 3D Understanding: A Survey on 3D Scene Question Answering","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-09T19:24:17.750006Z"},"links":{"citing_paper":"/paper/2502.00342"},"observation_digest":"sha256:28532a6a0c01f8aab0497c43c656c9a0ca23ae120f352e475d101345c2f47124","observation_id":"40f574b8-9214-47c8-8f89-6483e5c67ee5","resolution":{"observed_at":"2026-08-09T19:24:17.750006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02389","last_updated":"2024-11-18T02:32:22Z","snapshot_observed_at":"2026-07-06T19:10:08.541482Z","submitted_at":"2024-09-04T02:37:38Z","title":"Multi-modal Situated Reasoning in 3D Scenes","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.02389","snapshot_observed_at":"2026-08-09T19:24:17.755264Z","title":"Multi-modal situated reasoning in 3d scenes","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00342","last_updated":"2025-08-08T07:24:11Z","snapshot_observed_at":"2026-08-09T19:19:13.983577Z","submitted_at":"2025-02-01T07:01:33Z","title":"Embodied Intelligence for 3D Understanding: A Survey on 3D Scene Question Answering","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-09T19:24:17.755264Z"},"links":{"cited_paper":"/paper/2409.02389","citing_paper":"/paper/2502.00342"},"observation_digest":"sha256:f0c7bbb639c2793d672ca7a6dccc7ca9e19700d00802fd96b31a9b3136be3882","observation_id":"0c5781b4-0858-4eef-a3b7-35e8c34d5fcf","resolution":{"observed_at":"2026-08-09T19:24:17.755264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:24:17.734334Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models, in: International conference on machine learning, PMLR","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.00342","last_updated":"2025-08-08T07:24:11Z","snapshot_observed_at":"2026-08-09T19:19:13.983577Z","submitted_at":"2025-02-01T07:01:33Z","title":"Embodied Intelligence for 3D Understanding: A Survey on 3D Scene Question Answering","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-09T19:24:17.734334Z"},"links":{"citing_paper":"/paper/2502.00342"},"observation_digest":"sha256:079cd71610839b8bfbe7009079105c05aa2c2cc73e57a36fc1800a2ea4ae31cf","observation_id":"63e21f29-94c9-4ed7-9d9f-8ebe23edadb0","resolution":{"observed_at":"2026-08-09T19:24:17.734334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:24:17.765345Z","title":"Swin transformer: Hierarchical vision transformer using shifted windows, in: Proceedings of the IEEE/CVF international conference on computer vision, pp","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.00342","last_updated":"2025-08-08T07:24:11Z","snapshot_observed_at":"2026-08-09T19:19:13.983577Z","submitted_at":"2025-02-01T07:01:33Z","title":"Embodied Intelligence for 3D Understanding: A Survey on 3D Scene Question Answering","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-09T19:24:17.765345Z"},"links":{"citing_paper":"/paper/2502.00342"},"observation_digest":"sha256:2768cde71f496d52c3437cc87f230d46cd9f0854a3b2afc99845769ce96e3403","observation_id":"4801777a-71ac-4238-8e32-34dbc3de2986","resolution":{"observed_at":"2026-08-09T19:24:17.765345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:24:17.770451Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.00342","last_updated":"2025-08-08T07:24:11Z","snapshot_observed_at":"2026-08-09T19:19:13.983577Z","submitted_at":"2025-02-01T07:01:33Z","title":"Embodied Intelligence for 3D Understanding: A Survey on 3D Scene Question Answering","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-09T19:24:17.770451Z"},"links":{"citing_paper":"/paper/2502.00342"},"observation_digest":"sha256:7f52719df7b82a3a181c4a0d073f60d9a1b96828e0f511c75db374e276c9e048","observation_id":"7bbd9236-7f49-4e6b-b2a1-c2aebc5ba508","resolution":{"observed_at":"2026-08-09T19:24:17.770451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:24:17.781178Z","title":"Point-voxelcnnforefficient 3ddeeplearning","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.00342","last_updated":"2025-08-08T07:24:11Z","snapshot_observed_at":"2026-08-09T19:19:13.983577Z","submitted_at":"2025-02-01T07:01:33Z","title":"Embodied Intelligence for 3D Understanding: A Survey on 3D Scene Question Answering","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-09T19:24:17.781178Z"},"links":{"citing_paper":"/paper/2502.00342"},"observation_digest":"sha256:dffb37d300c60b6afbac9d376369c49959cc9efd56ede09922ad904e8d9fc525","observation_id":"54a80ed2-517c-40e7-a7bb-3a3fe0f2c389","resolution":{"observed_at":"2026-08-09T19:24:17.781178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:24:17.786244Z","title":"Group-free 3d object detection via transformers, in: Proceedings of the IEEE/CVF International Conference on Computer Vision, pp","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.00342","last_updated":"2025-08-08T07:24:11Z","snapshot_observed_at":"2026-08-09T19:19:13.983577Z","submitted_at":"2025-02-01T07:01:33Z","title":"Embodied Intelligence for 3D Understanding: A Survey on 3D Scene Question Answering","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-09T19:24:17.786244Z"},"links":{"citing_paper":"/paper/2502.00342"},"observation_digest":"sha256:b825491b8582a9f46458d390edcdccbef6cd46ed96fc0e90f6fedeff123240fd","observation_id":"40bb24eb-7b9a-4deb-a3ba-dd06e63e1eca","resolution":{"observed_at":"2026-08-09T19:24:17.786244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.07468","last_updated":"2025-03-02T16:57:11Z","snapshot_observed_at":"2026-08-07T10:36:33.375346Z","submitted_at":"2025-01-13T16:35:52Z","title":"From Screens to Scenes: A Survey of Embodied AI in Healthcare","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.07468","snapshot_observed_at":"2026-08-09T19:24:17.760631Z","title":"From screens to scenes: A survey of embodied ai in healthcare","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.00342","last_updated":"2025-08-08T07:24:11Z","snapshot_observed_at":"2026-08-09T19:19:13.983577Z","submitted_at":"2025-02-01T07:01:33Z","title":"Embodied Intelligence for 3D Understanding: A Survey on 3D Scene Question Answering","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-09T19:24:17.760631Z"},"links":{"cited_paper":"/paper/2501.07468","citing_paper":"/paper/2502.00342"},"observation_digest":"sha256:76395397c729c60a2ba81a855351baeaf43d144952d2522d4b55d06f74590f77","observation_id":"e4100ba6-880d-487a-a321-ca67317f75d0","resolution":{"observed_at":"2026-08-09T19:24:17.760631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:24:17.795774Z","title":"Scalable 3d captioning with pretrained models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.00342","last_updated":"2025-08-08T07:24:11Z","snapshot_observed_at":"2026-08-09T19:19:13.983577Z","submitted_at":"2025-02-01T07:01:33Z","title":"Embodied Intelligence for 3D Understanding: A Survey on 3D Scene Question Answering","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-09T19:24:17.795774Z"},"links":{"citing_paper":"/paper/2502.00342"},"observation_digest":"sha256:65fb8e592f179096da481274d69f629c95077ff90ed2a2e3ae7969f69e1d30d9","observation_id":"f1183ca7-278f-4839-9be5-5bc703fcc3fc","resolution":{"observed_at":"2026-08-09T19:24:17.795774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07474","last_updated":"2023-04-12T20:05:41Z","snapshot_observed_at":"2026-07-06T14:05:02.813765Z","submitted_at":"2022-10-14T02:52:26Z","title":"SQA3D: Situated Question Answering in 3D Scenes","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.07474","snapshot_observed_at":"2026-08-09T19:24:17.800718Z","title":"Sqa3d: Situated question answering in 3d scenes","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.00342","last_updated":"2025-08-08T07:24:11Z","snapshot_observed_at":"2026-08-09T19:19:13.983577Z","submitted_at":"2025-02-01T07:01:33Z","title":"Embodied Intelligence for 3D Understanding: A Survey on 3D Scene Question Answering","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-09T19:24:17.800718Z"},"links":{"cited_paper":"/paper/2210.07474","citing_paper":"/paper/2502.00342"},"observation_digest":"sha256:5d651935979e713c647d1617c38af9faa1dadb5502aee7b88403eef3c047376a","observation_id":"8c2750c8-b066-42ba-af1e-1a379520b0bc","resolution":{"observed_at":"2026-08-09T19:24:17.800718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:24:17.775560Z","title":"11976– 11986","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.00342","last_updated":"2025-08-08T07:24:11Z","snapshot_observed_at":"2026-08-09T19:19:13.983577Z","submitted_at":"2025-02-01T07:01:33Z","title":"Embodied Intelligence for 3D Understanding: A Survey on 3D Scene Question Answering","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-09T19:24:17.775560Z"},"links":{"citing_paper":"/paper/2502.00342"},"observation_digest":"sha256:859d487417f529bc039b759ea21e4b59dcc20a4e8c4edb3583724aca03b23ad5","observation_id":"59fcaa02-5cbd-4f67-b3f0-788ad8c2333f","resolution":{"observed_at":"2026-08-09T19:24:17.775560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:24:20.342341Z","title":"Situational awareness matters in 3d vision language reasoning, in: Proceedings of the IEEE/CVF ConferenceonComputerVisionandPatternRecognition,pp.13678– 13688","venue":null,"work_id":"4b84f0b0-2ea1-408d-922c-9bdd23472a2a","year":2024},"citing_paper":{"arxiv_id":"2502.00342","last_updated":"2025-08-08T07:24:11Z","snapshot_observed_at":"2026-08-09T19:19:13.983577Z","submitted_at":"2025-02-01T07:01:33Z","title":"Embodied Intelligence for 3D Understanding: A Survey on 3D Scene Question Answering","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-09T19:24:17.831521Z"},"links":{"citing_paper":"/paper/2502.00342"},"observation_digest":"sha256:7c5b2cf9e836ffe7fb93952cea649a1e4ca8f7bd13fb7868f369fab40282f8c7","observation_id":"f86f2a20-77d6-49fb-960e-298a4b99d70a","resolution":{"observed_at":"2026-08-09T19:24:20.348999Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:24:20.323755Z","title":"Chartqa: A benchmark for question answering about charts with visual and logical reasoning, in: Findings of the Association for Computational Linguistics: ACL 2022, pp","venue":null,"work_id":"69c07c09-c6a8-4bee-ba0d-bbb583940789","year":2022},"citing_paper":{"arxiv_id":"2502.00342","last_updated":"2025-08-08T07:24:11Z","snapshot_observed_at":"2026-08-09T19:19:13.983577Z","submitted_at":"2025-02-01T07:01:33Z","title":"Embodied Intelligence for 3D Understanding: A Survey on 3D Scene Question Answering","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-09T19:24:17.884997Z"},"links":{"citing_paper":"/paper/2502.00342"},"observation_digest":"sha256:6f1ce962f56a1251147751e03211465145cbdac0724923fe24e53e123003cc5e","observation_id":"458a1ac0-4749-4bc8-9af4-d951fffb7016","resolution":{"observed_at":"2026-08-09T19:24:20.330227Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:24:17.791284Z","title":"Transformer- based vision-language alignment for robot navigation and question answering","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.00342","last_updated":"2025-08-08T07:24:11Z","snapshot_observed_at":"2026-08-09T19:19:13.983577Z","submitted_at":"2025-02-01T07:01:33Z","title":"Embodied Intelligence for 3D Understanding: A Survey on 3D Scene Question Answering","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-09T19:24:17.791284Z"},"links":{"citing_paper":"/paper/2502.00342"},"observation_digest":"sha256:9192fb3070dcc1584489e84835e38947b163c72f992b163116be37a25f098097","observation_id":"0959a972-4ed6-413d-bc01-042f2d96cec7","resolution":{"observed_at":"2026-08-09T19:24:17.791284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:24:20.287818Z","title":"Situated language understandingat25milesperhour,in:Proceedingsofthe15thAnnual Meeting of the Special Interest Group on Discourse and Dialogue (SIGDIAL), pp","venue":null,"work_id":"671e69f9-ebcd-4fa0-8de7-3cbb2e63bb0c","year":2014},"citing_paper":{"arxiv_id":"2502.00342","last_updated":"2025-08-08T07:24:11Z","snapshot_observed_at":"2026-08-09T19:19:13.983577Z","submitted_at":"2025-02-01T07:01:33Z","title":"Embodied Intelligence for 3D Understanding: A Survey on 3D Scene Question Answering","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-09T19:24:17.919386Z"},"links":{"citing_paper":"/paper/2502.00342"},"observation_digest":"sha256:d9558d75c7011fd8fc190f48a82588423fd7304a87a4cf2426ea94d5864c683d","observation_id":"161797f3-3e26-4a7d-b6f0-f21d92395d3c","resolution":{"observed_at":"2026-08-09T19:24:20.293287Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:24:20.270995Z","title":"Bridging the gap between 2d and 3d visual question answering: A fusion approach for 3d vqa, in: Proceedings of the AAAI Conference on Artificial Intelligence, pp","venue":null,"work_id":"98e2f033-8683-4d45-bd3e-6aa36d70396b","year":2024},"citing_paper":{"arxiv_id":"2502.00342","last_updated":"2025-08-08T07:24:11Z","snapshot_observed_at":"2026-08-09T19:19:13.983577Z","submitted_at":"2025-02-01T07:01:33Z","title":"Embodied Intelligence for 3D Understanding: A Survey on 3D Scene Question Answering","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-09T19:24:17.924731Z"},"links":{"citing_paper":"/paper/2502.00342"},"observation_digest":"sha256:5a3583833d746f6c0564002e8dd47fbb95aca1f94fce47a9b1f51ef36adce000","observation_id":"3fe083a6-c902-4670-babc-ed24d338dcd8","resolution":{"observed_at":"2026-08-09T19:24:20.276344Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:24:20.359674Z","title":"Openeqa: Embodied question answering in the era of foundation models, in: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pp","venue":null,"work_id":"67ba3125-b622-4bf7-8305-ebcc3bbec81f","year":2024},"citing_paper":{"arxiv_id":"2502.00342","last_updated":"2025-08-08T07:24:11Z","snapshot_observed_at":"2026-08-09T19:19:13.983577Z","submitted_at":"2025-02-01T07:01:33Z","title":"Embodied Intelligence for 3D Understanding: A Survey on 3D Scene Question Answering","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-09T19:24:17.819884Z"},"links":{"citing_paper":"/paper/2502.00342"},"observation_digest":"sha256:98cab8ebfb2a7307beb0502b12995a53a2cfde36c2216d2a9813ad92dff9e539","observation_id":"2bc2d738-ed83-4694-8d2c-5464d99d1fcb","resolution":{"observed_at":"2026-08-09T19:24:20.364328Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:24:20.254955Z","title":"Bleu: a method forautomaticevaluationofmachinetranslation,in:Proceedingsofthe 40thannualmeetingoftheAssociationforComputationalLinguistics, pp","venue":null,"work_id":"13aff52b-a159-4076-98d3-d74aba64c276","year":2002},"citing_paper":{"arxiv_id":"2502.00342","last_updated":"2025-08-08T07:24:11Z","snapshot_observed_at":"2026-08-09T19:19:13.983577Z","submitted_at":"2025-02-01T07:01:33Z","title":"Embodied Intelligence for 3D Understanding: A Survey on 3D Scene Question Answering","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-09T19:24:17.936144Z"},"links":{"citing_paper":"/paper/2502.00342"},"observation_digest":"sha256:e1837a651cc767d77b090ed896c4dea6c8d0b5abe60604bdbceb247deb79d21e","observation_id":"a0793ba7-5424-492a-ac86-c466215232d2","resolution":{"observed_at":"2026-08-09T19:24:20.260466Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:24:20.238460Z","title":"Clip-guided vision-language pre- training for question answering in 3d scenes, in: Proceedings of the IEEE/CVFConferenceonComputerVisionandPatternRecognition, pp","venue":null,"work_id":"804035ae-cf37-410d-bae1-7ff241f5e9aa","year":2023},"citing_paper":{"arxiv_id":"2502.00342","last_updated":"2025-08-08T07:24:11Z","snapshot_observed_at":"2026-08-09T19:19:13.983577Z","submitted_at":"2025-02-01T07:01:33Z","title":"Embodied Intelligence for 3D Understanding: A Survey on 3D Scene Question Answering","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-09T19:24:17.941160Z"},"links":{"citing_paper":"/paper/2502.00342"},"observation_digest":"sha256:6fe9a7c3c5186de765d9b829625dea2385dc0d92aed5303e26c268543918a17d","observation_id":"c0c8011a-85ff-4af6-9bd6-df05eabcd90f","resolution":{"observed_at":"2026-08-09T19:24:20.243933Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:24:20.305122Z","title":"Wordnet: a lexical database for english","venue":null,"work_id":"c64315b3-e75a-470f-b6b9-afca8e65befe","year":1995},"citing_paper":{"arxiv_id":"2502.00342","last_updated":"2025-08-08T07:24:11Z","snapshot_observed_at":"2026-08-09T19:19:13.983577Z","submitted_at":"2025-02-01T07:01:33Z","title":"Embodied Intelligence for 3D Understanding: A Survey on 3D Scene Question Answering","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-09T19:24:17.913380Z"},"links":{"citing_paper":"/paper/2502.00342"},"observation_digest":"sha256:0bb6f96e8f346895328c0939eb16f2a838b4ed543f28fcf7928a3897c306207d","observation_id":"d2c4bb3e-b282-4c9c-8eaa-cb4e24f55608","resolution":{"observed_at":"2026-08-09T19:24:20.310515Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:24:20.200348Z","title":"Glove: Global vec- tors for word representation, in: Proceedings of the 2014 conference on empirical methods in natural language processing (EMNLP), pp","venue":null,"work_id":"c6fb68e6-8769-460d-a30e-ba2a55ed8994","year":2014},"citing_paper":{"arxiv_id":"2502.00342","last_updated":"2025-08-08T07:24:11Z","snapshot_observed_at":"2026-08-09T19:19:13.983577Z","submitted_at":"2025-02-01T07:01:33Z","title":"Embodied Intelligence for 3D Understanding: A Survey on 3D Scene Question Answering","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-09T19:24:17.953075Z"},"links":{"citing_paper":"/paper/2502.00342"},"observation_digest":"sha256:cd79e9b9e5222e2bb5fc5e7d64aca7471d3552a98655d34161feed0d520f82b3","observation_id":"6cabdd2f-da26-41df-8c74-3617643202a7","resolution":{"observed_at":"2026-08-09T19:24:20.205906Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:24:20.183605Z","title":"9277–9286","venue":null,"work_id":"e32fefe3-41db-41b7-84fa-418ab7430125","year":2019},"citing_paper":{"arxiv_id":"2502.00342","last_updated":"2025-08-08T07:24:11Z","snapshot_observed_at":"2026-08-09T19:19:13.983577Z","submitted_at":"2025-02-01T07:01:33Z","title":"Embodied Intelligence for 3D Understanding: A Survey on 3D Scene Question Answering","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-09T19:24:17.959269Z"},"links":{"citing_paper":"/paper/2502.00342"},"observation_digest":"sha256:ed7934a2db85d0bec97b86ffaf0c377c8ef0ac5c0f45010df5514033bad1df3a","observation_id":"c81878b0-94d5-4b26-9ebd-405478650924","resolution":{"observed_at":"2026-08-09T19:24:20.188705Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12973","last_updated":"2024-05-06T15:45:30Z","snapshot_observed_at":"2026-08-07T22:14:28.327485Z","submitted_at":"2023-10-19T17:59:05Z","title":"Frozen Transformers in Language Models Are Effective Visual Encoder Layers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12973","snapshot_observed_at":"2026-08-09T19:24:17.930017Z","title":"Frozentransformersin language models are effective visual encoder layers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.00342","last_updated":"2025-08-08T07:24:11Z","snapshot_observed_at":"2026-08-09T19:19:13.983577Z","submitted_at":"2025-02-01T07:01:33Z","title":"Embodied Intelligence for 3D Understanding: A Survey on 3D Scene Question Answering","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-09T19:24:17.930017Z"},"links":{"cited_paper":"/paper/2310.12973","citing_paper":"/paper/2502.00342"},"observation_digest":"sha256:b0bf0754ddaa452d1c543fc624a56449142d61a26355241c9267e1e1b3f76a21","observation_id":"60c0cdfb-23a2-41a8-afea-2df919149701","resolution":{"observed_at":"2026-08-09T19:24:17.930017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:24:20.146974Z","title":"Pointnet++: Deep hierarchicalfeaturelearningonpointsetsinametricspace","venue":null,"work_id":"fbc4607a-6a08-48d8-b726-39f6e44a3fd5","year":null},"citing_paper":{"arxiv_id":"2502.00342","last_updated":"2025-08-08T07:24:11Z","snapshot_observed_at":"2026-08-09T19:19:13.983577Z","submitted_at":"2025-02-01T07:01:33Z","title":"Embodied Intelligence for 3D Understanding: A Survey on 3D Scene Question Answering","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-09T19:24:17.970363Z"},"links":{"citing_paper":"/paper/2502.00342"},"observation_digest":"sha256:faaa13d2cce90c33d4ffe4373eb94cf4413a762bac377ef0c3e2178e2b6c32f0","observation_id":"a06c324c-05a8-43c0-8876-31210bbddbed","resolution":{"observed_at":"2026-08-09T19:24:20.152709Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:24:20.128872Z","title":"Langsplat: 3d language gaussian splatting, in: Proceedings of the IEEE/CVF ConferenceonComputerVisionandPatternRecognition,pp.20051– 20060","venue":null,"work_id":"1a2ab315-436c-436a-87cf-f23ff72b9367","year":2024},"citing_paper":{"arxiv_id":"2502.00342","last_updated":"2025-08-08T07:24:11Z","snapshot_observed_at":"2026-08-09T19:19:13.983577Z","submitted_at":"2025-02-01T07:01:33Z","title":"Embodied Intelligence for 3D Understanding: A Survey on 3D Scene Question Answering","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-09T19:24:17.976372Z"},"links":{"citing_paper":"/paper/2502.00342"},"observation_digest":"sha256:8456a58304d9048bbeb6097e0c2698b8f8d7ce0ed3008c027c815b16bdcb8b1a","observation_id":"f777bd15-7c0f-461f-97d4-6520f1f124ec","resolution":{"observed_at":"2026-08-09T19:24:20.134834Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:24:20.219143Z","title":"Openscene:3dsceneunderstandingwith open vocabularies, in: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition, pp","venue":null,"work_id":"53f194d4-d607-44f0-88da-8a7347d8cd5c","year":2023},"citing_paper":{"arxiv_id":"2502.00342","last_updated":"2025-08-08T07:24:11Z","snapshot_observed_at":"2026-08-09T19:19:13.983577Z","submitted_at":"2025-02-01T07:01:33Z","title":"Embodied Intelligence for 3D Understanding: A Survey on 3D Scene Question Answering","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-09T19:24:17.946976Z"},"links":{"citing_paper":"/paper/2502.00342"},"observation_digest":"sha256:ea1eda3b66b37adef59ae1549e69bdb27fc0b0692a98b0ad19a8373c66817719","observation_id":"6bb3b8da-7d2d-4d8d-b048-9d2d876d8558","resolution":{"observed_at":"2026-08-09T19:24:20.224915Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:24:20.099695Z","title":"Language models are unsupervised multitask learners","venue":null,"work_id":"956d58d5-ec10-431e-be55-08f9435d9fed","year":2019},"citing_paper":{"arxiv_id":"2502.00342","last_updated":"2025-08-08T07:24:11Z","snapshot_observed_at":"2026-08-09T19:19:13.983577Z","submitted_at":"2025-02-01T07:01:33Z","title":"Embodied Intelligence for 3D Understanding: A Survey on 3D Scene Question Answering","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-09T19:24:17.989114Z"},"links":{"citing_paper":"/paper/2502.00342"},"observation_digest":"sha256:e307c550b1a101ac43c9f2bfaaeac577648f022319ed69cda676b402781e4a09","observation_id":"18bdeaa3-da6b-4b76-8730-ef89a431cd02","resolution":{"observed_at":"2026-08-09T19:24:20.105079Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:24:20.081721Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer","venue":null,"work_id":"92527a70-8bd2-4f22-a0c4-611e824c6282","year":2020},"citing_paper":{"arxiv_id":"2502.00342","last_updated":"2025-08-08T07:24:11Z","snapshot_observed_at":"2026-08-09T19:19:13.983577Z","submitted_at":"2025-02-01T07:01:33Z","title":"Embodied Intelligence for 3D Understanding: A Survey on 3D Scene Question Answering","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-09T19:24:17.995346Z"},"links":{"citing_paper":"/paper/2502.00342"},"observation_digest":"sha256:372afc577f12a4a67d0fe2e27ed4a928847b79363e9450675775aa13244b7f65","observation_id":"c5c2937b-0a21-466a-88a8-a1403b85f529","resolution":{"observed_at":"2026-08-09T19:24:20.087066Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:24:20.164845Z","title":"Pointnet:Deeplearning on point sets for 3d classification and segmentation, in: Proceedings Z","venue":null,"work_id":"b891ce8a-c9b4-4100-8dbc-4c8f67f9a942","year":null},"citing_paper":{"arxiv_id":"2502.00342","last_updated":"2025-08-08T07:24:11Z","snapshot_observed_at":"2026-08-09T19:19:13.983577Z","submitted_at":"2025-02-01T07:01:33Z","title":"Embodied Intelligence for 3D Understanding: A Survey on 3D Scene Question Answering","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-09T19:24:17.964885Z"},"links":{"citing_paper":"/paper/2502.00342"},"observation_digest":"sha256:01187ba83d84781414000b5403bb8bed2f1ffc7d105b07532e3a63297afb11b5","observation_id":"0f197cae-0cf6-4be4-b553-dbd398825c44","resolution":{"observed_at":"2026-08-09T19:24:20.171580Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.08238","last_updated":"2021-09-16T22:01:24Z","snapshot_observed_at":"2026-07-06T11:48:35.206160Z","submitted_at":"2021-09-16T22:01:24Z","title":"Habitat-Matterport 3D Dataset (HM3D): 1000 Large-scale 3D Environments for Embodied AI","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.08238","snapshot_observed_at":"2026-08-09T19:24:18.008160Z","title":"Habitat-matterport 3d dataset (hm3d): 1000 large-scale 3d environments for embodied ai","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.00342","last_updated":"2025-08-08T07:24:11Z","snapshot_observed_at":"2026-08-09T19:19:13.983577Z","submitted_at":"2025-02-01T07:01:33Z","title":"Embodied Intelligence for 3D Understanding: A Survey on 3D Scene Question Answering","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-09T19:24:18.008160Z"},"links":{"cited_paper":"/paper/2109.08238","citing_paper":"/paper/2502.00342"},"observation_digest":"sha256:235475662056d91633f174c4bc6510d5e33c28e2b48220820f27808f8a4d7d2a","observation_id":"08ec80d4-085b-405b-bdca-2042072d1aae","resolution":{"observed_at":"2026-08-09T19:24:18.008160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:24:20.064505Z","title":"3d is here: Point cloud library (pcl), in: 2011 IEEE international conference on robotics and automation, IEEE","venue":null,"work_id":"ef773839-a7ef-426a-b771-a7152e32c85f","year":2011},"citing_paper":{"arxiv_id":"2502.00342","last_updated":"2025-08-08T07:24:11Z","snapshot_observed_at":"2026-08-09T19:19:13.983577Z","submitted_at":"2025-02-01T07:01:33Z","title":"Embodied Intelligence for 3D Understanding: A Survey on 3D Scene Question Answering","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-09T19:24:18.013925Z"},"links":{"citing_paper":"/paper/2502.00342"},"observation_digest":"sha256:e605234dfee90406e44c0a6f13aac6dda44fd0eca1882e8e5eb0df0444e4fa09","observation_id":"c05988c6-3d54-4554-9422-911d308c0889","resolution":{"observed_at":"2026-08-09T19:24:20.070008Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:24:17.983140Z","title":"Learning transferable visual models from natural language supervision, in: International conference on machine learning, PMLR","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.00342","last_updated":"2025-08-08T07:24:11Z","snapshot_observed_at":"2026-08-09T19:19:13.983577Z","submitted_at":"2025-02-01T07:01:33Z","title":"Embodied Intelligence for 3D Understanding: A Survey on 3D Scene Question Answering","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-09T19:24:17.983140Z"},"links":{"citing_paper":"/paper/2502.00342"},"observation_digest":"sha256:acf5639975e768975bcb294e4c809db1bab2fa87fb436d0ea4dbf99f9ff64361","observation_id":"1751947b-f9a5-4835-af09-afd17b371734","resolution":{"observed_at":"2026-08-09T19:24:17.983140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:24:20.030116Z","title":"Mask3d: Mask transformer for 3d semantic instance segmentation, in: 2023 IEEE International Conference on Robotics and Automation (ICRA), IEEE","venue":null,"work_id":"7be90e87-42ef-44a1-877d-b59daf1f72ff","year":2023},"citing_paper":{"arxiv_id":"2502.00342","last_updated":"2025-08-08T07:24:11Z","snapshot_observed_at":"2026-08-09T19:19:13.983577Z","submitted_at":"2025-02-01T07:01:33Z","title":"Embodied Intelligence for 3D Understanding: A Survey on 3D Scene Question Answering","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-09T19:24:18.023660Z"},"links":{"citing_paper":"/paper/2502.00342"},"observation_digest":"sha256:e53c913c2a0d95e09d5ae3088a12b2c932f37241b847ea1b25d77f45f2052888","observation_id":"54c087d1-90e1-4404-993d-7eeb62a14e26","resolution":{"observed_at":"2026-08-09T19:24:20.035134Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.18831","last_updated":"2024-05-29T07:20:28Z","snapshot_observed_at":"2026-07-06T18:21:48.356478Z","submitted_at":"2024-05-29T07:20:28Z","title":"Evaluating Zero-Shot GPT-4V Performance on 3D Visual Question Answering Benchmarks","version":1},"cited_work":{"arxiv_id":"2405.18831","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.18831","snapshot_observed_at":"2026-08-09T19:24:19.007009Z","title":"Evaluating Zero-Shot GPT-4V Performance on 3D Visual Question Answering Benchmarks","venue":"cs.CV","work_id":"6e9dc672-2926-473e-9686-20c9f8729b09","year":2024},"citing_paper":{"arxiv_id":"2502.00342","last_updated":"2025-08-08T07:24:11Z","snapshot_observed_at":"2026-08-09T19:19:13.983577Z","submitted_at":"2025-02-01T07:01:33Z","title":"Embodied Intelligence for 3D Understanding: A Survey on 3D Scene Question Answering","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-09T19:24:18.028898Z"},"links":{"cited_paper":"/paper/2405.18831","citing_paper":"/paper/2502.00342"},"observation_digest":"sha256:17ac173d17b708fda3e9f14d37b6d051d219a04cf8392d47f742d12371d56ab9","observation_id":"59110341-08da-491c-90e9-4c67baeea08c","resolution":{"observed_at":"2026-08-09T19:24:19.013183Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:24:18.001184Z","title":"SQuAD: 100,000+ questions for machine comprehension of text, in: Su, J., Duh, K., Carreras, X","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.00342","last_updated":"2025-08-08T07:24:11Z","snapshot_observed_at":"2026-08-09T19:19:13.983577Z","submitted_at":"2025-02-01T07:01:33Z","title":"Embodied Intelligence for 3D Understanding: A Survey on 3D Scene Question Answering","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-09T19:24:18.001184Z"},"links":{"citing_paper":"/paper/2502.00342"},"observation_digest":"sha256:def53f3ac3794a7e683a4e3c607a7d4c620a552b4f5fc2085777a82633a7ce76","observation_id":"aaf700ab-c215-47b7-a9ea-6ff33ed1bbec","resolution":{"observed_at":"2026-08-09T19:24:18.001184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:24:20.012806Z","title":null,"venue":null,"work_id":"8933d912-25fa-43f3-987e-015b46f66ae6","year":null},"citing_paper":{"arxiv_id":"2502.00342","last_updated":"2025-08-08T07:24:11Z","snapshot_observed_at":"2026-08-09T19:19:13.983577Z","submitted_at":"2025-02-01T07:01:33Z","title":"Embodied Intelligence for 3D Understanding: A Survey on 3D Scene Question Answering","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-09T19:24:18.038721Z"},"links":{"citing_paper":"/paper/2502.00342"},"observation_digest":"sha256:083f7a2687f4df246c66e1f151f32a0dcc75ba08e691e3f07f9b3b689e4801e0","observation_id":"49020635-2f2e-4c86-92e0-833503882ef7","resolution":{"observed_at":"2026-08-09T19:24:20.017994Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:24:19.979704Z","title":null,"venue":null,"work_id":"8c6c25d7-07ee-4386-984f-78ffad48f7c8","year":null},"citing_paper":{"arxiv_id":"2502.00342","last_updated":"2025-08-08T07:24:11Z","snapshot_observed_at":"2026-08-09T19:19:13.983577Z","submitted_at":"2025-02-01T07:01:33Z","title":"Embodied Intelligence for 3D Understanding: A Survey on 3D Scene Question Answering","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-09T19:24:18.047963Z"},"links":{"citing_paper":"/paper/2502.00342"},"observation_digest":"sha256:049afc3dfd1905eb228c3e2fcb9f747d62357dc65e6f578691c0b011856d2bef","observation_id":"82b63eac-17bb-4ff0-82be-79266cba391c","resolution":{"observed_at":"2026-08-09T19:24:19.984296Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:24:20.047253Z","title":"Habitat: A platform for embodied ai research, in: Proceedings of the IEEE/CVF international conference on computer vision, pp","venue":null,"work_id":"821fa1cb-142e-4e1d-a3c3-2dfbc8b0aac9","year":2019},"citing_paper":{"arxiv_id":"2502.00342","last_updated":"2025-08-08T07:24:11Z","snapshot_observed_at":"2026-08-09T19:19:13.983577Z","submitted_at":"2025-02-01T07:01:33Z","title":"Embodied Intelligence for 3D Understanding: A Survey on 3D Scene Question Answering","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-09T19:24:18.019065Z"},"links":{"citing_paper":"/paper/2502.00342"},"observation_digest":"sha256:9f0885336df7906bef9bf70052af8047a270b5f0cf30411107c73786dcb63290","observation_id":"6ac02b77-880a-418d-8219-196a4c375a74","resolution":{"observed_at":"2026-08-09T19:24:20.052660Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:24:19.945948Z","title":null,"venue":null,"work_id":"556800b2-dfbd-4be7-bde1-a74ccd981ff1","year":null},"citing_paper":{"arxiv_id":"2502.00342","last_updated":"2025-08-08T07:24:11Z","snapshot_observed_at":"2026-08-09T19:19:13.983577Z","submitted_at":"2025-02-01T07:01:33Z","title":"Embodied Intelligence for 3D Understanding: A Survey on 3D Scene Question Answering","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-09T19:24:18.063033Z"},"links":{"citing_paper":"/paper/2502.00342"},"observation_digest":"sha256:a523fd8f9ccb8ce64926d48a8bbf48406a60ab46107df72e7a04341ca2c77533","observation_id":"fb935da2-e5d3-44ab-8b97-834e69656197","resolution":{"observed_at":"2026-08-09T19:24:19.951331Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:24:18.074040Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.00342","last_updated":"2025-08-08T07:24:11Z","snapshot_observed_at":"2026-08-09T19:19:13.983577Z","submitted_at":"2025-02-01T07:01:33Z","title":"Embodied Intelligence for 3D Understanding: A Survey on 3D Scene Question Answering","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-09T19:24:18.074040Z"},"links":{"citing_paper":"/paper/2502.00342"},"observation_digest":"sha256:446d18b75e2a81b11d070b1cde21299b92425ff731b70163a35d46aeff716a4c","observation_id":"05ecb402-ab6f-4dff-8938-1ae7fd2ae615","resolution":{"observed_at":"2026-08-09T19:24:18.074040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:24:18.033660Z","title":"Robospatial: Teaching spatial understanding to 2d and 3d vision-language models for robotics","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00342","last_updated":"2025-08-08T07:24:11Z","snapshot_observed_at":"2026-08-09T19:19:13.983577Z","submitted_at":"2025-02-01T07:01:33Z","title":"Embodied Intelligence for 3D Understanding: A Survey on 3D Scene Question Answering","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-09T19:24:18.033660Z"},"links":{"citing_paper":"/paper/2502.00342"},"observation_digest":"sha256:f8a5ad3dfc3dfd0707b5621a10280acc884f3f70939ac4dac0d02a06e612adf4","observation_id":"602e8709-d571-49b0-93e2-02867534d7f0","resolution":{"observed_at":"2026-08-09T19:24:18.033660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:24:18.089500Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.00342","last_updated":"2025-08-08T07:24:11Z","snapshot_observed_at":"2026-08-09T19:19:13.983577Z","submitted_at":"2025-02-01T07:01:33Z","title":"Embodied Intelligence for 3D Understanding: A Survey on 3D Scene Question Answering","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-09T19:24:18.089500Z"},"links":{"citing_paper":"/paper/2502.00342"},"observation_digest":"sha256:72bc425089961f60b9a0b0e3115c9977a7d291c8f9132f974c93f2a47b10dc5a","observation_id":"d0126e34-0730-4c3b-9603-a12ed31c2a4c","resolution":{"observed_at":"2026-08-09T19:24:18.089500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:24:19.882965Z","title":"Cider: Consensus-based image description evaluation, in: Proceedings of the IEEE conference on computer vision and pattern recognition, pp","venue":null,"work_id":"d73651ba-7813-46aa-b3dc-ad5c7154ccbb","year":2015},"citing_paper":{"arxiv_id":"2502.00342","last_updated":"2025-08-08T07:24:11Z","snapshot_observed_at":"2026-08-09T19:19:13.983577Z","submitted_at":"2025-02-01T07:01:33Z","title":"Embodied Intelligence for 3D Understanding: A Survey on 3D Scene Question Answering","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-09T19:24:18.095281Z"},"links":{"citing_paper":"/paper/2502.00342"},"observation_digest":"sha256:32bdb2970252d09afe390cd27997b91a52f6115279c2520b831177393dbaef9f","observation_id":"0888d035-6604-4ecd-ba50-113077d7e7d9","resolution":{"observed_at":"2026-08-09T19:24:19.890016Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:24:19.862311Z","title":"Rio: 3d object instance re-localization in changing indoor environ- ments, in: Proceedings of the IEEE/CVF International Conference on Computer Vision, pp","venue":null,"work_id":"4e2b291f-aed1-4427-8594-f567eb9d2a70","year":2019},"citing_paper":{"arxiv_id":"2502.00342","last_updated":"2025-08-08T07:24:11Z","snapshot_observed_at":"2026-08-09T19:19:13.983577Z","submitted_at":"2025-02-01T07:01:33Z","title":"Embodied Intelligence for 3D Understanding: A Survey on 3D Scene Question Answering","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-09T19:24:18.100362Z"},"links":{"citing_paper":"/paper/2502.00342"},"observation_digest":"sha256:29a37b69fa12ff18d37aaf492c9a668e9aaf292f3632b3fd154d403d6790a6d2","observation_id":"5202b772-2e1e-416b-b31c-85050eb81cdb","resolution":{"observed_at":"2026-08-09T19:24:19.868550Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10560","last_updated":"2023-05-25T23:50:07Z","snapshot_observed_at":"2026-07-06T14:33:11.945106Z","submitted_at":"2022-12-20T18:59:19Z","title":"Self-Instruct: Aligning Language Models with Self-Generated Instructions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10560","snapshot_observed_at":"2026-08-09T19:24:18.105248Z","title":"Self-instruct: Aligning language models with self-generated instructions","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.00342","last_updated":"2025-08-08T07:24:11Z","snapshot_observed_at":"2026-08-09T19:19:13.983577Z","submitted_at":"2025-02-01T07:01:33Z","title":"Embodied Intelligence for 3D Understanding: A Survey on 3D Scene Question Answering","version":2},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-09T19:24:18.105248Z"},"links":{"cited_paper":"/paper/2212.10560","citing_paper":"/paper/2502.00342"},"observation_digest":"sha256:48f67ba4799220291816bc8025bc2b7a017937f18fca38641e62287839a5e849","observation_id":"b8add8e9-b150-47c8-8cde-4b3d2dd41e20","resolution":{"observed_at":"2026-08-09T19:24:18.105248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16662","last_updated":"2024-09-15T15:51:00Z","snapshot_observed_at":"2026-08-07T09:15:35.501379Z","submitted_at":"2024-08-29T16:05:22Z","title":"Space3D-Bench: Spatial 3D Question Answering Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16662","snapshot_observed_at":"2026-08-09T19:24:18.057476Z","title":"Space3d-bench: Spatial 3d question answering benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00342","last_updated":"2025-08-08T07:24:11Z","snapshot_observed_at":"2026-08-09T19:19:13.983577Z","submitted_at":"2025-02-01T07:01:33Z","title":"Embodied Intelligence for 3D Understanding: A Survey on 3D Scene Question Answering","version":2},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-09T19:24:18.057476Z"},"links":{"cited_paper":"/paper/2408.16662","citing_paper":"/paper/2502.00342"},"observation_digest":"sha256:2fee162dcabf7130b85e3721e62783a27d1b359dcb36ec8eb83dfa5094c81910","observation_id":"b79f58dc-148a-4d0d-82f8-4206a4d8aa86","resolution":{"observed_at":"2026-08-09T19:24:18.057476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:24:19.825166Z","title":"Medical vqa, in: Visual Question Answering: From Theory to Application","venue":null,"work_id":"a404c6e3-df93-4aa8-aade-8596b64a97a8","year":2022},"citing_paper":{"arxiv_id":"2502.00342","last_updated":"2025-08-08T07:24:11Z","snapshot_observed_at":"2026-08-09T19:19:13.983577Z","submitted_at":"2025-02-01T07:01:33Z","title":"Embodied Intelligence for 3D Understanding: A Survey on 3D Scene Question Answering","version":2},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-09T19:24:18.116148Z"},"links":{"citing_paper":"/paper/2502.00342"},"observation_digest":"sha256:019efeab5c15b6eb866b9352c10604a8ecf9799d3458fff6d94f2d55a7bcdbf6","observation_id":"85db0a83-c175-46f9-8e5a-bf7773b43ba2","resolution":{"observed_at":"2026-08-09T19:24:19.831073Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06271","last_updated":"2025-08-01T18:43:13Z","snapshot_observed_at":"2026-08-07T17:20:01.889779Z","submitted_at":"2025-03-08T16:31:48Z","title":"SplatTalk: 3D VQA with Gaussian Splatting","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06271","snapshot_observed_at":"2026-08-09T19:24:18.068674Z","title":"arXiv preprint arXiv:2503.06271","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.00342","last_updated":"2025-08-08T07:24:11Z","snapshot_observed_at":"2026-08-09T19:19:13.983577Z","submitted_at":"2025-02-01T07:01:33Z","title":"Embodied Intelligence for 3D Understanding: A Survey on 3D Scene Question Answering","version":2},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-09T19:24:18.068674Z"},"links":{"cited_paper":"/paper/2503.06271","citing_paper":"/paper/2502.00342"},"observation_digest":"sha256:2d844a74d176793528637728ba7df23f722fbd238e913d43f3d5723bcb20d7f2","observation_id":"07c8ad4f-d80a-4aa7-9143-b8bfe8035493","resolution":{"observed_at":"2026-08-09T19:24:18.068674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:24:19.806386Z","title":null,"venue":null,"work_id":"f8fa0d5f-fef8-4a7f-8aad-6fbce8a5a59e","year":null},"citing_paper":{"arxiv_id":"2502.00342","last_updated":"2025-08-08T07:24:11Z","snapshot_observed_at":"2026-08-09T19:19:13.983577Z","submitted_at":"2025-02-01T07:01:33Z","title":"Embodied Intelligence for 3D Understanding: A Survey on 3D Scene Question Answering","version":2},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-09T19:24:18.126915Z"},"links":{"citing_paper":"/paper/2502.00342"},"observation_digest":"sha256:05fbd24e62c73b4abf9c2fd7be67cafe8caf4dbba28c0097e3007eecc1be4906","observation_id":"69a842f5-e186-46ca-b09c-26fa2642b265","resolution":{"observed_at":"2026-08-09T19:24:19.811776Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-09T19:24:18.079030Z","title":"arXiv preprint arXiv:2302.13971","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.00342","last_updated":"2025-08-08T07:24:11Z","snapshot_observed_at":"2026-08-09T19:19:13.983577Z","submitted_at":"2025-02-01T07:01:33Z","title":"Embodied Intelligence for 3D Understanding: A Survey on 3D Scene Question Answering","version":2},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-09T19:24:18.079030Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2502.00342"},"observation_digest":"sha256:d856359441765ae59ed4a865fdf1922e1d5a1cec6470ceca6544ba9d290b24b9","observation_id":"465d05e9-243e-4786-acc3-b1f04e9ea7a9","resolution":{"observed_at":"2026-08-09T19:24:18.079030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.00342","last_updated":"2025-08-08T07:24:11Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T19:19:13.983577Z","submitted_at":"2025-02-01T07:01:33Z","title":"Embodied Intelligence for 3D Understanding: A Survey on 3D Scene Question Answering"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":76,"verified_exact":2,"verified_fuzzy":22},"total_outbound_references":132},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 100 of 132 outbound references and 3 inbound Pith citation observations for arXiv:2502.00342."}