{"as_of":"2026-08-13T19:00:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:20d0321f6ca02e363c9b5a0f1908fc3beb6d5fc09100a06e2fd096027306b282","coverage":[{"denominator":56,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":56,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T21:11:41.568355Z","state":"measured"},{"denominator":61,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":61,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T10:49:46.879382Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-21T17:10:25.176606Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.00886","last_updated":"2025-07-01T15:52:59Z","snapshot_observed_at":"2026-08-13T09:10:40.796129Z","submitted_at":"2025-07-01T15:52:59Z","title":"GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.00886","snapshot_observed_at":"2026-08-06T10:49:46.879382Z","title":"P.; and Gool, L","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.23478","last_updated":"2025-07-31T11:59:06Z","snapshot_observed_at":"2026-08-07T03:56:49.161093Z","submitted_at":"2025-07-31T11:59:06Z","title":"3D-R1: Enhancing Reasoning in 3D VLMs for Unified Scene Understanding","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T10:49:46.879382Z"},"links":{"cited_paper":"/paper/2507.00886","citing_paper":"/paper/2507.23478"},"observation_digest":"sha256:f70db64184f8d6f4947bc1fd27a706b1b1a014bf1a1f83601a20c1a4143aab29","observation_id":"7e82155e-5898-499c-9fd8-871245e418e0","resolution":{"observed_at":"2026-08-06T10:49:46.879382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.00886","last_updated":"2025-07-01T15:52:59Z","snapshot_observed_at":"2026-08-13T09:10:40.796129Z","submitted_at":"2025-07-01T15:52:59Z","title":"GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.00886","snapshot_observed_at":"2026-08-04T17:31:39.119379Z","title":"Gaussianvlm: Scene-centric 3d vision-language models using language-aligned gaussian splats for embodied reasoning and beyond,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.10884","last_updated":"2025-09-13T16:31:03Z","snapshot_observed_at":"2026-08-10T03:00:31.416194Z","submitted_at":"2025-09-13T16:31:03Z","title":"Nav-R1: Reasoning and Navigation in Embodied Scenes","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T17:31:39.119379Z"},"links":{"cited_paper":"/paper/2507.00886","citing_paper":"/paper/2509.10884"},"observation_digest":"sha256:419acb7265162607776945a28c942350b42f3dbaf7b02ec0d90fc5a260075965","observation_id":"941fcaf6-8663-445f-965e-9853f84b77fd","resolution":{"observed_at":"2026-08-04T17:31:39.119379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.00886","last_updated":"2025-07-01T15:52:59Z","snapshot_observed_at":"2026-08-13T09:10:40.796129Z","submitted_at":"2025-07-01T15:52:59Z","title":"GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond","version":1},"cited_work":{"arxiv_id":"2507.00886","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.00886","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gaussianvlm: Scene-centric 3d vision-language models using language- aligned gaussian splats for embodied reasoning and beyond","venue":null,"work_id":"4bd5b345-8b04-4090-b596-414a2afcc851","year":2025},"citing_paper":{"arxiv_id":"2512.17817","last_updated":"2026-05-04T21:21:49Z","snapshot_observed_at":"2026-08-12T22:15:44.312798Z","submitted_at":"2025-12-19T17:22:35Z","title":"Chorus: Multi-Teacher Pretraining for Holistic 3D Gaussian Scene Encoding","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-16T20:34:16.666956Z"},"links":{"cited_paper":"/paper/2507.00886","citing_paper":"/paper/2512.17817"},"observation_digest":"sha256:e71022f03fb4f0354f5bf2bef4a32776b914abc3caadd7a1a5df7c94159c5d53","observation_id":"f079f03d-4b14-4c66-bf24-7bbb12e19578","resolution":{"observed_at":"2026-05-16T20:38:24.856606Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.00886","last_updated":"2025-07-01T15:52:59Z","snapshot_observed_at":"2026-08-13T09:10:40.796129Z","submitted_at":"2025-07-01T15:52:59Z","title":"GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond","version":1},"cited_work":{"arxiv_id":"2507.00886","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.00886","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gaussianvlm: Scene-centric 3d vision-language models using language- aligned gaussian splats for embodied reasoning and beyond","venue":null,"work_id":"4bd5b345-8b04-4090-b596-414a2afcc851","year":2025},"citing_paper":{"arxiv_id":"2512.23180","last_updated":"2026-05-16T07:53:20Z","snapshot_observed_at":"2026-08-03T04:34:56.955960Z","submitted_at":"2025-12-29T03:40:05Z","title":"GaussianDWM: 3D Gaussian Driving World Model for Unified Scene Understanding and Multi-Modal Generation","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-21T17:06:34.398973Z"},"links":{"cited_paper":"/paper/2507.00886","citing_paper":"/paper/2512.23180"},"observation_digest":"sha256:b62f4c87e9144718aed03b965ed38d02c4f9e32a9035a641547e2287cea6b24b","observation_id":"86b7e462-9ced-4beb-bd69-2583450238f1","resolution":{"observed_at":"2026-05-21T17:10:25.178774Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.00886","last_updated":"2025-07-01T15:52:59Z","snapshot_observed_at":"2026-08-13T09:10:40.796129Z","submitted_at":"2025-07-01T15:52:59Z","title":"GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond","version":1},"cited_work":{"arxiv_id":"2507.00886","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.00886","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gaussianvlm: Scene-centric 3d vision-language models using language- aligned gaussian splats for embodied reasoning and beyond","venue":null,"work_id":"4bd5b345-8b04-4090-b596-414a2afcc851","year":2025},"citing_paper":{"arxiv_id":"2605.18210","last_updated":"2026-05-18T10:56:00Z","snapshot_observed_at":"2026-08-03T03:48:19.194837Z","submitted_at":"2026-05-18T10:56:00Z","title":"Motion-Enabled Tomography via Gaussian Mixture Models","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-05-20T00:22:19.543573Z"},"links":{"cited_paper":"/paper/2507.00886","citing_paper":"/paper/2605.18210"},"observation_digest":"sha256:d5a54e90007d17c37f3977b7aa39050737409dbae3cb76fdd7e982ec15c13c77","observation_id":"869fa4ab-31e3-4435-aeb5-d27c8362e560","resolution":{"observed_at":"2026-05-20T00:22:53.727881Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.00886/citation-record","integrity":"/paper/2507.00886/integrity","json":"/paper/2507.00886/citation-record.json","paper":"/paper/2507.00886"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:42.764637Z","title":null,"venue":null,"work_id":"8806e488-d6eb-47bf-91b4-c89b488c2324","year":2020},"citing_paper":{"arxiv_id":"2507.00886","last_updated":"2025-07-01T15:52:59Z","snapshot_observed_at":"2026-08-13T09:10:40.796129Z","submitted_at":"2025-07-01T15:52:59Z","title":"GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:41.213492Z"},"links":{"citing_paper":"/paper/2507.00886"},"observation_digest":"sha256:2004b889b85b65c3e7c37dba3c57d92c0f2944dca33f91fcbd097ef38378a9c0","observation_id":"dce48ee3-72fe-4174-bb03-8dda3ca37c9c","resolution":{"observed_at":"2026-08-06T21:11:42.769747Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:42.747359Z","title":"Spice: Semantic propositional image caption evaluation","venue":null,"work_id":"9c7a659c-e96f-4f74-a8d8-756aa22ba226","year":2016},"citing_paper":{"arxiv_id":"2507.00886","last_updated":"2025-07-01T15:52:59Z","snapshot_observed_at":"2026-08-13T09:10:40.796129Z","submitted_at":"2025-07-01T15:52:59Z","title":"GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:41.219518Z"},"links":{"citing_paper":"/paper/2507.00886"},"observation_digest":"sha256:994c0e97932604898a42fc80d3f5fadaac6154d2474dc8367f41ba1977075146","observation_id":"62b8e6e7-efdf-4bbd-b2c9-46f03abdc469","resolution":{"observed_at":"2026-08-06T21:11:42.753837Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:42.730189Z","title":"Scanqa: 3d question answering for spatial scene understanding","venue":null,"work_id":"96a9b00a-2936-4fb5-a3a3-0f9dadebd83d","year":2022},"citing_paper":{"arxiv_id":"2507.00886","last_updated":"2025-07-01T15:52:59Z","snapshot_observed_at":"2026-08-13T09:10:40.796129Z","submitted_at":"2025-07-01T15:52:59Z","title":"GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:41.225763Z"},"links":{"citing_paper":"/paper/2507.00886"},"observation_digest":"sha256:1d051031b7c102b0a6c8e96e90b97dba8cb251bd5fbf034c9f06c1d0b00f8092","observation_id":"7345b4a3-45b0-46f8-802c-2a20cb98c5c5","resolution":{"observed_at":"2026-08-06T21:11:42.735195Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:42.711541Z","title":"Meteor: An automatic metric for mt evaluation with improved correlation with human judgments","venue":null,"work_id":"d8b3dfff-d514-43a3-90d8-e67f3132c109","year":2005},"citing_paper":{"arxiv_id":"2507.00886","last_updated":"2025-07-01T15:52:59Z","snapshot_observed_at":"2026-08-13T09:10:40.796129Z","submitted_at":"2025-07-01T15:52:59Z","title":"GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:41.231148Z"},"links":{"citing_paper":"/paper/2507.00886"},"observation_digest":"sha256:df6d0be444e926eac3d6ac3ce008111d1af0e7e894924947f739ca0ecbe74ef0","observation_id":"63977d52-5bb8-497e-af86-33f3fba9f4a6","resolution":{"observed_at":"2026-08-06T21:11:42.717535Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-06T21:11:41.236634Z","title":"π0: A vision-language-action flow model for general robot control.arXiv:2410.24164, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00886","last_updated":"2025-07-01T15:52:59Z","snapshot_observed_at":"2026-08-13T09:10:40.796129Z","submitted_at":"2025-07-01T15:52:59Z","title":"GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:41.236634Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2507.00886"},"observation_digest":"sha256:a434f3e1915965cbfa0f499c5ea54ef99f78d2e3cdc09e2e883440a87815bb92","observation_id":"fb36ee04-3b55-4ebc-a842-1b153aa26830","resolution":{"observed_at":"2026-08-06T21:11:41.236634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:42.691930Z","title":"Language models are few-shot learners","venue":null,"work_id":"b9dc8b7e-29e0-4124-887a-4d9549fc7b9f","year":2020},"citing_paper":{"arxiv_id":"2507.00886","last_updated":"2025-07-01T15:52:59Z","snapshot_observed_at":"2026-08-13T09:10:40.796129Z","submitted_at":"2025-07-01T15:52:59Z","title":"GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:41.243336Z"},"links":{"citing_paper":"/paper/2507.00886"},"observation_digest":"sha256:f0495e7bc6e13fdfb8106f7863555338fe8e75daf48504c0ad4113b56957cf92","observation_id":"13f21252-f815-425b-8616-7b3393f11190","resolution":{"observed_at":"2026-08-06T21:11:42.697395Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:42.673891Z","title":"Language models are few-shot learners.NeurIPS, 33, 2020","venue":null,"work_id":"411f189c-0e1d-4ef3-8f2f-246390e32c6e","year":2020},"citing_paper":{"arxiv_id":"2507.00886","last_updated":"2025-07-01T15:52:59Z","snapshot_observed_at":"2026-08-13T09:10:40.796129Z","submitted_at":"2025-07-01T15:52:59Z","title":"GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:41.249674Z"},"links":{"citing_paper":"/paper/2507.00886"},"observation_digest":"sha256:adf3aa6fdfad06d90f47159b40ab3139596b3df0547e90d4c76608621d8f3eda","observation_id":"938ebc67-bb16-43c6-92a2-f630aa023d6a","resolution":{"observed_at":"2026-08-06T21:11:42.679435Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:42.652336Z","title":"Scanrefer: 3d object localization in rgb-d scans using natural language.ECCV, 2020","venue":null,"work_id":"1bc8faa3-49f2-4b09-aec2-d223bd15b1ab","year":2020},"citing_paper":{"arxiv_id":"2507.00886","last_updated":"2025-07-01T15:52:59Z","snapshot_observed_at":"2026-08-13T09:10:40.796129Z","submitted_at":"2025-07-01T15:52:59Z","title":"GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:41.255992Z"},"links":{"citing_paper":"/paper/2507.00886"},"observation_digest":"sha256:e26746c9d00542612dc353c26ca86a2d34dab57767fc6737a4b6ced19ab69690","observation_id":"76d5bb44-0d64-418a-86bc-5c6d05a5182c","resolution":{"observed_at":"2026-08-06T21:11:42.659786Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:42.632619Z","title":"Ll3da: Visual interactive instruction tuning for omni-3d understanding reasoning and planning","venue":null,"work_id":"03e1aea4-dd4a-48c8-a243-c4508d1e0a6a","year":2024},"citing_paper":{"arxiv_id":"2507.00886","last_updated":"2025-07-01T15:52:59Z","snapshot_observed_at":"2026-08-13T09:10:40.796129Z","submitted_at":"2025-07-01T15:52:59Z","title":"GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:41.261308Z"},"links":{"citing_paper":"/paper/2507.00886"},"observation_digest":"sha256:7e8856b9e1c7f08c5fc576d200dee4af7d6019abbbf29fc62ad6cd90f4c8a1bb","observation_id":"47304348-91cd-4ef2-a326-a47b8119f6e6","resolution":{"observed_at":"2026-08-06T21:11:42.638447Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:42.612227Z","title":"End-to-end 3d dense captioning with vote2cap-detr","venue":null,"work_id":"0220b076-9d09-4826-83dd-475cacfb2344","year":2023},"citing_paper":{"arxiv_id":"2507.00886","last_updated":"2025-07-01T15:52:59Z","snapshot_observed_at":"2026-08-13T09:10:40.796129Z","submitted_at":"2025-07-01T15:52:59Z","title":"GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:41.267207Z"},"links":{"citing_paper":"/paper/2507.00886"},"observation_digest":"sha256:832141f144e142c1e886bf971f21a213357268f71e3fac055418016f82238db1","observation_id":"fe9ce82c-b4e2-4712-89ae-142ba3d732c0","resolution":{"observed_at":"2026-08-06T21:11:42.617962Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.10370","last_updated":"2024-11-18T08:29:08Z","snapshot_observed_at":"2026-08-13T00:05:34.358839Z","submitted_at":"2024-05-16T18:03:41Z","title":"Grounded 3D-LLM with Referent Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.10370","snapshot_observed_at":"2026-08-06T21:11:41.273790Z","title":"Grounded 3d-llm with referent tokens.arXiv:2405.10370, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00886","last_updated":"2025-07-01T15:52:59Z","snapshot_observed_at":"2026-08-13T09:10:40.796129Z","submitted_at":"2025-07-01T15:52:59Z","title":"GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:41.273790Z"},"links":{"cited_paper":"/paper/2405.10370","citing_paper":"/paper/2507.00886"},"observation_digest":"sha256:8e9d32ab81ce7d111eca97c93e78a69cecc80e62aa78e06b8057960ec6e3e28c","observation_id":"5928badd-048a-4be5-bdec-2c371d8eddf5","resolution":{"observed_at":"2026-08-06T21:11:41.273790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:42.591906Z","title":"Scan2cap: Context-aware dense captioning in rgb-d scans","venue":null,"work_id":"7bf6a429-aa93-4256-ad9c-9f60904804dd","year":2021},"citing_paper":{"arxiv_id":"2507.00886","last_updated":"2025-07-01T15:52:59Z","snapshot_observed_at":"2026-08-13T09:10:40.796129Z","submitted_at":"2025-07-01T15:52:59Z","title":"GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:41.279380Z"},"links":{"citing_paper":"/paper/2507.00886"},"observation_digest":"sha256:0c4f029c610946b2010de5b7a0b2ded4c7ba58f4e62a850fd2e418835e0746a6","observation_id":"ece94938-dc4b-4c4e-89b9-0e712b158100","resolution":{"observed_at":"2026-08-06T21:11:42.597750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:42.573869Z","title":"Vicuna: An open-source chatbot impressing gpt-4 with 90%* chatgpt quality.See https://vicuna","venue":null,"work_id":"2483c37f-6c2a-486b-9c85-49afde6e7778","year":2023},"citing_paper":{"arxiv_id":"2507.00886","last_updated":"2025-07-01T15:52:59Z","snapshot_observed_at":"2026-08-13T09:10:40.796129Z","submitted_at":"2025-07-01T15:52:59Z","title":"GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:41.285356Z"},"links":{"citing_paper":"/paper/2507.00886"},"observation_digest":"sha256:77a14d0c95f5fcb6fe54132faea3b2be4362a3ae69da45b577e983de1b252f49","observation_id":"6f6573d0-446f-477c-b46b-aae6a6e9aad2","resolution":{"observed_at":"2026-08-06T21:11:42.579173Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:42.556547Z","title":"Rouge: A package for automatic evaluation of summaries","venue":null,"work_id":"d19865fc-486f-412a-b96f-c50a805ede82","year":2004},"citing_paper":{"arxiv_id":"2507.00886","last_updated":"2025-07-01T15:52:59Z","snapshot_observed_at":"2026-08-13T09:10:40.796129Z","submitted_at":"2025-07-01T15:52:59Z","title":"GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:41.293538Z"},"links":{"citing_paper":"/paper/2507.00886"},"observation_digest":"sha256:14a119a7c76eebcbdc7958303385abde9cb5ec82066d3e2b6bf70c5ea0a8e8b9","observation_id":"6b3e5da4-443a-404e-a6b8-04ed9476a780","resolution":{"observed_at":"2026-08-06T21:11:42.561846Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:41.299459Z","title":"Scannet: Richly-annotated 3d reconstructions of indoor scenes","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.00886","last_updated":"2025-07-01T15:52:59Z","snapshot_observed_at":"2026-08-13T09:10:40.796129Z","submitted_at":"2025-07-01T15:52:59Z","title":"GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:41.299459Z"},"links":{"citing_paper":"/paper/2507.00886"},"observation_digest":"sha256:03b714c599ac4f81d42772ae36b8229cc235f394b595d17ef8d572b571a7e7ae","observation_id":"b5621d6d-b740-4be6-9474-c0eeb9c74ea0","resolution":{"observed_at":"2026-08-06T21:11:41.299459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:42.527021Z","title":"Embodied question answering","venue":null,"work_id":"ff3c70bc-0cdf-4989-b70a-e94ccaa98071","year":2018},"citing_paper":{"arxiv_id":"2507.00886","last_updated":"2025-07-01T15:52:59Z","snapshot_observed_at":"2026-08-13T09:10:40.796129Z","submitted_at":"2025-07-01T15:52:59Z","title":"GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:41.305870Z"},"links":{"citing_paper":"/paper/2507.00886"},"observation_digest":"sha256:ad47eb2f7217f9f77436e6dcd78d5c87313577074a3f81d55568b14f77896b10","observation_id":"1bc32700-92e8-43ff-8734-bd62b9a88cf2","resolution":{"observed_at":"2026-08-06T21:11:42.532399Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:42.504131Z","title":"SceneFun3D: Fine-Grained Functionality and Affordance Understanding in 3D Scenes","venue":null,"work_id":"7c24d98e-9fce-4258-83a5-58d936ef34ab","year":2024},"citing_paper":{"arxiv_id":"2507.00886","last_updated":"2025-07-01T15:52:59Z","snapshot_observed_at":"2026-08-13T09:10:40.796129Z","submitted_at":"2025-07-01T15:52:59Z","title":"GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:41.311181Z"},"links":{"citing_paper":"/paper/2507.00886"},"observation_digest":"sha256:2d64af93983678fb47af03d9f91649b8e45d54cd5d95064751ff33a12a92a408","observation_id":"e07ac790-46a6-4e77-ac8e-1e736886849e","resolution":{"observed_at":"2026-08-06T21:11:42.510265Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:42.485513Z","title":"Scene- llm: Extending language model for 3d visual reasoning","venue":null,"work_id":"81c0c0cb-0010-4ff7-ae73-4fdd295c155a","year":2025},"citing_paper":{"arxiv_id":"2507.00886","last_updated":"2025-07-01T15:52:59Z","snapshot_observed_at":"2026-08-13T09:10:40.796129Z","submitted_at":"2025-07-01T15:52:59Z","title":"GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:41.316170Z"},"links":{"citing_paper":"/paper/2507.00886"},"observation_digest":"sha256:32fd95d16b2c9a60bf0f5e4c8e4e745c1db06e5b205d3e721d2aaa420e71549c","observation_id":"ef2b0ee1-703c-4e38-9f4a-9f9b863e2498","resolution":{"observed_at":"2026-08-06T21:11:42.491273Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:42.465397Z","title":"Perla: Perceptive 3d language assistant","venue":null,"work_id":"0b71cc7a-e3a2-4f92-8c05-48787cac60e7","year":2025},"citing_paper":{"arxiv_id":"2507.00886","last_updated":"2025-07-01T15:52:59Z","snapshot_observed_at":"2026-08-13T09:10:40.796129Z","submitted_at":"2025-07-01T15:52:59Z","title":"GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:41.320887Z"},"links":{"citing_paper":"/paper/2507.00886"},"observation_digest":"sha256:cf99082f0a9d71674a5d6f3407861b988a38e4d968d9382272138aee7cf2a2cb","observation_id":"9544d30b-4cbb-40ce-85a4-d77c5feccaa2","resolution":{"observed_at":"2026-08-06T21:11:42.471471Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:42.306790Z","title":"3d-llm: Injecting the 3d world into large language models.NeurIPS, 2023","venue":null,"work_id":"ece79bc8-eb6b-4f54-8629-0049e833f0e6","year":2023},"citing_paper":{"arxiv_id":"2507.00886","last_updated":"2025-07-01T15:52:59Z","snapshot_observed_at":"2026-08-13T09:10:40.796129Z","submitted_at":"2025-07-01T15:52:59Z","title":"GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:41.325975Z"},"links":{"citing_paper":"/paper/2507.00886"},"observation_digest":"sha256:d2c0853ec035fd0722220693064495c6e224b709db0ef8e757313b431a0e7acb","observation_id":"5c77d981-2f04-439c-bbce-603aafd41b13","resolution":{"observed_at":"2026-08-06T21:11:42.312306Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:42.286590Z","title":"Lora: Low-rank adaptation of large language models.ICLR, 1(2), 2022","venue":null,"work_id":"ed6ab08b-8447-4fb3-8fe6-a37e6a572a84","year":2022},"citing_paper":{"arxiv_id":"2507.00886","last_updated":"2025-07-01T15:52:59Z","snapshot_observed_at":"2026-08-13T09:10:40.796129Z","submitted_at":"2025-07-01T15:52:59Z","title":"GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:41.331246Z"},"links":{"citing_paper":"/paper/2507.00886"},"observation_digest":"sha256:bab5cb788bba32f865f299441bdfa83e15ba62ede74726ea506c5b80c376f44d","observation_id":"630f55f1-fbec-4517-b1a3-fbe858d17414","resolution":{"observed_at":"2026-08-06T21:11:42.292219Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:42.264923Z","title":"Chat-scene: Bridging 3d scene and large language models with object identifiers","venue":null,"work_id":"c6ccc816-bd76-421d-b93d-7996447871c7","year":2024},"citing_paper":{"arxiv_id":"2507.00886","last_updated":"2025-07-01T15:52:59Z","snapshot_observed_at":"2026-08-13T09:10:40.796129Z","submitted_at":"2025-07-01T15:52:59Z","title":"GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:41.336827Z"},"links":{"citing_paper":"/paper/2507.00886"},"observation_digest":"sha256:98edab9900924458f30e231c3d4609226343fcc67d37c80a19ecd67d9f47d2b9","observation_id":"f23b6634-9732-42de-a357-9d2f251845f4","resolution":{"observed_at":"2026-08-06T21:11:42.271592Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:42.245843Z","title":"An embodied generalist agent in 3d world","venue":null,"work_id":"e5d552e4-3483-411a-b343-cbac49572c9b","year":2024},"citing_paper":{"arxiv_id":"2507.00886","last_updated":"2025-07-01T15:52:59Z","snapshot_observed_at":"2026-08-13T09:10:40.796129Z","submitted_at":"2025-07-01T15:52:59Z","title":"GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:41.343406Z"},"links":{"citing_paper":"/paper/2507.00886"},"observation_digest":"sha256:3048e9a88c7ff191c4f47bdff419d58741790ecdd705311ed92d1b05a899481e","observation_id":"fb659d84-9e73-4fad-92b7-a75ccb24b7e3","resolution":{"observed_at":"2026-08-06T21:11:42.252342Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:42.226966Z","title":"Less is more: Clipbert for video-and-language learning via sparse sampling","venue":null,"work_id":"510c9264-84d7-49c9-a7fc-03a6a7c74404","year":2021},"citing_paper":{"arxiv_id":"2507.00886","last_updated":"2025-07-01T15:52:59Z","snapshot_observed_at":"2026-08-13T09:10:40.796129Z","submitted_at":"2025-07-01T15:52:59Z","title":"GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:41.349918Z"},"links":{"citing_paper":"/paper/2507.00886"},"observation_digest":"sha256:fd081f1d659e62995835eb246bf8c9914721924df0c915d8f20b0b0d7d24d98a","observation_id":"1b6958b3-d123-4be1-855f-265e1d28ba07","resolution":{"observed_at":"2026-08-06T21:11:42.233951Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:41.359433Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.00886","last_updated":"2025-07-01T15:52:59Z","snapshot_observed_at":"2026-08-13T09:10:40.796129Z","submitted_at":"2025-07-01T15:52:59Z","title":"GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:41.359433Z"},"links":{"citing_paper":"/paper/2507.00886"},"observation_digest":"sha256:8da1eb9a9b26bc88d971c66c53d89056a9acfd9cd85e3aca5fbeaf1c100ef7bf","observation_id":"f6a37ab2-ae31-4632-97ba-2e40621a4375","resolution":{"observed_at":"2026-08-06T21:11:41.359433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:42.195683Z","title":"M3dbench: Towards omni 3d assistant with interleaved multi-modal instructions","venue":null,"work_id":"66698458-7b1c-4bca-9760-c01f25468439","year":2025},"citing_paper":{"arxiv_id":"2507.00886","last_updated":"2025-07-01T15:52:59Z","snapshot_observed_at":"2026-08-13T09:10:40.796129Z","submitted_at":"2025-07-01T15:52:59Z","title":"GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:41.366259Z"},"links":{"citing_paper":"/paper/2507.00886"},"observation_digest":"sha256:600b65b4c19cf45ad4d53973acb6c053814eb3e851f64e27b9f9fd850d11bd69","observation_id":"bee4ddeb-8720-473d-b8a2-b0134860b0de","resolution":{"observed_at":"2026-08-06T21:11:42.201418Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18052","last_updated":"2025-06-03T16:42:52Z","snapshot_observed_at":"2026-08-12T08:16:39.525976Z","submitted_at":"2025-03-23T12:50:25Z","title":"SceneSplat: Gaussian Splatting-based Scene Understanding with Vision-Language Pretraining","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.18052","snapshot_observed_at":"2026-08-06T21:11:41.372451Z","title":"Scenesplat: Gaussian splatting-based scene understanding with vision- language pretraining.arXiv:2503.18052, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00886","last_updated":"2025-07-01T15:52:59Z","snapshot_observed_at":"2026-08-13T09:10:40.796129Z","submitted_at":"2025-07-01T15:52:59Z","title":"GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:41.372451Z"},"links":{"cited_paper":"/paper/2503.18052","citing_paper":"/paper/2507.00886"},"observation_digest":"sha256:21d66b451f0cb59b55899b4ec815021a2b6de071569bc86d2915664e00b82424","observation_id":"cab475ff-1491-4357-bb41-e7d10d80fc1a","resolution":{"observed_at":"2026-08-06T21:11:41.372451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:42.175392Z","title":"Visual instruction tuning","venue":null,"work_id":"b4121e32-3108-4163-93e2-9a454111e7f8","year":2023},"citing_paper":{"arxiv_id":"2507.00886","last_updated":"2025-07-01T15:52:59Z","snapshot_observed_at":"2026-08-13T09:10:40.796129Z","submitted_at":"2025-07-01T15:52:59Z","title":"GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:41.378323Z"},"links":{"citing_paper":"/paper/2507.00886"},"observation_digest":"sha256:0bcd895b6516ffb90fd67ec7907cca47929b91799c2ceafb2897b0e307cbe1e1","observation_id":"ede946ef-01c0-4c02-b54a-5fb3e29f890a","resolution":{"observed_at":"2026-08-06T21:11:42.180884Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:42.156540Z","title":"Robomp 2: A robotic multimodal perception-planning framework with mutlimodal large language models","venue":null,"work_id":"6468a6b7-4070-4229-b722-9296348c977d","year":2024},"citing_paper":{"arxiv_id":"2507.00886","last_updated":"2025-07-01T15:52:59Z","snapshot_observed_at":"2026-08-13T09:10:40.796129Z","submitted_at":"2025-07-01T15:52:59Z","title":"GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:41.383839Z"},"links":{"citing_paper":"/paper/2507.00886"},"observation_digest":"sha256:c6e78fb8be6de960807032f3096df2f32e45af6fd7e5941fb61caba611a10014","observation_id":"724f85b0-b6d3-4c1f-9cc7-f69445974593","resolution":{"observed_at":"2026-08-06T21:11:42.162291Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:42.137644Z","title":"Sqa3d: Situated question answering in 3d scenes","venue":null,"work_id":"f48ff884-e458-4ae4-ae1a-b3a05bae97ae","year":2023},"citing_paper":{"arxiv_id":"2507.00886","last_updated":"2025-07-01T15:52:59Z","snapshot_observed_at":"2026-08-13T09:10:40.796129Z","submitted_at":"2025-07-01T15:52:59Z","title":"GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:41.394318Z"},"links":{"citing_paper":"/paper/2507.00886"},"observation_digest":"sha256:c2d2ebc93a7c257938ce511ee70f5b36b5d8788a3b45e562a65a2fc434b42e89","observation_id":"5066d224-b78d-4b15-b019-0b5bee7fc1f6","resolution":{"observed_at":"2026-08-06T21:11:42.144252Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:42.118802Z","title":"Situational awareness matters in 3d vision language reasoning","venue":null,"work_id":"17a64253-0f22-46d8-a49f-8f8b6deab0be","year":2024},"citing_paper":{"arxiv_id":"2507.00886","last_updated":"2025-07-01T15:52:59Z","snapshot_observed_at":"2026-08-13T09:10:40.796129Z","submitted_at":"2025-07-01T15:52:59Z","title":"GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:41.402260Z"},"links":{"citing_paper":"/paper/2507.00886"},"observation_digest":"sha256:5287f6b852e47c07aa2238ebb1e97e95ed5aacc38c1b2db61b51e60b1a4f8e4f","observation_id":"e5e51994-6877-48f5-9e18-e05552774e67","resolution":{"observed_at":"2026-08-06T21:11:42.124429Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:42.101784Z","title":"Bleu: a method for automatic evaluation of machine translation","venue":null,"work_id":"ae052b35-1ed4-4652-90ed-608486dba12e","year":2002},"citing_paper":{"arxiv_id":"2507.00886","last_updated":"2025-07-01T15:52:59Z","snapshot_observed_at":"2026-08-13T09:10:40.796129Z","submitted_at":"2025-07-01T15:52:59Z","title":"GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:41.408755Z"},"links":{"citing_paper":"/paper/2507.00886"},"observation_digest":"sha256:f70b69c099a92526efa055cbdc00a3808fe4a626e0851abd200efe55681f6c65","observation_id":"fc7af682-c423-4ae7-a067-232cceb64d2e","resolution":{"observed_at":"2026-08-06T21:11:42.107208Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:41.414354Z","title":"Openscene: 3d scene understanding with open vocabularies","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.00886","last_updated":"2025-07-01T15:52:59Z","snapshot_observed_at":"2026-08-13T09:10:40.796129Z","submitted_at":"2025-07-01T15:52:59Z","title":"GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:41.414354Z"},"links":{"citing_paper":"/paper/2507.00886"},"observation_digest":"sha256:3e141b022e11184929649d84b6e65bbbbb858166eff88127339e6254eccc143f","observation_id":"520415f3-da78-419e-afde-e6821d753227","resolution":{"observed_at":"2026-08-06T21:11:41.414354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:42.073040Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"51c60d63-7e5c-4d1c-9f94-fb07c982fbce","year":2021},"citing_paper":{"arxiv_id":"2507.00886","last_updated":"2025-07-01T15:52:59Z","snapshot_observed_at":"2026-08-13T09:10:40.796129Z","submitted_at":"2025-07-01T15:52:59Z","title":"GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:41.419457Z"},"links":{"citing_paper":"/paper/2507.00886"},"observation_digest":"sha256:d608752866bc4e7d7c85344da1e67eb6cef300c4414486815a867ee177486506","observation_id":"f9a149be-8300-4397-ae53-08ed8e1386ce","resolution":{"observed_at":"2026-08-06T21:11:42.078273Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:42.055556Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer.Journal of Machine Learning Research, 21(140), 2020","venue":null,"work_id":"424744ef-323e-4588-a815-0b26f73b94f5","year":2020},"citing_paper":{"arxiv_id":"2507.00886","last_updated":"2025-07-01T15:52:59Z","snapshot_observed_at":"2026-08-13T09:10:40.796129Z","submitted_at":"2025-07-01T15:52:59Z","title":"GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:41.424588Z"},"links":{"citing_paper":"/paper/2507.00886"},"observation_digest":"sha256:7735b408a7f3d383c946ca37fc0ced3d9474ea0c848673e95610bc376d2189cb","observation_id":"438b0917-0e25-42a8-a935-22ef8c85c414","resolution":{"observed_at":"2026-08-06T21:11:42.061024Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:42.040096Z","title":"Sayplan: Grounding large language models using 3d scene graphs for scalable task planning","venue":null,"work_id":"b2d29422-34c8-4ca6-bbfa-293a1d9514f1","year":2023},"citing_paper":{"arxiv_id":"2507.00886","last_updated":"2025-07-01T15:52:59Z","snapshot_observed_at":"2026-08-13T09:10:40.796129Z","submitted_at":"2025-07-01T15:52:59Z","title":"GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:41.429612Z"},"links":{"citing_paper":"/paper/2507.00886"},"observation_digest":"sha256:2b6b450193e577cb2733a09abebc34c1eefacbc9dc0b7919303b717bac321cf8","observation_id":"71fa2693-091e-4163-bbe7-59e4e9eef479","resolution":{"observed_at":"2026-08-06T21:11:42.045045Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:42.023268Z","title":"Sentence-BERT: Sentence embed- dings using Siamese BERT-networks","venue":null,"work_id":"07a0d27e-36ce-4324-aeef-643734a42a03","year":2019},"citing_paper":{"arxiv_id":"2507.00886","last_updated":"2025-07-01T15:52:59Z","snapshot_observed_at":"2026-08-13T09:10:40.796129Z","submitted_at":"2025-07-01T15:52:59Z","title":"GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:41.435332Z"},"links":{"citing_paper":"/paper/2507.00886"},"observation_digest":"sha256:9af62f60e33e91862bb168407c52f51adaa8b48cec574241e965e9f2c9a0c0ef","observation_id":"ca57a215-ab1f-4e44-a3a3-87d767deba3f","resolution":{"observed_at":"2026-08-06T21:11:42.028525Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:42.002966Z","title":"Structure-from- motion revisited","venue":null,"work_id":"b310126a-6a56-4316-84d3-012a3253386c","year":2016},"citing_paper":{"arxiv_id":"2507.00886","last_updated":"2025-07-01T15:52:59Z","snapshot_observed_at":"2026-08-13T09:10:40.796129Z","submitted_at":"2025-07-01T15:52:59Z","title":"GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:41.441959Z"},"links":{"citing_paper":"/paper/2507.00886"},"observation_digest":"sha256:3cb3bc1f2549ce3b5f0a3822608aa68603c9e20d623742185342a23250518837","observation_id":"ef392936-ef1a-48bd-9d4f-ae7f2987b106","resolution":{"observed_at":"2026-08-06T21:11:42.010366Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:41.984903Z","title":"Pixelwise view selection for unstructured multi-view stereo","venue":null,"work_id":"70a899f2-884c-4d77-a0e6-1e815a0787a3","year":2016},"citing_paper":{"arxiv_id":"2507.00886","last_updated":"2025-07-01T15:52:59Z","snapshot_observed_at":"2026-08-13T09:10:40.796129Z","submitted_at":"2025-07-01T15:52:59Z","title":"GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:41.447545Z"},"links":{"citing_paper":"/paper/2507.00886"},"observation_digest":"sha256:04865e2212b156e6c5152122529160f51c703bb1114b3b6b7d415be0932b97a9","observation_id":"fc9d63c4-4a88-49e3-b8be-6d0aec5795b4","resolution":{"observed_at":"2026-08-06T21:11:41.990655Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:41.967036Z","title":"Splat-mover: Multi-stage, open-vocabulary robotic manipulation via editable gaussian splatting","venue":null,"work_id":"30119ed7-9b30-4c59-bb4d-54f92f6177c9","year":2024},"citing_paper":{"arxiv_id":"2507.00886","last_updated":"2025-07-01T15:52:59Z","snapshot_observed_at":"2026-08-13T09:10:40.796129Z","submitted_at":"2025-07-01T15:52:59Z","title":"GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:41.455862Z"},"links":{"citing_paper":"/paper/2507.00886"},"observation_digest":"sha256:e3148ba055d4a40383ec48ef24d337a57fe0aaa07cd4db52a67c5c9d09c08aca","observation_id":"ad03dfc2-3f01-4d59-9498-a50e8c5933ee","resolution":{"observed_at":"2026-08-06T21:11:41.972997Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:41.948027Z","title":"Habitat 2.0: Training home assistants to rearrange their habitat","venue":null,"work_id":"a1cbd2b5-e21d-459f-b5e1-028f9ce79aba","year":2021},"citing_paper":{"arxiv_id":"2507.00886","last_updated":"2025-07-01T15:52:59Z","snapshot_observed_at":"2026-08-13T09:10:40.796129Z","submitted_at":"2025-07-01T15:52:59Z","title":"GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:41.463816Z"},"links":{"citing_paper":"/paper/2507.00886"},"observation_digest":"sha256:8196d2f275af83943bddde9410a5f06b5c5241c2de5de262226c39cd2670461a","observation_id":"8e019016-dff5-43f2-97e2-b140d1b7666e","resolution":{"observed_at":"2026-08-06T21:11:41.953780Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-06T21:11:41.471296Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.00886","last_updated":"2025-07-01T15:52:59Z","snapshot_observed_at":"2026-08-13T09:10:40.796129Z","submitted_at":"2025-07-01T15:52:59Z","title":"GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:41.471296Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2507.00886"},"observation_digest":"sha256:30990af7bd2f4a4373b8bb9273cfe14dc6dfd68f2aa0beb15da87a182e517648","observation_id":"6dfa22b6-948a-417c-830f-1e1ad4564e8c","resolution":{"observed_at":"2026-08-06T21:11:41.471296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14786","last_updated":"2025-02-20T18:08:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-20T18:08:29Z","title":"SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14786","snapshot_observed_at":"2026-08-06T21:11:41.478020Z","title":"Siglip 2: Multilingual vision- language encoders with improved semantic understanding, localization, and dense features.arXiv:2502.14786, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00886","last_updated":"2025-07-01T15:52:59Z","snapshot_observed_at":"2026-08-13T09:10:40.796129Z","submitted_at":"2025-07-01T15:52:59Z","title":"GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:41.478020Z"},"links":{"cited_paper":"/paper/2502.14786","citing_paper":"/paper/2507.00886"},"observation_digest":"sha256:2da159d83cb2d5d23707106ceb0362ab302fa5f272cc9b66987bf850ed8f72b7","observation_id":"a2a34dc7-ff9e-4ee3-990d-5e24b3f707a1","resolution":{"observed_at":"2026-08-06T21:11:41.478020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:41.930236Z","title":"Cider: Consensus-based image description evaluation","venue":null,"work_id":"c3404a91-efac-4868-b4b8-0b1d3fafcf95","year":2015},"citing_paper":{"arxiv_id":"2507.00886","last_updated":"2025-07-01T15:52:59Z","snapshot_observed_at":"2026-08-13T09:10:40.796129Z","submitted_at":"2025-07-01T15:52:59Z","title":"GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:41.485329Z"},"links":{"citing_paper":"/paper/2507.00886"},"observation_digest":"sha256:981ca403a9f32bdb7d93a73e67a619b14c6f7f36282228bca6e1102becd31be0","observation_id":"eb9e799b-df73-4312-b8f3-a83af7481982","resolution":{"observed_at":"2026-08-06T21:11:41.935715Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:41.909514Z","title":"Chat-3d: Data-efficiently tuning large language model for universal dialogue of 3d scenes, 2023","venue":null,"work_id":"a4ce5910-24ad-4a47-8404-cb0377959719","year":2023},"citing_paper":{"arxiv_id":"2507.00886","last_updated":"2025-07-01T15:52:59Z","snapshot_observed_at":"2026-08-13T09:10:40.796129Z","submitted_at":"2025-07-01T15:52:59Z","title":"GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:41.495612Z"},"links":{"citing_paper":"/paper/2507.00886"},"observation_digest":"sha256:57fa01d6398651d9882f3f45a19a2988ef88090f243d4e287d16697bedd60729","observation_id":"d2f5a8ba-a8e4-4895-8388-3b4f1e16a624","resolution":{"observed_at":"2026-08-06T21:11:41.916290Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:41.888815Z","title":"Embodied question answering in photorealistic environments with point cloud perception","venue":null,"work_id":"4caa09d9-6296-4a35-b3a7-21a75f4b0d97","year":2019},"citing_paper":{"arxiv_id":"2507.00886","last_updated":"2025-07-01T15:52:59Z","snapshot_observed_at":"2026-08-13T09:10:40.796129Z","submitted_at":"2025-07-01T15:52:59Z","title":"GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:41.502387Z"},"links":{"citing_paper":"/paper/2507.00886"},"observation_digest":"sha256:6bd511d50c4484577f490aa375a7d712804634be682484a946bee30db4c87b59","observation_id":"7467322e-e05c-4dc6-8602-88dd22716ae1","resolution":{"observed_at":"2026-08-06T21:11:41.894413Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:41.868251Z","title":"Tidybot: Personalized robot assistance with large language models","venue":null,"work_id":"d1d96d5a-04ea-4e66-8478-8fda604f3928","year":2023},"citing_paper":{"arxiv_id":"2507.00886","last_updated":"2025-07-01T15:52:59Z","snapshot_observed_at":"2026-08-13T09:10:40.796129Z","submitted_at":"2025-07-01T15:52:59Z","title":"GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:41.509927Z"},"links":{"citing_paper":"/paper/2507.00886"},"observation_digest":"sha256:b4785fb5fa705a7b09f9e76ec2b68ae84e08beb657ec217292b3f16e9dfef469","observation_id":"5821b62b-36f7-475b-a2c8-8f516a4957ac","resolution":{"observed_at":"2026-08-06T21:11:41.875390Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06084","last_updated":"2024-07-08T16:26:52Z","snapshot_observed_at":"2026-08-12T23:26:36.535356Z","submitted_at":"2024-07-08T16:26:52Z","title":"3D Vision and Language Pretraining with Large-Scale Synthetic Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.06084","snapshot_observed_at":"2026-08-06T21:11:41.518057Z","title":"3d vision and language pretraining with large-scale synthetic data.arXiv:2407.06084, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00886","last_updated":"2025-07-01T15:52:59Z","snapshot_observed_at":"2026-08-13T09:10:40.796129Z","submitted_at":"2025-07-01T15:52:59Z","title":"GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:41.518057Z"},"links":{"cited_paper":"/paper/2407.06084","citing_paper":"/paper/2507.00886"},"observation_digest":"sha256:3223e8f10fb95352a91611019aefad7291c6cf498d068e11e29a81dbe9e5b155","observation_id":"082210d5-5156-446f-846e-b2e69e8d03a2","resolution":{"observed_at":"2026-08-06T21:11:41.518057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:41.524888Z","title":"Scannet++: A high-fidelity dataset of 3d indoor scenes","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.00886","last_updated":"2025-07-01T15:52:59Z","snapshot_observed_at":"2026-08-13T09:10:40.796129Z","submitted_at":"2025-07-01T15:52:59Z","title":"GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:41.524888Z"},"links":{"citing_paper":"/paper/2507.00886"},"observation_digest":"sha256:a2c0b4e6b104863bf1b6b7d29182fcf6e76eae2c43fa65ea284c8c583da783ac","observation_id":"9b9e34a3-bae8-453e-8ca3-30f12c17e50b","resolution":{"observed_at":"2026-08-06T21:11:41.524888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:41.530797Z","title":"Deep modular co-attention networks for visual question answering","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.00886","last_updated":"2025-07-01T15:52:59Z","snapshot_observed_at":"2026-08-13T09:10:40.796129Z","submitted_at":"2025-07-01T15:52:59Z","title":"GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:41.530797Z"},"links":{"citing_paper":"/paper/2507.00886"},"observation_digest":"sha256:2d25f20a3ab932d3eafbef630abceb5d1b76f76fbfa4296057067fab96577b3c","observation_id":"7d7b2030-b090-4bd6-9119-af0a1bebda9f","resolution":{"observed_at":"2026-08-06T21:11:41.530797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:41.536825Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.00886","last_updated":"2025-07-01T15:52:59Z","snapshot_observed_at":"2026-08-13T09:10:40.796129Z","submitted_at":"2025-07-01T15:52:59Z","title":"GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:41.536825Z"},"links":{"citing_paper":"/paper/2507.00886"},"observation_digest":"sha256:7b4b5bb059e6b1ab3665d095fa7affbe63b93c484a3cf7aee276f0c10603bbe9","observation_id":"392a3eda-69b0-437a-934f-f03aabed6c19","resolution":{"observed_at":"2026-08-06T21:11:41.536825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-08-06T03:13:37.403059Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-08-06T21:11:41.543075Z","title":"Opt: Open pre-trained transformer language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.00886","last_updated":"2025-07-01T15:52:59Z","snapshot_observed_at":"2026-08-13T09:10:40.796129Z","submitted_at":"2025-07-01T15:52:59Z","title":"GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:41.543075Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2507.00886"},"observation_digest":"sha256:3d3292afad3e55e946f5e11aefeddc590d848c97b71732bd895acf9def5b6c91","observation_id":"1b9bf275-139b-4dd7-94bb-40a60bd0d958","resolution":{"observed_at":"2026-08-06T21:11:41.543075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03878","last_updated":"2025-03-02T15:22:12Z","snapshot_observed_at":"2026-08-12T22:30:26.260801Z","submitted_at":"2024-10-04T19:22:20Z","title":"SPARTUN3D: Situated Spatial Understanding of 3D World in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03878","snapshot_observed_at":"2026-08-06T21:11:41.548733Z","title":"Spartun3d: Situated spatial understanding of 3d world in large language models.arXiv:2410.03878, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00886","last_updated":"2025-07-01T15:52:59Z","snapshot_observed_at":"2026-08-13T09:10:40.796129Z","submitted_at":"2025-07-01T15:52:59Z","title":"GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:41.548733Z"},"links":{"cited_paper":"/paper/2410.03878","citing_paper":"/paper/2507.00886"},"observation_digest":"sha256:50cb2a323acc25f336c056d075510e545de239cd3830dee2277bc9575a25deb6","observation_id":"9ce69592-f7d9-440f-84b4-907a3b850874","resolution":{"observed_at":"2026-08-06T21:11:41.548733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01292","last_updated":"2025-02-02T11:49:25Z","snapshot_observed_at":"2026-08-12T14:26:34.209331Z","submitted_at":"2024-12-02T09:07:57Z","title":"LSceneLLM: Enhancing Large 3D Scene Understanding Using Adaptive Visual Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.01292","snapshot_observed_at":"2026-08-06T21:11:41.554989Z","title":"Lscenellm: Enhancing large 3d scene understanding using adaptive visual preferences.arXiv:2412.01292, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00886","last_updated":"2025-07-01T15:52:59Z","snapshot_observed_at":"2026-08-13T09:10:40.796129Z","submitted_at":"2025-07-01T15:52:59Z","title":"GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:41.554989Z"},"links":{"cited_paper":"/paper/2412.01292","citing_paper":"/paper/2507.00886"},"observation_digest":"sha256:2e2e15763e8eadfdc9f5f686c811a06ca3e6452888ecada9823334ed3795de36","observation_id":"5587a349-bc45-4921-9800-e501f3c2a3f7","resolution":{"observed_at":"2026-08-06T21:11:41.554989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:41.804411Z","title":"3d-vista: Pre-trained transformer for 3d vision and text alignment","venue":null,"work_id":"bea3257a-3989-4db4-8575-1031ae7723b9","year":2023},"citing_paper":{"arxiv_id":"2507.00886","last_updated":"2025-07-01T15:52:59Z","snapshot_observed_at":"2026-08-13T09:10:40.796129Z","submitted_at":"2025-07-01T15:52:59Z","title":"GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:41.560840Z"},"links":{"citing_paper":"/paper/2507.00886"},"observation_digest":"sha256:b97c5f17b32c2b67a11d16855edf8c4dbf93f7364da412c29e80057f4b273e18","observation_id":"563e7a67-45a9-4d5b-ab49-1aafb27fae0f","resolution":{"observed_at":"2026-08-06T21:11:41.810640Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:41.776726Z","title":"How many","venue":null,"work_id":"50be3415-6b33-438c-b360-2ea1667760fc","year":2025},"citing_paper":{"arxiv_id":"2507.00886","last_updated":"2025-07-01T15:52:59Z","snapshot_observed_at":"2026-08-13T09:10:40.796129Z","submitted_at":"2025-07-01T15:52:59Z","title":"GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:41.568355Z"},"links":{"citing_paper":"/paper/2507.00886"},"observation_digest":"sha256:c0bf74691b8ca26db110d2dc83e3dc4abca1399a977f860ce9fe29cca0295d01","observation_id":"6640cf24-8cb2-4049-83d1-940a79869b70","resolution":{"observed_at":"2026-08-06T21:11:41.789956Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.00886","last_updated":"2025-07-01T15:52:59Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T09:10:40.796129Z","submitted_at":"2025-07-01T15:52:59Z","title":"GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond"},"reference_resolution":{"displayed":56,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":16,"verified_exact":0,"verified_fuzzy":40},"total_outbound_references":56},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 56 of 56 outbound references and 5 inbound Pith citation observations for arXiv:2507.00886."}