Pith. sign in

Paper Citation Record · LEDGER

GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond

As of 8 August 2026, this Paper Citation Record lists 56 of 56 outbound references and 5 inbound Pith citation observations for arXiv:2507.00886.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2507.00886 v1

Coverage vector

measured 56 of 56 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-06T21:11:41.568355Z

measured 61 of 61 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-08T06:32:00.761636+00:00

measured 5 of 5 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-06T10:49:46.879382Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-05-21T17:10:25.176606Z

Reference resolution

56 of 56 outbound references displayed

  • verified exact0
  • verified fuzzy40
  • unresolved16
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation dce48ee3-72fe-4174-bb03-8dda3ca37c9c · outbound

This paper cites an unresolved cited work.

GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond Unresolved cited work

Reference 1

Resolution
unresolved
raw_fallback, observed 2026-08-06T21:11:42.769747Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T21:11:41.213492Z digest=sha256:9be7ba017d4d976a849ee3f93e29f89652a54f5bf5f6a24d5864d3a02cd96b64

Observation 62b8e6e7-efdf-4bbd-b2c9-46f03abdc469 · outbound

This paper cites Spice: Semantic propositional image caption evaluation.

GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond Spice: Semantic propositional image caption evaluation

Reference 2

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:11:42.753837Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T21:11:41.219518Z digest=sha256:429f6ca43003dac586d24b94917522be704eac976755f81ea13c8660f5fb5572

Observation 7345b4a3-45b0-46f8-802c-2a20cb98c5c5 · outbound

This paper cites Scanqa: 3d question answering for spatial scene understanding.

GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond Scanqa: 3d question answering for spatial scene understanding

Reference 3

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:11:42.735195Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T21:11:41.225763Z digest=sha256:09ae5373572cdb9d6381d21a81b7369fa39a72a6f395073ad6c17470c3b47649

Observation 63977d52-5bb8-497e-af86-33f3fba9f4a6 · outbound

This paper cites Meteor: An automatic metric for mt evaluation with improved correlation with human judgments.

GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond Meteor: An automatic metric for mt evaluation with improved correlation with human judgments

Reference 4

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:11:42.717535Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T21:11:41.231148Z digest=sha256:09effe717c6bc69f1aa2047ae5a185629602351bf8539989e50b58ec486c8390

Observation fb36ee04-3b55-4ebc-a842-1b153aa26830 · outbound

This paper cites $\pi_0$: A Vision-Language-Action Flow Model for General Robot Control.

GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond $\pi_0$: A Vision-Language-Action Flow Model for General Robot Control

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-06T21:11:41.236634Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T21:11:41.236634Z digest=sha256:cecf050df532f55c6581c43f5d1fb1cd26f21a57b2c5cc1adf8d9205b1ca020b

Observation 13f21252-f815-425b-8616-7b3393f11190 · outbound

This paper cites Language models are few-shot learners.

GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond Language models are few-shot learners

Reference 6

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:11:42.697395Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T21:11:41.243336Z digest=sha256:1b4a99ce3120f9be37fe2ba3191f117cbbc325a010413f0b7cf61b4c42b2f5ae

Observation 938ebc67-bb16-43c6-92a2-f630aa023d6a · outbound

This paper cites Language models are few-shot learners.NeurIPS, 33, 2020.

GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond Language models are few-shot learners.NeurIPS, 33, 2020

Reference 7

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:11:42.679435Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T21:11:41.249674Z digest=sha256:cab6adcaef0c3b64bc49831143ff39fb6598fa19d2d4065884d7b8b79386925d

Observation 76d5bb44-0d64-418a-86bc-5c6d05a5182c · outbound

This paper cites Scanrefer: 3d object localization in rgb-d scans using natural language.ECCV, 2020.

GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond Scanrefer: 3d object localization in rgb-d scans using natural language.ECCV, 2020

Reference 8

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:11:42.659786Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T21:11:41.255992Z digest=sha256:a1e677c112edb261b08169d1838493ee59ace5445d90b8fdaa4170b90c6a3736

Observation 47304348-91cd-4ef2-a326-a47b8119f6e6 · outbound

This paper cites Ll3da: Visual interactive instruction tuning for omni-3d understanding reasoning and planning.

GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond Ll3da: Visual interactive instruction tuning for omni-3d understanding reasoning and planning

Reference 9

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:11:42.638447Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T21:11:41.261308Z digest=sha256:470957111625937771cbc3665c04f1104a53fd50c23cbcdc2d50c2fda36d7ae4

Observation fe9ce82c-b4e2-4712-89ae-142ba3d732c0 · outbound

This paper cites End-to-end 3d dense captioning with vote2cap-detr.

GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond End-to-end 3d dense captioning with vote2cap-detr

Reference 10

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:11:42.617962Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T21:11:41.267207Z digest=sha256:6c9738fcb2ce8132bcdf03e051969b6067e315b1e7dece50d1873016e609544a

Observation 5928badd-048a-4be5-bdec-2c371d8eddf5 · outbound

This paper cites Grounded 3D-LLM with Referent Tokens.

GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond Grounded 3D-LLM with Referent Tokens

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-06T21:11:41.273790Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T21:11:41.273790Z digest=sha256:6f8311de1afed63ceffa87be31d30b2e2852a0c5fad89bcef2a5b21ebd01d365

Observation ece94938-dc4b-4c4e-89b9-0e712b158100 · outbound

This paper cites Scan2cap: Context-aware dense captioning in rgb-d scans.

GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond Scan2cap: Context-aware dense captioning in rgb-d scans

Reference 12

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:11:42.597750Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T21:11:41.279380Z digest=sha256:6d2d6be33a52e07639d8d568bb096297e20b4ee6db73686939f1dee9d3909791

Observation 6f6573d0-446f-477c-b46b-aae6a6e9aad2 · outbound

This paper cites Vicuna: An open-source chatbot impressing gpt-4 with 90%* chatgpt quality.See https://vicuna.

GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond Vicuna: An open-source chatbot impressing gpt-4 with 90%* chatgpt quality.See https://vicuna

Reference 13

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:11:42.579173Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T21:11:41.285356Z digest=sha256:e3099827e46f293072ac509b435803901c06b6afe638fc5173a5f5c9432169ff

Observation 6b3e5da4-443a-404e-a6b8-04ed9476a780 · outbound

This paper cites Rouge: A package for automatic evaluation of summaries.

GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond Rouge: A package for automatic evaluation of summaries

Reference 14

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:11:42.561846Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T21:11:41.293538Z digest=sha256:3ac11ce2fb82cc887fdf572d72ba310404d406b439d96fc14a541bc652b5e171

Observation b5621d6d-b740-4be6-9474-c0eeb9c74ea0 · outbound

This paper cites Scannet: Richly-annotated 3d reconstructions of indoor scenes.

GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond Scannet: Richly-annotated 3d reconstructions of indoor scenes

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-06T21:11:41.299459Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T21:11:41.299459Z digest=sha256:38a763d3907879b612b11364a803961eba00ab76ba5206eab363fea1b0912031

Observation 1bc32700-92e8-43ff-8734-bd62b9a88cf2 · outbound

This paper cites Embodied question answering.

GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond Embodied question answering

Reference 16

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:11:42.532399Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T21:11:41.305870Z digest=sha256:095e34fa0c998a5b813fa76d6ae66426d4ea4120191fed1789103fdefc2b3890

Observation e07ac790-46a6-4e77-ac8e-1e736886849e · outbound

This paper cites SceneFun3D: Fine-Grained Functionality and Affordance Understanding in 3D Scenes.

GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond SceneFun3D: Fine-Grained Functionality and Affordance Understanding in 3D Scenes

Reference 17

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:11:42.510265Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T21:11:41.311181Z digest=sha256:3aadacb456ab71e4ee6210c1c9732a9e824ac22714cda1d27a9b8deba5309bb0

Observation ef2b0ee1-703c-4e38-9f4a-9f9b863e2498 · outbound

This paper cites Scene- llm: Extending language model for 3d visual reasoning.

GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond Scene- llm: Extending language model for 3d visual reasoning

Reference 18

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:11:42.491273Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T21:11:41.316170Z digest=sha256:b14b7ee058c351ffdcbd8445d8c1506079c8fab2d50c682cfa898924739ce754

Observation 9544d30b-4cbb-40ce-85a4-d77c5feccaa2 · outbound

This paper cites Perla: Perceptive 3d language assistant.

GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond Perla: Perceptive 3d language assistant

Reference 19

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:11:42.471471Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T21:11:41.320887Z digest=sha256:00d0313d97a1b620dd7552225a8a3864b9a77885a5dcad41b37317a3a7da246a

Observation 5c77d981-2f04-439c-bbce-603aafd41b13 · outbound

This paper cites 3d-llm: Injecting the 3d world into large language models.NeurIPS, 2023.

GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond 3d-llm: Injecting the 3d world into large language models.NeurIPS, 2023

Reference 20

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:11:42.312306Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T21:11:41.325975Z digest=sha256:a2cdd1df3adee7e748a8b9be546bc24a97c4d1d39e0e9ebaf6bb2cfb188814e1

Observation 630f55f1-fbec-4517-b1a3-fbe858d17414 · outbound

This paper cites Lora: Low-rank adaptation of large language models.ICLR, 1(2), 2022.

GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond Lora: Low-rank adaptation of large language models.ICLR, 1(2), 2022

Reference 21

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:11:42.292219Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T21:11:41.331246Z digest=sha256:ef1e59f597f88554cdad6943f723f7c8190fdafe761d1400194fabe69fa14181

Observation f23b6634-9732-42de-a357-9d2f251845f4 · outbound

This paper cites Chat-scene: Bridging 3d scene and large language models with object identifiers.

GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond Chat-scene: Bridging 3d scene and large language models with object identifiers

Reference 22

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:11:42.271592Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T21:11:41.336827Z digest=sha256:125fa8d7e89f08448dbef6765a3e812d88b91db730c8194944d1abf84d62e058

Observation fb659d84-9e73-4fad-92b7-a75ccb24b7e3 · outbound

This paper cites An embodied generalist agent in 3d world.

GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond An embodied generalist agent in 3d world

Reference 23

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:11:42.252342Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T21:11:41.343406Z digest=sha256:051916433e8644adcf33f869ca13e169f38b2502d7f8eb999332c6c497461336

Observation 1b6958b3-d123-4be1-855f-265e1d28ba07 · outbound

This paper cites Less is more: Clipbert for video-and-language learning via sparse sampling.

GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond Less is more: Clipbert for video-and-language learning via sparse sampling

Reference 24

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:11:42.233951Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T21:11:41.349918Z digest=sha256:db423817a6661fb9125512bee2cb7f7c696c9df72feca6b543923b70bc7ed8fa

Observation f6a37ab2-ae31-4632-97ba-2e40621a4375 · outbound

This paper cites Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models.

GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-06T21:11:41.359433Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T21:11:41.359433Z digest=sha256:717c12d3f65ff4b2c65f8031d436ff4913803f49bccc03ee9e6e4ed936809ca1

Observation bee4ddeb-8720-473d-b8a2-b0134860b0de · outbound

This paper cites M3dbench: Towards omni 3d assistant with interleaved multi-modal instructions.

GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond M3dbench: Towards omni 3d assistant with interleaved multi-modal instructions

Reference 26

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:11:42.201418Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T21:11:41.366259Z digest=sha256:0ae0d6ee935802cf090ea9821b7ab51a48af117b89e5f2092f28b448093d0efb

Observation cab475ff-1491-4357-bb41-e7d10d80fc1a · outbound

This paper cites SceneSplat: Gaussian Splatting-based Scene Understanding with Vision-Language Pretraining.

GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond SceneSplat: Gaussian Splatting-based Scene Understanding with Vision-Language Pretraining

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-06T21:11:41.372451Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T21:11:41.372451Z digest=sha256:2f195d1858ad54864d19ed4a2ef7067a1fdf1639e4abcfe99f61a8aefa4ad08b

Observation ede946ef-01c0-4c02-b54a-5fb3e29f890a · outbound

This paper cites Visual instruction tuning.

GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond Visual instruction tuning

Reference 28

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:11:42.180884Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T21:11:41.378323Z digest=sha256:e4cfde2c978e07a29ebf682dbab4f045c4cef4c36326eef130691fb23b0b356a

Observation 724f85b0-b6d3-4c1f-9cc7-f69445974593 · outbound

This paper cites Robomp 2: A robotic multimodal perception-planning framework with mutlimodal large language models.

GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond Robomp 2: A robotic multimodal perception-planning framework with mutlimodal large language models

Reference 29

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:11:42.162291Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T21:11:41.383839Z digest=sha256:97f81289a6bdfad09c3fe4bba6aa85543d21eee641e6254deb0e7df0ac3bbab0

Observation 5066d224-b78d-4b15-b019-0b5bee7fc1f6 · outbound

This paper cites Sqa3d: Situated question answering in 3d scenes.

GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond Sqa3d: Situated question answering in 3d scenes

Reference 30

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:11:42.144252Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T21:11:41.394318Z digest=sha256:2880997ab51caf94eac4563eb04a29935bd599816e2919e5386f733ee3e10116

Observation e5e51994-6877-48f5-9e18-e05552774e67 · outbound

This paper cites Situational awareness matters in 3d vision language reasoning.

GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond Situational awareness matters in 3d vision language reasoning

Reference 31

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:11:42.124429Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T21:11:41.402260Z digest=sha256:29e5d15cf97189ede4140bbd32e41ab79c7f6c009b56ffe9eadb2201cf6a2e87

Observation fc7af682-c423-4ae7-a067-232cceb64d2e · outbound

This paper cites Bleu: a method for automatic evaluation of machine translation.

GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond Bleu: a method for automatic evaluation of machine translation

Reference 32

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:11:42.107208Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T21:11:41.408755Z digest=sha256:6fadf6ce30321afccb6e93e22a69db458e314c7f868383c3d0b57d4fa9bb7cc7

Observation 520415f3-da78-419e-afde-e6821d753227 · outbound

This paper cites Openscene: 3d scene understanding with open vocabularies.

GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond Openscene: 3d scene understanding with open vocabularies

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-06T21:11:41.414354Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T21:11:41.414354Z digest=sha256:42a95d38303242b41d422ac11859d8e227aa25176e277ee070b4bbf705b754e9

Observation f9a149be-8300-4397-ae53-08ed8e1386ce · outbound

This paper cites Learning transferable visual models from natural language supervision.

GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond Learning transferable visual models from natural language supervision

Reference 34

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:11:42.078273Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T21:11:41.419457Z digest=sha256:f7c8541edc55ed4867ae6fcce0196148c6451680b4025baf157e5c48f6fb9d09

Observation 438b0917-0e25-42a8-a935-22ef8c85c414 · outbound

This paper cites Exploring the limits of transfer learning with a unified text-to-text transformer.Journal of Machine Learning Research, 21(140), 2020.

GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond Exploring the limits of transfer learning with a unified text-to-text transformer.Journal of Machine Learning Research, 21(140), 2020

Reference 35

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:11:42.061024Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T21:11:41.424588Z digest=sha256:ea1c836b7ed1a3c5b6e7a1d748592bad19eddfdff9aa483052359535408d3d54

Observation 71fa2693-091e-4163-bbe7-59e4e9eef479 · outbound

This paper cites Sayplan: Grounding large language models using 3d scene graphs for scalable task planning.

GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond Sayplan: Grounding large language models using 3d scene graphs for scalable task planning

Reference 36

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:11:42.045045Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T21:11:41.429612Z digest=sha256:7a04947cc0fb3812fb3cc57125742838ad798e73efd69c2a90a5257acc6e4d95

Observation ca57a215-ab1f-4e44-a3a3-87d767deba3f · outbound

This paper cites Sentence-BERT: Sentence embed- dings using Siamese BERT-networks.

GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond Sentence-BERT: Sentence embed- dings using Siamese BERT-networks

Reference 37

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:11:42.028525Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T21:11:41.435332Z digest=sha256:ca01293a8acee7b6b72e209a0c31bbca6e70b339d80d73d6e1d8fa185bcdc6f5

Observation ef392936-ef1a-48bd-9d4f-ae7f2987b106 · outbound

This paper cites Structure-from- motion revisited.

GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond Structure-from- motion revisited

Reference 38

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:11:42.010366Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T21:11:41.441959Z digest=sha256:c1a33d2c9cdf4bd8f6aa060d3a427fb3b933e64ca9d345c040d9c7f7e90e3b64

Observation fc9d63c4-4a88-49e3-b8be-6d0aec5795b4 · outbound

This paper cites Pixelwise view selection for unstructured multi-view stereo.

GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond Pixelwise view selection for unstructured multi-view stereo

Reference 39

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:11:41.990655Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T21:11:41.447545Z digest=sha256:0e17ccab9b6d0280d684a369714db54e93f70969b2e857bbaddeb7cb340b4b03

Observation ad03dfc2-3f01-4d59-9498-a50e8c5933ee · outbound

This paper cites Splat-mover: Multi-stage, open-vocabulary robotic manipulation via editable gaussian splatting.

GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond Splat-mover: Multi-stage, open-vocabulary robotic manipulation via editable gaussian splatting

Reference 40

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:11:41.972997Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T21:11:41.455862Z digest=sha256:7a793b7994328fc984354b458e4df10d495e780aa12f4389d7630db5f717c428

Observation 8e019016-dff5-43f2-97e2-b140d1b7666e · outbound

This paper cites Habitat 2.0: Training home assistants to rearrange their habitat.

GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond Habitat 2.0: Training home assistants to rearrange their habitat

Reference 41

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:11:41.953780Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T21:11:41.463816Z digest=sha256:ab48953efecce0d9b1f6f42fcc0badc2451552ec8a3ad00a4a1c59fa68cc9177

Observation 6dfa22b6-948a-417c-830f-1e1ad4564e8c · outbound

This paper cites Llama 2: Open Foundation and Fine-Tuned Chat Models.

GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond Llama 2: Open Foundation and Fine-Tuned Chat Models

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-06T21:11:41.471296Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T21:11:41.471296Z digest=sha256:7ac5dbbe7247bc0b5765c5bc0f8b49ebc31de08f37ef0cd572411a828606a344

Observation a2a34dc7-ff9e-4ee3-990d-5e24b3f707a1 · outbound

This paper cites SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features.

GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-06T21:11:41.478020Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T21:11:41.478020Z digest=sha256:5146e7b73cce4b8d7a8b5dc5f5374afe23305c596a03dd3238b3964df38742ee

Observation eb9e799b-df73-4312-b8f3-a83af7481982 · outbound

This paper cites Cider: Consensus-based image description evaluation.

GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond Cider: Consensus-based image description evaluation

Reference 44

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:11:41.935715Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T21:11:41.485329Z digest=sha256:8298be7c7c86dfbe1124e3fe64a0180c26c91a3e71cb124ad4f926637ef22efc

Observation d2f5a8ba-a8e4-4895-8388-3b4f1e16a624 · outbound

This paper cites Chat-3d: Data-efficiently tuning large language model for universal dialogue of 3d scenes, 2023.

GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond Chat-3d: Data-efficiently tuning large language model for universal dialogue of 3d scenes, 2023

Reference 45

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:11:41.916290Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T21:11:41.495612Z digest=sha256:b3adccce8b7915626e6145962cfa5e894fd98e6479d5e1769ac2732b64484755

Observation 7467322e-e05c-4dc6-8602-88dd22716ae1 · outbound

This paper cites Embodied question answering in photorealistic environments with point cloud perception.

GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond Embodied question answering in photorealistic environments with point cloud perception

Reference 46

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:11:41.894413Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T21:11:41.502387Z digest=sha256:a47f8195fb55355c2d83fe03d6c874d990c17c4ea3995d484cb5acd252e50f12

Observation 5821b62b-36f7-475b-a2c8-8f516a4957ac · outbound

This paper cites Tidybot: Personalized robot assistance with large language models.

GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond Tidybot: Personalized robot assistance with large language models

Reference 47

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:11:41.875390Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T21:11:41.509927Z digest=sha256:39229b342c7830afa87db9871dc191b0a57716f1b0188cddfde41fa4269dccc1

Observation 082210d5-5156-446f-846e-b2e69e8d03a2 · outbound

This paper cites 3D Vision and Language Pretraining with Large-Scale Synthetic Data.

GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond 3D Vision and Language Pretraining with Large-Scale Synthetic Data

Reference 48

Resolution
unresolved
no resolver link, observed 2026-08-06T21:11:41.518057Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T21:11:41.518057Z digest=sha256:11aefe1080a20daee46aefab33e23d12b21ce6189c9cdd0552c90e5d2e98bb06

Observation 9b9e34a3-bae8-453e-8ca3-30f12c17e50b · outbound

This paper cites Scannet++: A high-fidelity dataset of 3d indoor scenes.

GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond Scannet++: A high-fidelity dataset of 3d indoor scenes

Reference 49

Resolution
unresolved
no resolver link, observed 2026-08-06T21:11:41.524888Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T21:11:41.524888Z digest=sha256:71ee24a3725b7b686cffb827f5f74c599efe22d83f46f26f5e2ded776df2f82b

Observation 7d7b2030-b090-4bd6-9119-af0a1bebda9f · outbound

This paper cites Deep modular co-attention networks for visual question answering.

GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond Deep modular co-attention networks for visual question answering

Reference 50

Resolution
unresolved
no resolver link, observed 2026-08-06T21:11:41.530797Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T21:11:41.530797Z digest=sha256:643000f74352ef53c0fd4959b2c9597ac1b1044f9abdf58131ec21bc95780ba5

Observation 392a3eda-69b0-437a-934f-f03aabed6c19 · outbound

This paper cites Sigmoid loss for language image pre-training.

GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond Sigmoid loss for language image pre-training

Reference 51

Resolution
unresolved
no resolver link, observed 2026-08-06T21:11:41.536825Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T21:11:41.536825Z digest=sha256:b69f5b0ff23cdd10fb0ce51a4d7707b34f6b312dfc3b386681a27b899890cc49

Observation 1b9bf275-139b-4dd7-94bb-40a60bd0d958 · outbound

This paper cites OPT: Open Pre-trained Transformer Language Models.

GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond OPT: Open Pre-trained Transformer Language Models

Reference 52

Resolution
unresolved
no resolver link, observed 2026-08-06T21:11:41.543075Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T21:11:41.543075Z digest=sha256:60786fe3d34d784f9db44f5a5356f807eb96e9bc6059bea279a987eae1511e00

Observation 9ce69592-f7d9-440f-84b4-907a3b850874 · outbound

This paper cites SPARTUN3D: Situated Spatial Understanding of 3D World in Large Language Models.

GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond SPARTUN3D: Situated Spatial Understanding of 3D World in Large Language Models

Reference 53

Resolution
unresolved
no resolver link, observed 2026-08-06T21:11:41.548733Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T21:11:41.548733Z digest=sha256:1b513bbaf795d10abb68654e0fcd30fdd0a68068f3f154f0c4612cb7658c8d8e

Observation 5587a349-bc45-4921-9800-e501f3c2a3f7 · outbound

This paper cites LSceneLLM: Enhancing Large 3D Scene Understanding Using Adaptive Visual Preferences.

GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond LSceneLLM: Enhancing Large 3D Scene Understanding Using Adaptive Visual Preferences

Reference 54

Resolution
unresolved
no resolver link, observed 2026-08-06T21:11:41.554989Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T21:11:41.554989Z digest=sha256:6e8c61b4ca2132dfb4f44880c9771ecee1367a3cb6419973a5cb93d95bebc132

Observation 563e7a67-45a9-4d5b-ab49-1aafb27fae0f · outbound

This paper cites 3d-vista: Pre-trained transformer for 3d vision and text alignment.

GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond 3d-vista: Pre-trained transformer for 3d vision and text alignment

Reference 55

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:11:41.810640Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T21:11:41.560840Z digest=sha256:b4ac82e6c557827928abc2c39b7109e7dbb493e83f654f846f2cf514e6476ab0

Observation 6640cf24-8cb2-4049-83d1-940a79869b70 · outbound

This paper cites How many.

GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond How many

Reference 56

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T21:11:41.789956Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T21:11:41.568355Z digest=sha256:4b7c876b4afeed84f1757539cff993abcf520be58d87b58f8fef35c684c9c1eb

Pith citing papers

Observation 7e82155e-5898-499c-9fd8-871245e418e0 · inbound

3D-R1: Enhancing Reasoning in 3D VLMs for Unified Scene Understanding cites this paper.

3D-R1: Enhancing Reasoning in 3D VLMs for Unified Scene Understanding GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-06T10:49:46.879382Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T10:49:46.879382Z digest=sha256:ea23c3b478d37f6a47075c4f3edc546d54ac410261a7db4590cb367daab6c015

Observation 941fcaf6-8663-445f-965e-9853f84b77fd · inbound

Nav-R1: Reasoning and Navigation in Embodied Scenes cites this paper.

Nav-R1: Reasoning and Navigation in Embodied Scenes GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-04T17:31:39.119379Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T17:31:39.119379Z digest=sha256:5e4dd23ea4bf7e2325dc7bb6cc31ec798811d242b17f4f7ea5f6b69e40bfb93c

Observation f079f03d-4b14-4c66-bf24-7bbb12e19578 · inbound

Chorus: Multi-Teacher Pretraining for Holistic 3D Gaussian Scene Encoding cites this paper.

Chorus: Multi-Teacher Pretraining for Holistic 3D Gaussian Scene Encoding GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond

Reference 14

Resolution
verified exact
arxiv_id, observed 2026-05-16T20:38:24.856606Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-05-16T20:34:16.666956Z digest=sha256:51b3dfc90198d1c88c4798c512d98a2cbaf63e2a2c3f3064b143e0f0a556eaa1

Observation 86b7e462-9ced-4beb-bd69-2583450238f1 · inbound

GaussianDWM: 3D Gaussian Driving World Model for Unified Scene Understanding and Multi-Modal Generation cites this paper.

GaussianDWM: 3D Gaussian Driving World Model for Unified Scene Understanding and Multi-Modal Generation GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond

Reference 21

Resolution
verified exact
arxiv_id, observed 2026-05-21T17:10:25.178774Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-05-21T17:06:34.398973Z digest=sha256:510181dd2ca1984bbb85a5d773a62bf3e016819f8b08a4964a3f1b670e96187b

Observation 869fa4ab-31e3-4435-aeb5-d27c8362e560 · inbound

Motion-Enabled Tomography via Gaussian Mixture Models cites this paper.

Motion-Enabled Tomography via Gaussian Mixture Models GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond

Reference 61

Resolution
metadata mismatch
arxiv_id, observed 2026-05-20T00:22:53.727881Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-05-20T00:22:19.543573Z digest=sha256:37ea9f825159963672602dfb612501d3efa874947176b77170beb1c7283436ea