Pith. sign in

Paper Citation Record · LEDGER

LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion

As of 7 August 2026, this Paper Citation Record lists 54 of 54 outbound references and 3 inbound Pith citation observations for arXiv:2507.02813.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2507.02813 v1

Coverage vector

measured 54 of 54 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-06T20:26:10.731298Z

measured 57 of 57 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-07T06:34:17.273281+00:00

measured 3 of 3 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-05-16T20:46:04.875912Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-05-16T20:48:32.619134Z

Reference resolution

54 of 54 outbound references displayed

  • verified exact2
  • verified fuzzy20
  • unresolved32
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 2ba00fcf-dc2a-4cd3-8009-2215fac3b0ab · outbound

This paper cites SegDiff: Image Segmentation with Diffusion Probabilistic Models.

LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion SegDiff: Image Segmentation with Diffusion Probabilistic Models

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-06T20:26:10.485250Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T20:26:10.485250Z digest=sha256:0872dde6452ccb62e3b9bfd3a6577a6dfe726ae9f11bff244b34db75092a2171

Observation 8c24e836-1846-4fb5-84ca-e273ff01f671 · outbound

This paper cites Scanqa: 3d question answering for spatial scene understanding.

LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion Scanqa: 3d question answering for spatial scene understanding

Reference 2

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T20:26:11.575492Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T20:26:10.490698Z digest=sha256:140461affcec6c469f61c29b3c26eda858d3678529524de87aa4c1aa7717f227

Observation ab5176a5-be07-4a85-a416-cb99f9d3e077 · outbound

This paper cites VD3D: Taming Large Video Diffusion Transformers for 3D Camera Control.

LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion VD3D: Taming Large Video Diffusion Transformers for 3D Camera Control

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-06T20:26:10.495325Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T20:26:10.495325Z digest=sha256:2b295e96f64a2d620a866b77026efe5a71b91ed33025911bcd2376a77604328b

Observation 702b9339-e220-486b-9577-73612a2e86c9 · outbound

This paper cites pixelsplat: 3d gaussian splats from image pairs for scalable generalizable 3d reconstruction.

LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion pixelsplat: 3d gaussian splats from image pairs for scalable generalizable 3d reconstruction

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-06T20:26:10.501075Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T20:26:10.501075Z digest=sha256:20a2ef2b0903f8d12f763c5629f9c007944696174ff94c37a83b204cb35b0b6c

Observation 560d5a49-c128-455e-b2d4-bb520d2f5bf8 · outbound

This paper cites PGSR: Planar-based Gaussian Splatting for Efficient and High-Fidelity Surface Reconstruction.

LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion PGSR: Planar-based Gaussian Splatting for Efficient and High-Fidelity Surface Reconstruction

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-06T20:26:10.505304Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T20:26:10.505304Z digest=sha256:124ae29809188776e878f89f1bc2c42739b390c91da7b48086580fa322db404c

Observation a1093ef5-d166-45b6-ab6d-b7bd09acf525 · outbound

This paper cites Mvsplat: Efficient 3d gaussian splatting from sparse multi-view images.

LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion Mvsplat: Efficient 3d gaussian splatting from sparse multi-view images

Reference 6

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T20:26:11.552600Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T20:26:10.510017Z digest=sha256:1118040f2b51de99aecb00f13c0fa2135d8ba5e64c731d7e6435c814228d1871

Observation 00bee198-6472-4cdc-8804-20acb66a67ec · outbound

This paper cites Scannet: Richly-annotated 3d reconstructions of indoor scenes.

LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion Scannet: Richly-annotated 3d reconstructions of indoor scenes

Reference 7

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T20:26:11.539853Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T20:26:10.514928Z digest=sha256:94e6cf53bd50c2788c4f706aca6e840bb9aad47e978cf8d83ed42b4fb39ed578

Observation a671133e-0400-477a-9b4d-37640493ebab · outbound

This paper cites Large spatial model: End-to-end unposed images to semantic 3d.

LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion Large spatial model: End-to-end unposed images to semantic 3d

Reference 8

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T20:26:11.527302Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T20:26:10.519495Z digest=sha256:7b39070df292d975528238ad9c32f4046e2539de6f5cf4ed5dc3dbb813e225dd

Observation 4edcbdc5-3c37-4e1b-9211-3ea833820311 · outbound

This paper cites Random sample consensus: a paradigm for model fitting with applications to image analy- sis and automated cartography.

LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion Random sample consensus: a paradigm for model fitting with applications to image analy- sis and automated cartography

Reference 9

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T20:26:11.514724Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T20:26:10.523577Z digest=sha256:8edd0914f7f999407f856d1c5514d7baeca25a535aee3028576b342901eb5007

Observation 99e68be3-4479-4fa2-b0f3-8cf68ea5c5c5 · outbound

This paper cites Iqa: Visual question answering in interactive environments.

LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion Iqa: Visual question answering in interactive environments

Reference 10

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T20:26:11.502255Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T20:26:10.527780Z digest=sha256:b36b9e67955fb0bc0195774936c08f1c2aed0dad3d22ef303cab6b33e6311bc1

Observation d5701d34-484b-4d2e-bc23-6139032ad08f · outbound

This paper cites Sugar: Surface- aligned gaussian splatting for efficient 3d mesh reconstruc- tion and high-quality mesh rendering.

LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion Sugar: Surface- aligned gaussian splatting for efficient 3d mesh reconstruc- tion and high-quality mesh rendering

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-06T20:26:10.532027Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T20:26:10.532027Z digest=sha256:1522c7926525772fdbc0911ed746960326385529b0e62f66bc5f3a812402d0c1

Observation 6c7397a1-a266-480a-a4cf-7f81a2c3d63b · outbound

This paper cites CameraCtrl: Enabling Camera Control for Text-to-Video Generation.

LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion CameraCtrl: Enabling Camera Control for Text-to-Video Generation

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-06T20:26:10.536003Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T20:26:10.536003Z digest=sha256:53fd2915d103467a6b8d4bb3348dfe361ec018a90a6b434b435e68c49c82a403

Observation ad221c26-2cd7-4a69-af52-afbb14e32f37 · outbound

This paper cites SparseLGS: Sparse View Language Embedded Gaussian Splatting.

LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion SparseLGS: Sparse View Language Embedded Gaussian Splatting

Reference 13

Resolution
verified exact
local_arxiv, observed 2026-08-06T20:26:11.119535Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T20:26:10.540584Z digest=sha256:829bbacee1f6e903e357317001ddf0f8012fa2349aec6cbd956c7944057639c5

Observation d6dcd6a3-1953-4a52-870d-1c6e7b2fb79a · outbound

This paper cites DepthCrafter: Generating Consistent Long Depth Sequences for Open-world Videos.

LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion DepthCrafter: Generating Consistent Long Depth Sequences for Open-world Videos

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-06T20:26:10.545095Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T20:26:10.545095Z digest=sha256:a4cf65b48f4e77998b034e8151897182fb1f2470c0ffe8c953020037a973e8e3

Observation 650467ba-9673-4bbf-9730-1b30551f9038 · outbound

This paper cites 3d gaussian splatting for real-time radiance field rendering.

LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion 3d gaussian splatting for real-time radiance field rendering

Reference 15

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T20:26:11.480640Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T20:26:10.549768Z digest=sha256:30151d2ca6f16f0f321c04459344d93e151a7a9a06d1992ffebfb0a2cfa303ff

Observation 95fe322b-823b-4bb5-b9c7-e4940a7ca05d · outbound

This paper cites Lerf: Language embedded radiance fields.

LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion Lerf: Language embedded radiance fields

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-06T20:26:10.558642Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T20:26:10.558642Z digest=sha256:a8a596684d60528e2512dbe7461229bd76ef8fe6f9bd25f056be334ba8d91441

Observation 33c246f3-1211-4ce6-9869-f0a9a28e170f · outbound

This paper cites Segment Anything.

LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion Segment Anything

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-06T20:26:10.562955Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T20:26:10.562955Z digest=sha256:5c267734c0875d71a3cfd02f31f3f3f97aab053163870f4c199d495d93fbf9f5

Observation aefb78a9-159c-4af5-89af-c8c4943bbe05 · outbound

This paper cites Language-driven semantic seg- mentation.

LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion Language-driven semantic seg- mentation

Reference 19

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T20:26:11.458186Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T20:26:10.567968Z digest=sha256:5ac6360be3a2a79d6ff8dece2c023a7897806b29f3509ded956c29e85e947d64

Observation bdc9fe5c-b17d-4264-98e1-3db0c15f292f · outbound

This paper cites Langsurf: Language-embedded surface gaussians for 3d scene under- standing.

LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion Langsurf: Language-embedded surface gaussians for 3d scene under- standing

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-06T20:26:10.572250Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T20:26:10.572250Z digest=sha256:d9bb728e4dc7e01d15c1673273872a189dc029749acce70cb8eb298ed3912dc6

Observation 4657ebb9-27b7-49b0-8764-a76531c8dce3 · outbound

This paper cites Gp- nerf: Generalized perception nerf for context-aware 3d scene understanding.

LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion Gp- nerf: Generalized perception nerf for context-aware 3d scene understanding

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-06T20:26:10.576980Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T20:26:10.576980Z digest=sha256:ec762c0c02b45406cfa5f487e855ff456562f020b92eb3b385e95c83abc5c8da

Observation ffe2ab00-0a5b-4b7d-89c1-9c7a8328c928 · outbound

This paper cites Dngaussian: Optimizing sparse-view 3d gaussian radiance fields with global-local depth normaliza- tion.

LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion Dngaussian: Optimizing sparse-view 3d gaussian radiance fields with global-local depth normaliza- tion

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-06T20:26:10.581135Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T20:26:10.581135Z digest=sha256:6755cf54ee39e09b79bc361657653e73debd7df7162f5bc5a8a9d115ba94fac9

Observation 879e0617-5f42-41ab-a3df-1c48a85518ca · outbound

This paper cites Microsoft coco: Common objects in context.

LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion Microsoft coco: Common objects in context

Reference 23

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T20:26:11.419116Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T20:26:10.585876Z digest=sha256:d6df4ee4b0fee9c7520d0ac1dd2757190ff6c831afbe4d11a83e11df9a6f9088

Observation 3aa9618f-d615-4f13-9ec7-1f27fad952a8 · outbound

This paper cites Infinite na- ture: Perpetual view generation of natural scenes from a sin- gle image.

LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion Infinite na- ture: Perpetual view generation of natural scenes from a sin- gle image

Reference 24

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T20:26:11.392621Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T20:26:10.590058Z digest=sha256:cc257aa2e79f502f8a30af80d9119f17718e73181e0d7dac5c069730b4bc2e8a

Observation 9a7b4c84-e442-446c-937a-e10205ac8651 · outbound

This paper cites Semantic ray: Learning a generalizable semantic field with cross-reprojection attention.

LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion Semantic ray: Learning a generalizable semantic field with cross-reprojection attention

Reference 25

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T20:26:11.377059Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T20:26:10.594803Z digest=sha256:160763961cba8e6b3cdfac9778ecd40970fcb213d2ced551a0b48e7a16476f52

Observation f5734084-3444-42ef-a038-169e0f07a17a · outbound

This paper cites ReconX: Reconstruct Any Scene from Sparse Views with Video Diffusion Model.

LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion ReconX: Reconstruct Any Scene from Sparse Views with Video Diffusion Model

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-06T20:26:10.599197Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T20:26:10.599197Z digest=sha256:59886965beeb69b9c8a753756885e5fa00995259f63c390ddf2d62bf1a67fc1f

Observation 202a909a-fdc0-40ba-a51c-9957341dc664 · outbound

This paper cites Make-your-3d: Fast and consistent subject- driven 3d content generation.

LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion Make-your-3d: Fast and consistent subject- driven 3d content generation

Reference 27

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T20:26:11.362417Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T20:26:10.603721Z digest=sha256:8ee6a50c040705426eee5a271b359e7a8c2930f5e0e5df494528eadb44502796

Observation ae15fd43-e018-46a2-841f-f31d3c2af895 · outbound

This paper cites Physics3D: Learning Physical Properties of 3D Gaussians via Video Diffusion.

LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion Physics3D: Learning Physical Properties of 3D Gaussians via Video Diffusion

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-06T20:26:10.607650Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T20:26:10.607650Z digest=sha256:5c37c9728a4c103dbbe3b8b57e205c839be02e17f98a711d98c9e310acfa693d

Observation 20d2d07c-0fc2-477e-a6d9-8d80c82c699b · outbound

This paper cites Decoupled Weight Decay Regularization.

LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion Decoupled Weight Decay Regularization

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-06T20:26:10.612591Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T20:26:10.612591Z digest=sha256:a691bd32cdb287cf0de1a028c000d39a6bb11c34360af97961b98efc92a23f32

Observation 9a74b982-b103-410b-b1e7-7b8783a0203b · outbound

This paper cites Gaussian splatting slam.

LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion Gaussian splatting slam

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-06T20:26:10.617454Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T20:26:10.617454Z digest=sha256:266e80b963a5827b38fe284072855bd0443494d344e61e8600edd6ab98c4b0d1

Observation 6bbe1d33-99a9-4dfc-93e5-f9499cd9f715 · outbound

This paper cites Nerf: Representing scenes as neural radiance fields for view syn- thesis.

LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion Nerf: Representing scenes as neural radiance fields for view syn- thesis

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-06T20:26:10.621535Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T20:26:10.621535Z digest=sha256:aca6906f65c7e23c01d793925126cd5514c360dd521637c4cf612618706932f1

Observation 7f6d95e9-1898-482a-9dee-928897084797 · outbound

This paper cites Sift: Predicting amino acid changes that affect protein function.

LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion Sift: Predicting amino acid changes that affect protein function

Reference 32

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T20:26:11.331927Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T20:26:10.625528Z digest=sha256:e8cfd8a30d9c21feae08a6e8821692af8bed87838c64cc6f161fd99192379b4f

Observation 78a107e8-d47d-47ee-a835-ae292b11209d · outbound

This paper cites Scalable diffusion models with transformers.

LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion Scalable diffusion models with transformers

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-06T20:26:10.629501Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T20:26:10.629501Z digest=sha256:f88fff0da18974c45479c6c5b1a093ac318af068a6aa089414c15505bbc328ea

Observation 3d0c6447-2761-402d-8cf9-50107ee7c3bd · outbound

This paper cites Langsplat: 3d language gaussian splatting.

LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion Langsplat: 3d language gaussian splatting

Reference 34

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T20:26:11.309471Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T20:26:10.634390Z digest=sha256:518f48ea55aa75dd53e9a4dad5ea28cd6728042b73913a9ff1bdcb1671b8c2b5

Observation 8d0f8964-70a6-430c-b7bc-df4414790a17 · outbound

This paper cites Ramesh, Gabriel Goh, Sandhini Agarwal, Girish Sastry, Amanda Askell, Pamela Mishkin, Jack Clark, Gretchen Krueger, and Ilya Sutskever.

LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion Ramesh, Gabriel Goh, Sandhini Agarwal, Girish Sastry, Amanda Askell, Pamela Mishkin, Jack Clark, Gretchen Krueger, and Ilya Sutskever

Reference 35

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T20:26:11.295710Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T20:26:10.638836Z digest=sha256:8071fd82ea7261f849315d3107bb62bf0009ebdb539713c64291883c2a162e7f

Observation 0c0b20d5-7a6e-4237-861a-da58180303a0 · outbound

This paper cites Language embedded radiance fields for zero-shot task-oriented grasping.

LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion Language embedded radiance fields for zero-shot task-oriented grasping

Reference 36

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T20:26:11.281973Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T20:26:10.643064Z digest=sha256:fa73262333a9e685fb34f4b26478288d198b40c7bc770b5a169bee2aa6a53844

Observation 16d2046e-4f69-404c-a0a1-268129f03364 · outbound

This paper cites SAM 2: Segment Anything in Images and Videos.

LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion SAM 2: Segment Anything in Images and Videos

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-06T20:26:10.647263Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T20:26:10.647263Z digest=sha256:c5ed06cc8b36af17a47cf0e8a8bb84cc9f6edf0fff37fa939e6f522af9814453

Observation 4cfc5efb-48f3-449b-8c94-83085e319eb2 · outbound

This paper cites Scaling Properties of Diffusion Models for Perceptual Tasks.

LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion Scaling Properties of Diffusion Models for Perceptual Tasks

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-06T20:26:10.651525Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T20:26:10.651525Z digest=sha256:eaaefcd1d5a7df7c2a3b1e47704389972a3862dad638f32cbf6a9a5a5ac98d61

Observation 4015ad1e-4e98-430a-806e-28a7774615e2 · outbound

This paper cites Robustness of Segment Anything Model (SAM) for Autonomous Driving in Adverse Weather Conditions.

LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion Robustness of Segment Anything Model (SAM) for Autonomous Driving in Adverse Weather Conditions

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-06T20:26:10.655782Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T20:26:10.655782Z digest=sha256:fa09dfc0e3ac7efa3a6de304be8f39d08d8d91fb3338e1e41af6a604a9b02568

Observation f796409e-3e49-47f6-be21-de314265e29b · outbound

This paper cites Learning Temporally Consistent Video Depth from Video Diffusion Priors.

LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion Learning Temporally Consistent Video Depth from Video Diffusion Priors

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-06T20:26:10.660772Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T20:26:10.660772Z digest=sha256:2ee47aaeb1b43de4ee20189758c872c574da329e59eb6a8f4f85f2dd532c91b2

Observation 2391828b-e872-4545-a342-40bad334e217 · outbound

This paper cites DimensionX: Create Any 3D and 4D Scenes from a Single Image with Controllable Video Diffusion.

LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion DimensionX: Create Any 3D and 4D Scenes from a Single Image with Controllable Video Diffusion

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-06T20:26:10.665816Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T20:26:10.665816Z digest=sha256:495af9430154cbd6db591c27080a84845945c657477be45c6653d54758760731

Observation 506ce214-9099-474b-a186-76021252fe87 · outbound

This paper cites Neural discrete representation learning.

LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion Neural discrete representation learning

Reference 42

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T20:26:11.267870Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T20:26:10.670213Z digest=sha256:c950886b31471fcba9529c5e5bbc0841e4f7de4dd55550520376f65e9e4bddd6

Observation edc2e6db-53b6-4c67-b1ca-9cefc1ca3aff · outbound

This paper cites Attention is all you need.

LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion Attention is all you need

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-06T20:26:10.675125Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T20:26:10.675125Z digest=sha256:cb3fabe33a66765fa72d9284c2f4e8f6f2d45c30f3dc722c272845a57aa81596

Observation 5e2f1175-642d-41fd-b604-eddf3f3fd8b7 · outbound

This paper cites Sv3d: Novel multi-view syn- thesis and 3d generation from a single image using latent video diffusion.

LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion Sv3d: Novel multi-view syn- thesis and 3d generation from a single image using latent video diffusion

Reference 44

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T20:26:11.245962Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T20:26:10.679594Z digest=sha256:d9b8eb76b51e59ea43ff50333eddbebc94e44d5bccf0af803d0e204514044a90

Observation ea0e8247-a121-4b00-9931-562c30aca80b · outbound

This paper cites Dust3r: Geometric 3d vi- sion made easy.

LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion Dust3r: Geometric 3d vi- sion made easy

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-06T20:26:10.683800Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T20:26:10.683800Z digest=sha256:f9949fb51ae0de93a9c6502cc9773cba347fb0be2c012a9d1f49b6300356fd27

Observation 335c0d32-a83a-4248-b557-f0cc46b319fa · outbound

This paper cites OpenGaussian: Towards Point-Level 3D Gaussian-based Open Vocabulary Understanding.

LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion OpenGaussian: Towards Point-Level 3D Gaussian-based Open Vocabulary Understanding

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-06T20:26:10.687969Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T20:26:10.687969Z digest=sha256:08bd6d132b3e5e75712aa62ac5967ffcae67cb21b2709720dac4ab88795c854c

Observation 6988754d-8987-4e89-955e-4b2325ccbca4 · outbound

This paper cites Dynamicrafter: Animating open-domain images with video diffusion priors.

LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion Dynamicrafter: Animating open-domain images with video diffusion priors

Reference 47

Resolution
unresolved
no resolver link, observed 2026-08-06T20:26:10.692552Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T20:26:10.692552Z digest=sha256:ac86cb57f8e0990b59b383d3e92df78adb6982afc67395d0c92247a918dc6a1e

Observation 3661aea2-e974-441a-aff4-5e9992b1aff9 · outbound

This paper cites Thinking in Space: How Multimodal Large Language Models See, Remember, and Recall Spaces.

LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion Thinking in Space: How Multimodal Large Language Models See, Remember, and Recall Spaces

Reference 48

Resolution
unresolved
no resolver link, observed 2026-08-06T20:26:10.697300Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T20:26:10.697300Z digest=sha256:09014bf1c17343a80281c07910288c0422a1a1c85eb2634e5c91a9428a59a409

Observation cfda3e98-8668-4489-a746-fe1a5e560a8a · outbound

This paper cites CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer.

LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer

Reference 49

Resolution
unresolved
no resolver link, observed 2026-08-06T20:26:10.702612Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T20:26:10.702612Z digest=sha256:b7bf23a5bf40e22bf4435948bc8d75421220b3d3d12cebb1e0c0bddcb4356655

Observation 36c1e16e-119d-48fc-a830-aa1f94263a22 · outbound

This paper cites Stablenormal: Reducing diffusion variance for stable and sharp normal.

LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion Stablenormal: Reducing diffusion variance for stable and sharp normal

Reference 50

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T20:26:11.214442Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T20:26:10.707596Z digest=sha256:6166b3a981ef2df19672b87db0dc149c82d79d2a1d87ad6e924303ac15a070b2

Observation 7b7f76ba-15ce-404a-af64-b56ee5b4c24f · outbound

This paper cites Convolutions die hard: Open-vocabulary seg- mentation with single frozen convolutional clip.

LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion Convolutions die hard: Open-vocabulary seg- mentation with single frozen convolutional clip

Reference 51

Resolution
unresolved
no resolver link, observed 2026-08-06T20:26:10.713100Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T20:26:10.713100Z digest=sha256:f3feac6ca8a6f0a3060820beaefe5ba0bf6e5edceae9caca97177c80c39e9259

Observation 6bb1143d-0374-4a2a-993e-ae9ffe2f5bb8 · outbound

This paper cites ViewCrafter: Taming Video Diffusion Models for High-fidelity Novel View Synthesis.

LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion ViewCrafter: Taming Video Diffusion Models for High-fidelity Novel View Synthesis

Reference 52

Resolution
unresolved
no resolver link, observed 2026-08-06T20:26:10.717650Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T20:26:10.717650Z digest=sha256:2c26d98d797a7a2c214096f71f23565923135381c01ab322d6000910659af33e

Observation cfade3f6-0df7-4509-a74f-7ea0d7686a6d · outbound

This paper cites SAM-E: Leveraging Visual Foundation Model with Sequence Imitation for Embodied Manipulation.

LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion SAM-E: Leveraging Visual Foundation Model with Sequence Imitation for Embodied Manipulation

Reference 53

Resolution
verified exact
local_arxiv, observed 2026-08-06T20:26:10.789431Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T20:26:10.722071Z digest=sha256:9980f6debae17f14d39d4ec7bac87782dcff6ee3fed284991095bcfd033cf560

Observation ab10986e-163d-4366-9a8b-1d3d8ae937ef · outbound

This paper cites Motiondirector: Motion customization of text-to-video diffusion models.

LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion Motiondirector: Motion customization of text-to-video diffusion models

Reference 54

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T20:26:11.190957Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T20:26:10.726682Z digest=sha256:b300349ac848d74d3be173d00ed1468b9509c6ddb89a48e938586731a2019718

Observation 11aac6ee-99c3-4b6e-b1ce-e88fdc2f7c32 · outbound

This paper cites Stereo Magnification: Learning View Synthesis using Multiplane Images.

LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion Stereo Magnification: Learning View Synthesis using Multiplane Images

Reference 55

Resolution
unresolved
no resolver link, observed 2026-08-06T20:26:10.731298Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T20:26:10.731298Z digest=sha256:465e151d9e57e434d66d58e73319fee6cc8c7939b0a52364ca7f49a5497f3978

Pith citing papers

Observation 33d0b0fb-25af-4e02-9cc8-a9db8557c60f · inbound

FLEG: Feed-Forward Language Embedded Gaussian Splatting from Any Views via Compact Semantic Representation cites this paper.

FLEG: Feed-Forward Language Embedded Gaussian Splatting from Any Views via Compact Semantic Representation LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion

Reference 16

Resolution
verified exact
arxiv_id, observed 2026-05-16T20:48:32.622421Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-16T20:46:04.875912Z digest=sha256:df25af4d0f55664787cc8fbbb4ec9247007f37e919dd4237649112c162136c11

Observation 1ddcfd7f-f597-4e2a-a764-225ff3c1203d · inbound

NG-GS: NeRF-Guided 3D Gaussian Splatting Segmentation cites this paper.

NG-GS: NeRF-Guided 3D Gaussian Splatting Segmentation LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion

Reference 19

Resolution
verified exact
arxiv_id, observed 2026-05-10T11:55:20.610305Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-10T11:53:22.566217Z digest=sha256:39213a6916bd9042bca78ac332a06580ebed37572ea615c54f7d92040b1921e3

Observation 92ad6003-1e25-4413-bd8e-e4fdfd66ca4c · inbound

VistaBot: View-Robust Robot Manipulation via Spatiotemporal-Aware View Synthesis cites this paper.

VistaBot: View-Robust Robot Manipulation via Spatiotemporal-Aware View Synthesis LangScene-X: Reconstruct Generalizable 3D Language-Embedded Scenes with TriMap Video Diffusion

Reference 7

Resolution
verified exact
arxiv_id, observed 2026-05-11T14:41:13.785497Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-09T21:18:12.192842Z digest=sha256:4ace7b06fba30d4cc06bda17609f2e39ea401389e09fb5cb2f7a17a6722b9248