{"as_of":"2026-08-10T09:54:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9da1a06d945a2f349b9e85f274b8e32c08d8ce661131d1c027974d2519c23bef","coverage":[{"denominator":29,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":29,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T00:23:03.822300Z","state":"measured"},{"denominator":29,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":29,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.15054/citation-record","integrity":"/paper/2607.15054/integrity","json":"/paper/2607.15054/citation-record.json","paper":"/paper/2607.15054"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-02T00:23:00.973913Z","title":"Gpt-4 technical report.arXiv preprint arXiv:2303.08774,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15054","last_updated":"2026-07-16T14:31:16Z","snapshot_observed_at":"2026-08-06T08:47:40.413599Z","submitted_at":"2026-07-16T14:31:16Z","title":"Beyond Single Expert: Harmonizing Diverse Visual Priors in MLLMs for Spatial Understanding","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T00:23:00.973913Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2607.15054"},"observation_digest":"sha256:66a48938f8da54a296ca7afae9a95bbc807e7921921018b20c2a2a87dd68fd73","observation_id":"4afc75ac-6588-4b67-9378-2ffc5ef46892","resolution":{"observed_at":"2026-08-02T00:23:00.973913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.10370","last_updated":"2024-11-18T08:29:08Z","snapshot_observed_at":"2026-08-05T04:37:45.202508Z","submitted_at":"2024-05-16T18:03:41Z","title":"Grounded 3D-LLM with Referent Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.10370","snapshot_observed_at":"2026-08-02T00:23:01.210993Z","title":"Ll3da: Visual interactive instruction tuning for omni-3d understanding reasoning and planning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15054","last_updated":"2026-07-16T14:31:16Z","snapshot_observed_at":"2026-08-06T08:47:40.413599Z","submitted_at":"2026-07-16T14:31:16Z","title":"Beyond Single Expert: Harmonizing Diverse Visual Priors in MLLMs for Spatial Understanding","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T00:23:01.210993Z"},"links":{"cited_paper":"/paper/2405.10370","citing_paper":"/paper/2607.15054"},"observation_digest":"sha256:59570cb8d6c8658accb38b95e42b8cf6c9cf4c062c17889fa8860d9ff5ad89a9","observation_id":"f649197a-b618-408a-87f8-e57038564a1e","resolution":{"observed_at":"2026-08-02T00:23:01.210993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11401","last_updated":"2024-03-22T18:52:51Z","snapshot_observed_at":"2026-08-06T11:39:56.281668Z","submitted_at":"2024-03-18T01:18:48Z","title":"Scene-LLM: Extending Language Model for 3D Visual Understanding and Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.11401","snapshot_observed_at":"2026-08-02T00:23:01.362939Z","title":"Scene-llm: Extending language model for 3d visual understanding and reasoning.arXiv preprint arXiv:2403.11401,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15054","last_updated":"2026-07-16T14:31:16Z","snapshot_observed_at":"2026-08-06T08:47:40.413599Z","submitted_at":"2026-07-16T14:31:16Z","title":"Beyond Single Expert: Harmonizing Diverse Visual Priors in MLLMs for Spatial Understanding","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T00:23:01.362939Z"},"links":{"cited_paper":"/paper/2403.11401","citing_paper":"/paper/2607.15054"},"observation_digest":"sha256:a3359482acf3e6c7c90b47e5e293613bcb7e5eb101bac480e4a6281ad6a0e7da","observation_id":"e8b896e1-377a-4bf6-b5de-c6c188cc415e","resolution":{"observed_at":"2026-08-02T00:23:01.362939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08168","last_updated":"2024-09-28T03:56:28Z","snapshot_observed_at":"2026-08-07T17:07:05.445620Z","submitted_at":"2023-12-13T14:27:45Z","title":"Chat-Scene: Bridging 3D Scene and Large Language Models with Object Identifiers","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08168","snapshot_observed_at":"2026-08-02T00:23:01.530176Z","title":"Chat-3d v2: Bridging 3d scene and large language models with object identifiers.arXiv preprint arXiv:2312.08168,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15054","last_updated":"2026-07-16T14:31:16Z","snapshot_observed_at":"2026-08-06T08:47:40.413599Z","submitted_at":"2026-07-16T14:31:16Z","title":"Beyond Single Expert: Harmonizing Diverse Visual Priors in MLLMs for Spatial Understanding","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T00:23:01.530176Z"},"links":{"cited_paper":"/paper/2312.08168","citing_paper":"/paper/2607.15054"},"observation_digest":"sha256:cd76e34b26cca699237b6c4373894b42838df1fb3d7f6e6a0b5ff86140473f7b","observation_id":"4675c47a-7b5a-4ab3-b24f-83a706477a0e","resolution":{"observed_at":"2026-08-02T00:23:01.530176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-02T00:23:01.696722Z","title":"Gpt-4o system card.arXiv preprint arXiv:2410.21276,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15054","last_updated":"2026-07-16T14:31:16Z","snapshot_observed_at":"2026-08-06T08:47:40.413599Z","submitted_at":"2026-07-16T14:31:16Z","title":"Beyond Single Expert: Harmonizing Diverse Visual Priors in MLLMs for Spatial Understanding","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T00:23:01.696722Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2607.15054"},"observation_digest":"sha256:0aa4d153da77434cbfd0a886d224df9783170da658646b407a26e4634bdf6e9e","observation_id":"05707b40-b89d-40bf-8e03-39d0298d5072","resolution":{"observed_at":"2026-08-02T00:23:01.696722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-02T00:23:01.780480Z","title":"Adam: A method for stochastic optimization.arXiv preprint arXiv:1412.6980,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15054","last_updated":"2026-07-16T14:31:16Z","snapshot_observed_at":"2026-08-06T08:47:40.413599Z","submitted_at":"2026-07-16T14:31:16Z","title":"Beyond Single Expert: Harmonizing Diverse Visual Priors in MLLMs for Spatial Understanding","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T00:23:01.780480Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2607.15054"},"observation_digest":"sha256:bcccffb5c4dcb7be56016d726fc6b92dfdb3f4a164f80e4fe584f0edfbf8bbe1","observation_id":"87e64744-d2a1-4358-87b8-233278902a8f","resolution":{"observed_at":"2026-08-02T00:23:01.780480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.06037","last_updated":"2026-05-01T09:36:02Z","snapshot_observed_at":"2026-07-06T22:44:46.690576Z","submitted_at":"2026-02-05T18:59:32Z","title":"Thinking with Geometry: Active Geometry Integration for Spatial Reasoning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.06037","snapshot_observed_at":"2026-08-02T00:23:01.948198Z","title":"Thinking with geometry: Active geometry integration for spatial reasoning.arXiv preprint arXiv:2602.06037,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15054","last_updated":"2026-07-16T14:31:16Z","snapshot_observed_at":"2026-08-06T08:47:40.413599Z","submitted_at":"2026-07-16T14:31:16Z","title":"Beyond Single Expert: Harmonizing Diverse Visual Priors in MLLMs for Spatial Understanding","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T00:23:01.948198Z"},"links":{"cited_paper":"/paper/2602.06037","citing_paper":"/paper/2607.15054"},"observation_digest":"sha256:3c309597d1d31a5a4396528de4019a79ff4dcc281b05772a639ecd017b893d08","observation_id":"5e88b47d-566b-43b7-9ad8-e1851429c6fc","resolution":{"observed_at":"2026-08-02T00:23:01.948198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.10647","last_updated":"2025-11-13T18:59:53Z","snapshot_observed_at":"2026-07-06T22:35:46.018050Z","submitted_at":"2025-11-13T18:59:53Z","title":"Depth Anything 3: Recovering the Visual Space from Any Views","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.10647","snapshot_observed_at":"2026-08-02T00:23:02.051394Z","title":"Depth anything 3: Recovering the visual space from any views","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15054","last_updated":"2026-07-16T14:31:16Z","snapshot_observed_at":"2026-08-06T08:47:40.413599Z","submitted_at":"2026-07-16T14:31:16Z","title":"Beyond Single Expert: Harmonizing Diverse Visual Priors in MLLMs for Spatial Understanding","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T00:23:02.051394Z"},"links":{"cited_paper":"/paper/2511.10647","citing_paper":"/paper/2607.15054"},"observation_digest":"sha256:d132c61b9f6b719731a6efcc35e7a327ddd767259741fd6fad9d10bf900c6dc7","observation_id":"2f189430-0882-4be4-8ef6-5b005ae1de66","resolution":{"observed_at":"2026-08-02T00:23:02.051394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:23:02.211902Z","title":"Trace anything: Representing any video in 4d via trajectory fields.arXiv preprint arXiv:2510.13802, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15054","last_updated":"2026-07-16T14:31:16Z","snapshot_observed_at":"2026-08-06T08:47:40.413599Z","submitted_at":"2026-07-16T14:31:16Z","title":"Beyond Single Expert: Harmonizing Diverse Visual Priors in MLLMs for Spatial Understanding","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T00:23:02.211902Z"},"links":{"citing_paper":"/paper/2607.15054"},"observation_digest":"sha256:fcf40a60f9064d7ea9d1931544d68543c2f9bf9d984f9c5e1986c00d59de7151","observation_id":"4a7fe89a-a414-4b7c-9969-fa9de197a021","resolution":{"observed_at":"2026-08-02T00:23:02.211902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01805","last_updated":"2025-05-21T09:38:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-02T15:12:17Z","title":"SpaceR: Reinforcing MLLMs in Video Spatial Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.01805","snapshot_observed_at":"2026-08-02T00:23:02.322345Z","title":"Spacer: Reinforcing mllms in video spatial reasoning.arXiv preprint arXiv:2504.01805,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15054","last_updated":"2026-07-16T14:31:16Z","snapshot_observed_at":"2026-08-06T08:47:40.413599Z","submitted_at":"2026-07-16T14:31:16Z","title":"Beyond Single Expert: Harmonizing Diverse Visual Priors in MLLMs for Spatial Understanding","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T00:23:02.322345Z"},"links":{"cited_paper":"/paper/2504.01805","citing_paper":"/paper/2607.15054"},"observation_digest":"sha256:9c295f773bb44cc1ceb65fa6864e248790721d9d40817bcbfef897c9487d2c45","observation_id":"bf8cbbc5-f5d1-4423-802f-21ab9d50271a","resolution":{"observed_at":"2026-08-02T00:23:02.322345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01428","last_updated":"2025-03-11T07:54:04Z","snapshot_observed_at":"2026-08-06T23:31:17.110793Z","submitted_at":"2025-01-02T18:59:59Z","title":"GPT4Scene: Understand 3D Scenes from Videos with Vision-Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01428","snapshot_observed_at":"2026-08-02T00:23:02.432874Z","title":"Gpt4scene: Understand 3d scenes from videos with vision- language models.arXiv preprint arXiv:2501.01428,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15054","last_updated":"2026-07-16T14:31:16Z","snapshot_observed_at":"2026-08-06T08:47:40.413599Z","submitted_at":"2026-07-16T14:31:16Z","title":"Beyond Single Expert: Harmonizing Diverse Visual Priors in MLLMs for Spatial Understanding","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T00:23:02.432874Z"},"links":{"cited_paper":"/paper/2501.01428","citing_paper":"/paper/2607.15054"},"observation_digest":"sha256:694c4222c1397f9b2e995794639dc74e4aa371493ebd42053316459305442198","observation_id":"d3b06a84-d677-4a0a-9a70-d483a1a880cd","resolution":{"observed_at":"2026-08-02T00:23:02.432874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-02T00:23:02.519901Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context.arXiv preprint arXiv:2403.05530,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15054","last_updated":"2026-07-16T14:31:16Z","snapshot_observed_at":"2026-08-06T08:47:40.413599Z","submitted_at":"2026-07-16T14:31:16Z","title":"Beyond Single Expert: Harmonizing Diverse Visual Priors in MLLMs for Spatial Understanding","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T00:23:02.519901Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2607.15054"},"observation_digest":"sha256:b2262ea82851cc73c0531d08be4ce50ddff5988d6bde0748cc9a612dd47f04f2","observation_id":"edf82e13-76f9-433c-902f-45a4153ecd22","resolution":{"observed_at":"2026-08-02T00:23:02.519901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-02T00:23:02.675732Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15054","last_updated":"2026-07-16T14:31:16Z","snapshot_observed_at":"2026-08-06T08:47:40.413599Z","submitted_at":"2026-07-16T14:31:16Z","title":"Beyond Single Expert: Harmonizing Diverse Visual Priors in MLLMs for Spatial Understanding","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T00:23:02.675732Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2607.15054"},"observation_digest":"sha256:e155bac36738fc48a39339b9f60da6bf7d62826ded325c1c58144fe631d5ce3f","observation_id":"2cac0151-ae00-4379-8ced-26b44dd6e06d","resolution":{"observed_at":"2026-08-02T00:23:02.675732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-02T00:23:02.835659Z","title":"Wan: Open and advanced large-scale video generative models.arXiv preprint arXiv:2503.20314,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15054","last_updated":"2026-07-16T14:31:16Z","snapshot_observed_at":"2026-08-06T08:47:40.413599Z","submitted_at":"2026-07-16T14:31:16Z","title":"Beyond Single Expert: Harmonizing Diverse Visual Priors in MLLMs for Spatial Understanding","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T00:23:02.835659Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2607.15054"},"observation_digest":"sha256:c3f81d58624cedd6153477e5b773fc99787a541a0620ffae37ca9f8a20fcd42f","observation_id":"21e08e6c-d6e8-46fa-afc1-3e2ea1de8f1b","resolution":{"observed_at":"2026-08-02T00:23:02.835659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-02T00:23:03.003520Z","title":"Ross3d: Reconstructive visual instruction tuning with 3d-awareness","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15054","last_updated":"2026-07-16T14:31:16Z","snapshot_observed_at":"2026-08-06T08:47:40.413599Z","submitted_at":"2026-07-16T14:31:16Z","title":"Beyond Single Expert: Harmonizing Diverse Visual Priors in MLLMs for Spatial Understanding","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T00:23:03.003520Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2607.15054"},"observation_digest":"sha256:9b7648b93ac50a7db72d458813357db8fff88e304e64aa2537b63593b88232a1","observation_id":"ce1e85c9-3eed-47d0-9f27-d9e51c7d7277","resolution":{"observed_at":"2026-08-02T00:23:03.003520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.08769","last_updated":"2023-08-17T03:52:15Z","snapshot_observed_at":"2026-08-08T07:19:32.263241Z","submitted_at":"2023-08-17T03:52:15Z","title":"Chat-3D: Data-efficiently Tuning Large Language Model for Universal Dialogue of 3D Scenes","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.08769","snapshot_observed_at":"2026-08-02T00:23:03.164292Z","title":"Chat-3d: Data-efficiently tuning large language model for universal dialogue of 3d scenes.arXiv preprint arXiv:2308.08769,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15054","last_updated":"2026-07-16T14:31:16Z","snapshot_observed_at":"2026-08-06T08:47:40.413599Z","submitted_at":"2026-07-16T14:31:16Z","title":"Beyond Single Expert: Harmonizing Diverse Visual Priors in MLLMs for Spatial Understanding","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T00:23:03.164292Z"},"links":{"cited_paper":"/paper/2308.08769","citing_paper":"/paper/2607.15054"},"observation_digest":"sha256:7f1a063b98030b081dee6626d69d33956699d02e8b07069c59e38fc733320f0d","observation_id":"f91d52c3-b8c2-47b3-a065-f8004863312e","resolution":{"observed_at":"2026-08-02T00:23:03.164292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.19235","last_updated":"2026-07-17T06:42:00Z","snapshot_observed_at":"2026-08-10T00:39:51.221084Z","submitted_at":"2026-03-19T17:59:58Z","title":"Generation Models Know Space: Unleashing Implicit 3D Priors for Scene Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.19235","snapshot_observed_at":"2026-08-02T00:23:03.278174Z","title":"Generation models know space: Unleashing implicit 3d priors for scene understanding.arXiv preprint arXiv:2603.19235,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15054","last_updated":"2026-07-16T14:31:16Z","snapshot_observed_at":"2026-08-06T08:47:40.413599Z","submitted_at":"2026-07-16T14:31:16Z","title":"Beyond Single Expert: Harmonizing Diverse Visual Priors in MLLMs for Spatial Understanding","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T00:23:03.278174Z"},"links":{"cited_paper":"/paper/2603.19235","citing_paper":"/paper/2607.15054"},"observation_digest":"sha256:c22edddc95ed2b9ae721d118bd055b333a288451e307e0b8f639ec325b3676d2","observation_id":"a94d5c6e-44f2-4f55-b3f5-195fd52981b0","resolution":{"observed_at":"2026-08-02T00:23:03.278174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:23:03.437035Z","title":"From flatland to space: Teaching vision-language models to perceive and reason in 3d.arXiv preprint arXiv:2503.22976,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15054","last_updated":"2026-07-16T14:31:16Z","snapshot_observed_at":"2026-08-06T08:47:40.413599Z","submitted_at":"2026-07-16T14:31:16Z","title":"Beyond Single Expert: Harmonizing Diverse Visual Priors in MLLMs for Spatial Understanding","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T00:23:03.437035Z"},"links":{"citing_paper":"/paper/2607.15054"},"observation_digest":"sha256:9bda26eb8c06db54552e600ea5fc9c25b74d31a458d1e8796c778a352b52e85b","observation_id":"7437ff82-5dab-4f3b-bb6f-57ef258a53b1","resolution":{"observed_at":"2026-08-02T00:23:03.437035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.27437","last_updated":"2026-05-02T17:42:29Z","snapshot_observed_at":"2026-08-02T12:27:33.147868Z","submitted_at":"2026-03-28T22:49:40Z","title":"SpatialStack: Layered Geometry-Language Fusion for 3D VLM Spatial Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.27437","snapshot_observed_at":"2026-08-02T00:23:03.547032Z","title":"Spatialstack: Layered geometry-language fusion for 3d vlm spatial reasoning.arXiv preprint arXiv:2603.27437,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15054","last_updated":"2026-07-16T14:31:16Z","snapshot_observed_at":"2026-08-06T08:47:40.413599Z","submitted_at":"2026-07-16T14:31:16Z","title":"Beyond Single Expert: Harmonizing Diverse Visual Priors in MLLMs for Spatial Understanding","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T00:23:03.547032Z"},"links":{"cited_paper":"/paper/2603.27437","citing_paper":"/paper/2607.15054"},"observation_digest":"sha256:e893662541b2670811ece06e1221f23475325cabbc0551728b3d2b8da72a4751","observation_id":"a305829a-724f-4163-949f-21405c8dc6f3","resolution":{"observed_at":"2026-08-02T00:23:03.547032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-02T00:23:03.658491Z","title":"Adding conditional control to text-to-image diffusion models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15054","last_updated":"2026-07-16T14:31:16Z","snapshot_observed_at":"2026-08-06T08:47:40.413599Z","submitted_at":"2026-07-16T14:31:16Z","title":"Beyond Single Expert: Harmonizing Diverse Visual Priors in MLLMs for Spatial Understanding","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T00:23:03.658491Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2607.15054"},"observation_digest":"sha256:2b0407c1cb08476663056342a2bb8ede3446cfb2793922ae3982e657355632a7","observation_id":"65a174ab-bebd-457d-9885-22696f41c3b0","resolution":{"observed_at":"2026-08-02T00:23:03.658491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:23:03.740289Z","title":"Multi3drefer: Grounding text description to multiple 3d objects","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15054","last_updated":"2026-07-16T14:31:16Z","snapshot_observed_at":"2026-08-06T08:47:40.413599Z","submitted_at":"2026-07-16T14:31:16Z","title":"Beyond Single Expert: Harmonizing Diverse Visual Priors in MLLMs for Spatial Understanding","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T00:23:03.740289Z"},"links":{"citing_paper":"/paper/2607.15054"},"observation_digest":"sha256:6e0c67ae924bcd4bb3a49e75ec24f55bca7816aaab45deb0bf01a34508098743","observation_id":"9ffbde95-a8de-47a6-b3f6-8568ef4d81d3","resolution":{"observed_at":"2026-08-02T00:23:03.740289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:23:03.822300Z","title":"Unifying 3d vision-language understanding via promptable queries","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15054","last_updated":"2026-07-16T14:31:16Z","snapshot_observed_at":"2026-08-06T08:47:40.413599Z","submitted_at":"2026-07-16T14:31:16Z","title":"Beyond Single Expert: Harmonizing Diverse Visual Priors in MLLMs for Spatial Understanding","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-02T00:23:03.822300Z"},"links":{"citing_paper":"/paper/2607.15054"},"observation_digest":"sha256:01550ac5e3b4fa37367382360100353612d3c25eaf80c7679767b0de5feeeced","observation_id":"c7f2432c-0cb8-4974-abe2-f3bc6d064307","resolution":{"observed_at":"2026-08-02T00:23:03.822300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-02T00:23:01.864475Z","title":"Llava-onevision: Easy visual task transfer.arXiv preprint arXiv:2408.03326,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15054","last_updated":"2026-07-16T14:31:16Z","snapshot_observed_at":"2026-08-06T08:47:40.413599Z","submitted_at":"2026-07-16T14:31:16Z","title":"Beyond Single Expert: Harmonizing Diverse Visual Priors in MLLMs for Spatial Understanding","version":1},"reference_index":2014,"source":"pdf_text","source_observed_at":"2026-08-02T00:23:01.864475Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2607.15054"},"observation_digest":"sha256:68ffc57910f105c72d8d6228f49d4e1af4043252ca15b7215098c852e6107558","observation_id":"c891bda5-50ec-4552-b0e0-f6f66ad68479","resolution":{"observed_at":"2026-08-02T00:23:01.864475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:23:01.120140Z","title":"Seeing through imagination: Learning scene geometry via implicit spatial world modeling.arXiv preprint arXiv:2512.01821,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15054","last_updated":"2026-07-16T14:31:16Z","snapshot_observed_at":"2026-08-06T08:47:40.413599Z","submitted_at":"2026-07-16T14:31:16Z","title":"Beyond Single Expert: Harmonizing Diverse Visual Priors in MLLMs for Spatial Understanding","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-02T00:23:01.120140Z"},"links":{"citing_paper":"/paper/2607.15054"},"observation_digest":"sha256:083470cf034d8378df84ba643dbee63e805112a38da1cbe97aa970c65754e93f","observation_id":"c4ec22de-4f42-4007-8a85-dc08415a53dc","resolution":{"observed_at":"2026-08-02T00:23:01.120140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-02T00:23:01.048543Z","title":"Qwen3-vl technical report.arXiv preprint arXiv:2511.21631,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15054","last_updated":"2026-07-16T14:31:16Z","snapshot_observed_at":"2026-08-06T08:47:40.413599Z","submitted_at":"2026-07-16T14:31:16Z","title":"Beyond Single Expert: Harmonizing Diverse Visual Priors in MLLMs for Spatial Understanding","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-02T00:23:01.048543Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2607.15054"},"observation_digest":"sha256:e96c7920bdb5926ee040f25c341cf0a257217d7e4a2d83a1b0b50dab8b6744c3","observation_id":"99ea6e02-6a1d-4020-adf5-02c703efe42a","resolution":{"observed_at":"2026-08-02T00:23:01.048543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:23:01.613098Z","title":"3drs: Mllms need 3d-aware representation supervision for scene understanding.arXiv preprint arXiv:2506.01946,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15054","last_updated":"2026-07-16T14:31:16Z","snapshot_observed_at":"2026-08-06T08:47:40.413599Z","submitted_at":"2026-07-16T14:31:16Z","title":"Beyond Single Expert: Harmonizing Diverse Visual Priors in MLLMs for Spatial Understanding","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-02T00:23:01.613098Z"},"links":{"citing_paper":"/paper/2607.15054"},"observation_digest":"sha256:ea997ee086f127bbb3c17bb3a127405719932e70d132b7a7ece8a1f2929f6228","observation_id":"71d197b1-e280-443c-b1c5-c20763002696","resolution":{"observed_at":"2026-08-02T00:23:01.613098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00615","last_updated":"2023-09-01T17:59:47Z","snapshot_observed_at":"2026-08-08T23:14:57.166208Z","submitted_at":"2023-09-01T17:59:47Z","title":"Point-Bind & Point-LLM: Aligning Point Cloud with Multi-modality for 3D Understanding, Generation, and Instruction Following","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00615","snapshot_observed_at":"2026-08-02T00:23:01.446109Z","title":"Point-bind & point-llm: Aligning point cloud with multi- modality for 3d understanding, generation, and instruction following.arXiv preprint arXiv:2309.00615,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15054","last_updated":"2026-07-16T14:31:16Z","snapshot_observed_at":"2026-08-06T08:47:40.413599Z","submitted_at":"2026-07-16T14:31:16Z","title":"Beyond Single Expert: Harmonizing Diverse Visual Priors in MLLMs for Spatial Understanding","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-02T00:23:01.446109Z"},"links":{"cited_paper":"/paper/2309.00615","citing_paper":"/paper/2607.15054"},"observation_digest":"sha256:7e9e4421a5ac78b8141a74f0dd932435a1eaa0d3bee4925bac009221b6a2d3dc","observation_id":"4ba8b9c3-c4ab-43e9-9f7c-f875897ca14e","resolution":{"observed_at":"2026-08-02T00:23:01.446109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20279","snapshot_observed_at":"2026-08-02T00:23:01.277839Z","title":"Vlm-3r: Vision-language models augmented with instruction-aligned 3d reconstruction.arXiv preprint arXiv:2505.20279,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15054","last_updated":"2026-07-16T14:31:16Z","snapshot_observed_at":"2026-08-06T08:47:40.413599Z","submitted_at":"2026-07-16T14:31:16Z","title":"Beyond Single Expert: Harmonizing Diverse Visual Priors in MLLMs for Spatial Understanding","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-02T00:23:01.277839Z"},"links":{"cited_paper":"/paper/2505.20279","citing_paper":"/paper/2607.15054"},"observation_digest":"sha256:1bb5bff5528eef94bcee7186e080711d8c6a3afb20da97cf505836a17bfba539","observation_id":"3a027346-4e82-4a16-966d-da6358e1aa4e","resolution":{"observed_at":"2026-08-02T00:23:01.277839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.00883","last_updated":"2025-04-14T20:12:57Z","snapshot_observed_at":"2026-08-07T16:17:09.409469Z","submitted_at":"2025-04-01T15:11:11Z","title":"Improved Visual-Spatial Reasoning via R1-Zero-Like Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.00883","snapshot_observed_at":"2026-08-02T00:23:01.979540Z","title":"Improved visual-spatial reasoning via r1-zero-like training","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15054","last_updated":"2026-07-16T14:31:16Z","snapshot_observed_at":"2026-08-06T08:47:40.413599Z","submitted_at":"2026-07-16T14:31:16Z","title":"Beyond Single Expert: Harmonizing Diverse Visual Priors in MLLMs for Spatial Understanding","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-02T00:23:01.979540Z"},"links":{"cited_paper":"/paper/2504.00883","citing_paper":"/paper/2607.15054"},"observation_digest":"sha256:edf1988747e8f3e4b431356b576cc4d82f3de0eb703d132e42d1ff2e7af6a72a","observation_id":"8c4a1fa3-70d6-499e-b42b-d96f56b54eb2","resolution":{"observed_at":"2026-08-02T00:23:01.979540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.15054","last_updated":"2026-07-16T14:31:16Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T08:47:40.413599Z","submitted_at":"2026-07-16T14:31:16Z","title":"Beyond Single Expert: Harmonizing Diverse Visual Priors in MLLMs for Spatial Understanding"},"reference_resolution":{"displayed":29,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":29,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":29},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 29 of 29 outbound references and 0 inbound Pith citation observations for arXiv:2607.15054."}