{"as_of":"2026-08-14T09:32:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0ba9a500257b52dac5201f161b62249507a3645de8a0cad41c8b59429e8c6a9f","coverage":[{"denominator":77,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":77,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T21:53:04.127385Z","state":"measured"},{"denominator":78,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":78,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T22:13:52.383043Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-14T06:19:39.931283Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.23120","snapshot_observed_at":"2026-08-03T22:13:52.383043Z","title":"Enhanc- ing spatial reasoning in multimodal large language mod- els through reasoning-based segmentation.arXiv preprint arXiv:2506.23120, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.11440","last_updated":"2026-05-29T13:40:10Z","snapshot_observed_at":"2026-08-03T22:13:48.348551Z","submitted_at":"2025-11-14T16:07:18Z","title":"Synthetic Stimuli, Real Gains: Rethinking VLM Fine-Tuning Through Fully Controlled Data Generation","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T22:13:52.383043Z"},"links":{"cited_paper":"/paper/2506.23120","citing_paper":"/paper/2511.11440"},"observation_digest":"sha256:4eff0d06a207bf4cfdb2f439398c7a3802de199fd0a91e3ae0b0842b7eb7b82e","observation_id":"ba066641-729c-4b3d-b6c6-854f6ebf7940","resolution":{"observed_at":"2026-08-03T22:13:52.383043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.23120/citation-record","integrity":"/paper/2506.23120/integrity","json":"/paper/2506.23120/citation-record.json","paper":"/paper/2506.23120"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:57.793154Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-14T06:19:39.931283Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:57.793154Z"},"links":{"citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:958b579bdd808c6a64999bfb7d7d9b02ba75b0d5f2b6015b753659a16c30239b","observation_id":"325774cd-e2b0-4437-9db1-1771425d731c","resolution":{"observed_at":"2026-08-06T21:52:57.793154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:14.658767Z","title":"Scanqa: 3d question answering for spatial scene understanding","venue":null,"work_id":"1d878cd8-63cb-4256-93ec-2e48ab160344","year":2022},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-14T06:19:39.931283Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:57.848548Z"},"links":{"citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:3564ed743fd421c9e05de1f45858d05935431e4dba9aedc02a26b7374b5a9d97","observation_id":"6a7764da-d893-49aa-80d6-879fc4821c98","resolution":{"observed_at":"2026-08-06T21:53:14.729965Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:14.515123Z","title":"Semantic scene com- pletion via integrating instances and scene in-the-loop","venue":null,"work_id":"ae8bebed-c527-4739-a21b-70bcad87fcac","year":2021},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-14T06:19:39.931283Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:57.941641Z"},"links":{"citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:1bada1bae0fea5b954c797ec6bb1b91d419656aa89da83e8933ac35036a6faf2","observation_id":"ec84b564-9542-4b2a-b53d-af68d50282d6","resolution":{"observed_at":"2026-08-06T21:53:14.576806Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:14.326033Z","title":"Scanrefer: 3d object localization in rgb-d scans using natural language","venue":null,"work_id":"9d8eed12-76da-496d-8daf-cb51b728c812","year":2020},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-14T06:19:39.931283Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:58.068312Z"},"links":{"citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:92e9e0c74adbf65b5b98b6ea0db58070125acf9125132eb0d4078d1d23ce4d7a","observation_id":"eb38820f-994a-4424-a259-5980f3e22e0d","resolution":{"observed_at":"2026-08-06T21:53:14.406809Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:14.160844Z","title":"Language conditioned spatial relation reasoning for 3d object grounding","venue":null,"work_id":"e8a16532-7a22-4530-a8bb-593eeeae65a8","year":null},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-14T06:19:39.931283Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:58.206308Z"},"links":{"citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:09b806234aa1e334222560abbe8ae9ffc5ff676571a6fe3ce4f922949c9e856f","observation_id":"7525dbd6-533c-4a95-babf-e4d55a965115","resolution":{"observed_at":"2026-08-06T21:53:14.238738Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:14.001542Z","title":"Ll3da: Visual interactive instruction tuning for omni-3d understand- ing reasoning and planning","venue":null,"work_id":"4038835e-3f5d-46af-bf17-625dc49b6723","year":2024},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-14T06:19:39.931283Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:58.293363Z"},"links":{"citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:dbece3e3033eb960ae10bb277fd751a7e7fec53e7fdf60f957ec22ef7ae4c1ae","observation_id":"5b1a3463-d775-4faf-b2e6-b2f6a048ebe2","resolution":{"observed_at":"2026-08-06T21:53:14.061588Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:13.784930Z","title":"Mppnet: Multi-frame feature intertwining with proxy points for 3d temporal ob- ject detection","venue":null,"work_id":"307c0380-7baa-4906-8dc2-1a065b7552e6","year":2022},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-14T06:19:39.931283Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:58.381758Z"},"links":{"citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:a92e49175a20d511b05dadf96ab48204f1cba34273bad5fab5a87b7dceabbcc1","observation_id":"becd4c34-3a8b-4b1e-9027-ac8dbaaa3d1b","resolution":{"observed_at":"2026-08-06T21:53:13.902145Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:13.610821Z","title":"Trajectoryformer: 3d object tracking transformer with predictive trajectory hypotheses","venue":null,"work_id":"dfbb30c0-1606-4c0b-9baa-40ba55949a84","year":2023},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-14T06:19:39.931283Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:58.480676Z"},"links":{"citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:efc8bc69507b5a778f97520bf8ae5ef493b983e073e920659039353fedb8e33c","observation_id":"fd2f6363-7d1b-458d-a749-37362235b4e2","resolution":{"observed_at":"2026-08-06T21:53:13.687509Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.10370","last_updated":"2024-11-18T08:29:08Z","snapshot_observed_at":"2026-08-13T00:05:34.358839Z","submitted_at":"2024-05-16T18:03:41Z","title":"Grounded 3D-LLM with Referent Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.10370","snapshot_observed_at":"2026-08-06T21:52:58.607061Z","title":"Grounded 3d-llm with referent tokens","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-14T06:19:39.931283Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:58.607061Z"},"links":{"cited_paper":"/paper/2405.10370","citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:c2842c145dc4557dacf064dd30d3c4075fb66e2a5af0dde6c3c1bf1d1d750322","observation_id":"1c299235-7d13-492f-b05f-0ee47acad1ef","resolution":{"observed_at":"2026-08-06T21:52:58.607061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:13.452079Z","title":"Reslt: Residual learning for long-tailed recog- nition","venue":null,"work_id":"c17ea751-fe1f-4359-aff7-e939daa0cf6a","year":2022},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-14T06:19:39.931283Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:58.701391Z"},"links":{"citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:1cf2f76b7479434a6ad4bd45af632dc6f1e46b7a8bccebda07f60202de490d52","observation_id":"a1c83751-31cb-426a-ac9f-b69ab4ad7c73","resolution":{"observed_at":"2026-08-06T21:53:13.513529Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:58.811072Z","title":"Scannet: Richly-annotated 3d reconstructions of indoor scenes","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-14T06:19:39.931283Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:58.811072Z"},"links":{"citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:526ede595d2e7feb3afd35d2e7061d59a6f8b2d1e327da61d8da4cf5ad01fb46","observation_id":"458a1831-5f2a-48fc-803e-39cdd608875a","resolution":{"observed_at":"2026-08-06T21:52:58.811072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21654","last_updated":"2024-07-31T14:56:42Z","snapshot_observed_at":"2026-08-14T04:59:46.152074Z","submitted_at":"2024-07-31T14:56:42Z","title":"MTA-CLIP: Language-Guided Semantic Segmentation with Mask-Text Alignment","version":1},"cited_work":{"arxiv_id":"2407.21654","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.21654","snapshot_observed_at":"2026-08-06T21:53:04.806413Z","title":"MTA-CLIP: Language-Guided Semantic Segmentation with Mask-Text Alignment","venue":"cs.CV","work_id":"81c6c3b3-b018-4554-8294-05337caa494b","year":2024},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-14T06:19:39.931283Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:58.917530Z"},"links":{"cited_paper":"/paper/2407.21654","citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:01b7bc72b970723477b7e13bde2330a3b3b56a5d88ab5bdd0ccbbec74d79da40","observation_id":"94ac9a92-49d9-42d3-8d0f-78cc8cc7c625","resolution":{"observed_at":"2026-08-06T21:53:04.929386Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-07-30T09:12:38.100527Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-06T21:52:59.052695Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-14T06:19:39.931283Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:59.052695Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:3154fe607679c5ad1c324a2bbdee3104baf790ff4c4ee3ec256720fa10a8fc5a","observation_id":"e112cc66-d919-4cc3-b7ea-c1c26b72a5df","resolution":{"observed_at":"2026-08-06T21:52:59.052695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:59.155141Z","title":"Pla: Language-driven open- vocabulary 3d scene understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-14T06:19:39.931283Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:59.155141Z"},"links":{"citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:478af1d03d14af805ccce8fe15e5cf30360f42628f9bf293dd2dfbe49d78bdc4","observation_id":"90af0a97-5bb2-413d-9280-9877aa54cf5e","resolution":{"observed_at":"2026-08-06T21:52:59.155141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:13.251527Z","title":"The llama 3 herd of models, 2024","venue":null,"work_id":"f80390e7-6db3-4faf-b86b-c9d27b48540b","year":2024},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-14T06:19:39.931283Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:59.243701Z"},"links":{"citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:f55fbb684c48e3761b426d1c43a49efea18615b008d55c0036ab8aa4eec4d25a","observation_id":"de2e4887-707f-4e28-96b1-bdf9f352fea9","resolution":{"observed_at":"2026-08-06T21:53:13.360728Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00615","last_updated":"2023-09-01T17:59:47Z","snapshot_observed_at":"2026-08-13T10:22:27.699118Z","submitted_at":"2023-09-01T17:59:47Z","title":"Point-Bind & Point-LLM: Aligning Point Cloud with Multi-modality for 3D Understanding, Generation, and Instruction Following","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00615","snapshot_observed_at":"2026-08-06T21:52:59.369243Z","title":"Point-bind & point-llm: Aligning point cloud with multi-modality for 3d understand- ing, generation, and instruction following","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-14T06:19:39.931283Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:59.369243Z"},"links":{"cited_paper":"/paper/2309.00615","citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:7782f7b39539db5f61b62b1616c9fc7691248d3d216675cedeb191e615770bd2","observation_id":"44a72786-e440-4241-b3d0-a9436f35572d","resolution":{"observed_at":"2026-08-06T21:52:59.369243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.03905","last_updated":"2023-09-11T20:25:16Z","snapshot_observed_at":"2026-08-13T10:18:19.648567Z","submitted_at":"2023-09-07T17:59:45Z","title":"ImageBind-LLM: Multi-modality Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.03905","snapshot_observed_at":"2026-08-06T21:52:59.473536Z","title":"Imagebind-llm: Multi-modality instruction tun- ing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-14T06:19:39.931283Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:59.473536Z"},"links":{"cited_paper":"/paper/2309.03905","citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:413d5b56de7e719d930130dba22238a7b94e5af93b78582d64b3e1a90c64545b","observation_id":"ad57e631-7596-4529-8f48-cc1ce6ee5a4d","resolution":{"observed_at":"2026-08-06T21:52:59.473536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:13.066883Z","title":"3d-llm: Inject- ing the 3d world into large language models","venue":null,"work_id":"d1733a03-751d-49e8-97a6-649a44dfe928","year":null},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-14T06:19:39.931283Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:59.578599Z"},"links":{"citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:4b0d725289f2d6b8c96f10ea6b124fc478f0d072b32c00a796a1c3547b7bed76","observation_id":"97ce80bc-d7d0-4338-a09c-467d0f2c3547","resolution":{"observed_at":"2026-08-06T21:53:13.146921Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08168","last_updated":"2024-09-28T03:56:28Z","snapshot_observed_at":"2026-08-13T05:03:16.391892Z","submitted_at":"2023-12-13T14:27:45Z","title":"Chat-Scene: Bridging 3D Scene and Large Language Models with Object Identifiers","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08168","snapshot_observed_at":"2026-08-06T21:52:59.681855Z","title":"Chat-3d v2: Bridging 3d scene and large language models with object identifiers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-14T06:19:39.931283Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:59.681855Z"},"links":{"cited_paper":"/paper/2312.08168","citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:5db177f0d2fc4d579260d92d05878dd2c9e677cd84bf997e460e66f9fa7440ad","observation_id":"0f9edb34-9b72-4b97-8b5d-91ae6ec18f30","resolution":{"observed_at":"2026-08-06T21:52:59.681855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12871","last_updated":"2024-05-09T17:35:44Z","snapshot_observed_at":"2026-08-05T10:01:43.401012Z","submitted_at":"2023-11-18T01:21:38Z","title":"An Embodied Generalist Agent in 3D World","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12871","snapshot_observed_at":"2026-08-06T21:52:59.769267Z","title":"An embodied generalist agent in 3d world","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-14T06:19:39.931283Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:59.769267Z"},"links":{"cited_paper":"/paper/2311.12871","citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:fd32c3d797d940754d54bb47ed5fb2da6ecd146cba6fa52c7bd0a627094495b7","observation_id":"34d95fbc-e937-4715-9210-663522ad7705","resolution":{"observed_at":"2026-08-06T21:52:59.769267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:12.847299Z","title":"Multi- view transformer for 3d visual grounding","venue":null,"work_id":"ed28737c-1514-4309-84d6-f005588f7719","year":2022},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-14T06:19:39.931283Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:59.867853Z"},"links":{"citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:3c362a6da82f29f3d6310bc41ff77a5b83786032b3aa94e094e502c7ed214f5d","observation_id":"4b4618bd-cdea-4d2c-828d-1afa9f1c645b","resolution":{"observed_at":"2026-08-06T21:53:12.946706Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.09340","last_updated":"2024-09-24T03:18:24Z","snapshot_observed_at":"2026-08-13T04:40:29.523178Z","submitted_at":"2024-01-17T17:04:35Z","title":"SceneVerse: Scaling 3D Vision-Language Learning for Grounded Scene Understanding","version":3},"cited_work":{"arxiv_id":"2401.09340","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.09340","snapshot_observed_at":"2026-08-06T21:53:04.396674Z","title":"SceneVerse: Scaling 3D Vision-Language Learning for Grounded Scene Understanding","venue":"cs.CV","work_id":"8302529d-a5bb-49c6-99de-1cedd65574ae","year":2024},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-14T06:19:39.931283Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:59.994335Z"},"links":{"cited_paper":"/paper/2401.09340","citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:6d0a8201c186ce20bc3ddde66f20ceaf7f146a53a434709d47e13c1093164b8e","observation_id":"62e5aba4-dde3-4665-b802-8ea3177c3189","resolution":{"observed_at":"2026-08-06T21:53:04.545494Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:12.687235Z","title":"Guided point contrastive learn- ing for semi-supervised point cloud semantic segmentation","venue":null,"work_id":"81ee941f-5ede-4f44-ae24-bbf80a586a34","year":2021},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-14T06:19:39.931283Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T21:53:00.083655Z"},"links":{"citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:12636c5db382e93988eddc353586a36c8a445fc517b2670152389d36e21461b7","observation_id":"ef4f5f50-f464-48c0-82e9-bf42cd0c62ed","resolution":{"observed_at":"2026-08-06T21:53:12.761403Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.02643","last_updated":"2023-04-05T17:59:46Z","snapshot_observed_at":"2026-08-08T05:14:59.435033Z","submitted_at":"2023-04-05T17:59:46Z","title":"Segment Anything","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.02643","snapshot_observed_at":"2026-08-06T21:53:00.204418Z","title":"Berg, Wan-Yen Lo, Piotr Doll ´ar, and Ross Girshick","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-14T06:19:39.931283Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T21:53:00.204418Z"},"links":{"cited_paper":"/paper/2304.02643","citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:d0859b6362f368bb6c18332dcde10a8589825a622a76638d4747c0fe9b84c4b9","observation_id":"831e018b-d7b8-4946-89c5-d2f9cd460c8e","resolution":{"observed_at":"2026-08-06T21:53:00.204418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:12.488390Z","title":"Oneformer3d: One transformer for unified point cloud segmentation","venue":null,"work_id":"61da9187-9143-43ce-abee-7098e1fefa93","year":2024},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-14T06:19:39.931283Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T21:53:00.306050Z"},"links":{"citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:8d263f31557d66665ca8f320cb911314b06b9a48a112511b175242324424d55f","observation_id":"7188b26a-7abb-4603-90da-ee7f35813e5a","resolution":{"observed_at":"2026-08-06T21:53:12.583338Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:12.273351Z","title":"Lisa: Reasoning segmentation via large language model","venue":null,"work_id":"1ecd2dca-240a-4f94-b8e4-651ceea1a063","year":2024},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-14T06:19:39.931283Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T21:53:00.437200Z"},"links":{"citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:b207a844346d1caf812099cbdd58d095199f228ba914b2952c24dc2f8e41992a","observation_id":"76ace732-993f-481d-af74-7ab8261c1a13","resolution":{"observed_at":"2026-08-06T21:53:12.403341Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18629","last_updated":"2024-06-26T17:43:06Z","snapshot_observed_at":"2026-08-06T00:24:52.274888Z","submitted_at":"2024-06-26T17:43:06Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18629","snapshot_observed_at":"2026-08-06T21:53:00.558586Z","title":"Step-dpo: Step-wise preference op- timization for long-chain reasoning of llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-14T06:19:39.931283Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T21:53:00.558586Z"},"links":{"cited_paper":"/paper/2406.18629","citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:e224a7a7cd96b9e7efb65260b6049434a3bc2c0eff79b53b236d7010687becdb","observation_id":"d9653dec-3380-4c78-8316-8b21d5210f57","resolution":{"observed_at":"2026-08-06T21:53:00.558586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:12.065254Z","title":"Large-scale point cloud semantic segmentation with superpoint graphs","venue":null,"work_id":"c2f9984e-61e9-424d-8cc1-a15f0c96eeac","year":2018},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-14T06:19:39.931283Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T21:53:00.644188Z"},"links":{"citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:b745816e9addbbe1a31f3bdde930951ad2147686418bf668712504f122401471","observation_id":"b4becde9-e5fd-46d0-80c8-0fe3f452cab6","resolution":{"observed_at":"2026-08-06T21:53:12.158422Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:11.861173Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":"721174e6-779e-4bb9-abfe-c76079dad402","year":2023},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-14T06:19:39.931283Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T21:53:00.717881Z"},"links":{"citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:f0ea4fe6ef36911122c2daea72a2343de88159f65dc31a730e72f004f3d7fc58","observation_id":"dc14eb7e-771a-4c7f-b789-4daefd08ace7","resolution":{"observed_at":"2026-08-06T21:53:11.967553Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03327","last_updated":"2024-01-09T06:20:23Z","snapshot_observed_at":"2026-08-13T04:46:49.515800Z","submitted_at":"2024-01-09T06:20:23Z","title":"Uni3D-LLM: Unifying Point Cloud Perception, Generation and Editing with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03327","snapshot_observed_at":"2026-08-06T21:53:00.799961Z","title":"Uni3d-llm: Unifying point cloud perception, generation and editing with large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-14T06:19:39.931283Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T21:53:00.799961Z"},"links":{"cited_paper":"/paper/2402.03327","citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:30128a6d6756fe08884245c994e6fd3d19356d0755f8f7a3db0016d89d3aa105","observation_id":"3ea31733-91bf-48ee-8dce-ef838f65b9e2","resolution":{"observed_at":"2026-08-06T21:53:00.799961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-09T20:34:52.923500Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-06T21:53:00.901821Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-14T06:19:39.931283Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T21:53:00.901821Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:eb07cf573237c6a9d29b2ecfeaa2d1f386fd12373f061778383747039017ed0a","observation_id":"c4d0f4aa-fc8b-469b-bf92-4d7ef8153b75","resolution":{"observed_at":"2026-08-06T21:53:00.901821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07474","last_updated":"2023-04-12T20:05:41Z","snapshot_observed_at":"2026-08-13T14:05:27.706416Z","submitted_at":"2022-10-14T02:52:26Z","title":"SQA3D: Situated Question Answering in 3D Scenes","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.07474","snapshot_observed_at":"2026-08-06T21:53:00.971816Z","title":"Sqa3d: Situated question answering in 3d scenes","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-14T06:19:39.931283Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T21:53:00.971816Z"},"links":{"cited_paper":"/paper/2210.07474","citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:8c17109d7fc95900bc62fd031e878b4d4e34818feecca87135a9721824fb0f42","observation_id":"27d46f3b-d777-4076-b839-5e64e9a65f93","resolution":{"observed_at":"2026-08-06T21:53:00.971816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:11.679247Z","title":"An end-to-end transformer model for 3d object detection","venue":null,"work_id":"daff00a6-c8c8-4dad-9b01-6429ae4450b3","year":2021},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-14T06:19:39.931283Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T21:53:01.046044Z"},"links":{"citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:92fa17b9bdd92a73480e89c11075b2dc6d7bf1cf04b2a0a2dc60df9534948a90","observation_id":"146b51d3-c45f-413a-90dd-24a29d730431","resolution":{"observed_at":"2026-08-06T21:53:11.753791Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:11.515115Z","title":"Boosting few-shot 3d point cloud segmentation via query-guided enhancement","venue":null,"work_id":"6c4114f3-542e-43c9-812a-59609f66cd87","year":1904},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-14T06:19:39.931283Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T21:53:01.149234Z"},"links":{"citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:8b5c61b2d91fd117aa60db19cee950b172eb0dde94c81fd7d31a73c5b71cdd10","observation_id":"dd071416-a327-43c7-a1db-a6996a849c5f","resolution":{"observed_at":"2026-08-06T21:53:11.575644Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:11.317482Z","title":"Hierarchi- cal dense correlation distillation for few-shot segmentation","venue":null,"work_id":"4a755f0c-a501-4e65-b163-a2e6e8d318a6","year":2023},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-14T06:19:39.931283Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T21:53:01.255571Z"},"links":{"citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:a935c38527db4997d994351ddae11100f1dbcf3b5e8cc437c9cb640ad0249da3","observation_id":"50ced8bf-31e5-4b03-8fc6-e2c65b4f4d2d","resolution":{"observed_at":"2026-08-06T21:53:11.421226Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07470","last_updated":"2024-04-11T04:22:15Z","snapshot_observed_at":"2026-08-13T00:32:57.927307Z","submitted_at":"2024-04-11T04:22:15Z","title":"Scalable Language Model with Generalized Continual Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07470","snapshot_observed_at":"2026-08-06T21:53:01.348484Z","title":"Scalable language model with generalized contin- ual learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-14T06:19:39.931283Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T21:53:01.348484Z"},"links":{"cited_paper":"/paper/2404.07470","citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:92634b9342997cf9f54a9181b2c797b3b2e8dd850aa37d1ab1cd0c29634c88e0","observation_id":"f7cae70b-0dc2-4b0c-8eb7-ce7ca5f1d669","resolution":{"observed_at":"2026-08-06T21:53:01.348484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:11.081413Z","title":"Oa-cnns: Omni- adaptive sparse cnns for 3d semantic segmentation","venue":null,"work_id":"5e99ffc0-17f1-473c-a590-23a50795ac21","year":2024},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-14T06:19:39.931283Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T21:53:01.438300Z"},"links":{"citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:a202983661aab1d5c2f9d7c7f942e118d5410b3e37aecbd604fe56a76f2f9b1f","observation_id":"584d8855-8324-4fd3-aae2-bdc8b758c3ba","resolution":{"observed_at":"2026-08-06T21:53:11.173646Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:01.538579Z","title":"Openscene: 3d scene understanding with open vocabularies","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-14T06:19:39.931283Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T21:53:01.538579Z"},"links":{"citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:7a7e03d5ee795cf8d24c33e897f79b1874d116679344e683f0b54440aaeaff4f","observation_id":"0d582eb0-37e5-4246-a451-0eb88695eccc","resolution":{"observed_at":"2026-08-06T21:53:01.538579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:10.911005Z","title":"Explore the potential of clip for training-free open vocab- ulary semantic segmentation","venue":null,"work_id":"dfe0c110-d997-4140-9b35-82fbc143cc3f","year":2024},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-14T06:19:39.931283Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T21:53:01.634815Z"},"links":{"citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:5be6fa9977606d115777315981a4390923f9954f6edc5e926904782a79b61208","observation_id":"56dc775b-f6a2-446e-a8c0-172202b6e50c","resolution":{"observed_at":"2026-08-06T21:53:10.983916Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:10.738470Z","title":"Pointr- cnn: 3d object proposal generation and detection from point cloud","venue":null,"work_id":"1d9bb422-6ea6-4537-8785-9ca3a0bd0fd6","year":null},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-14T06:19:39.931283Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T21:53:01.702626Z"},"links":{"citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:c41930bc26666c1ca7b7e0430eb035fc05e59a66a7fee5ca2bf83292e57bf091","observation_id":"61f5a869-bb7a-4f88-b675-271d3b0fe13b","resolution":{"observed_at":"2026-08-06T21:53:10.816844Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13631","last_updated":"2023-10-29T14:04:25Z","snapshot_observed_at":"2026-08-13T11:10:28.688404Z","submitted_at":"2023-06-23T17:36:44Z","title":"OpenMask3D: Open-Vocabulary 3D Instance Segmentation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13631","snapshot_observed_at":"2026-08-06T21:53:01.780508Z","title":"Open- mask3d: Open-vocabulary 3d instance segmentation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-14T06:19:39.931283Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T21:53:01.780508Z"},"links":{"cited_paper":"/paper/2306.13631","citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:f12cf8641577579ce2cd4741d199e07e2644ec854fad2d278b5ce2f343da1672","observation_id":"1096ace6-d48f-4595-b0ac-f2ab5e1a36b7","resolution":{"observed_at":"2026-08-06T21:53:01.780508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:10.497389Z","title":"Mind the interference: Retaining pre-trained knowledge in parameter efficient continual learning of vision-language models","venue":null,"work_id":"268fd848-1082-4750-a2ac-de706853b77e","year":2024},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-14T06:19:39.931283Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T21:53:01.855126Z"},"links":{"citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:91267504dc34a823d20b8ce66ee15c81239475b20c383098ba41f7c9ed1476c6","observation_id":"78a01afb-911b-4a4b-b494-590f26f7df4c","resolution":{"observed_at":"2026-08-06T21:53:10.628744Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:10.312428Z","title":"Learning shape-aware embedding for scene text detection","venue":null,"work_id":"496399f6-a298-4173-9625-804d12f406da","year":2019},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-14T06:19:39.931283Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T21:53:01.946814Z"},"links":{"citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:daaf4e373e78dcaa056b54c88e5374d9d967eadf2b8c6500ad2dd8b2162c43d8","observation_id":"934c49e3-811d-49b1-b6ca-78cb5612802d","resolution":{"observed_at":"2026-08-06T21:53:10.428096Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:10.091141Z","title":"Prior guided feature enrich- ment network for few-shot segmentation","venue":null,"work_id":"3b05af9f-e9ab-4bc0-8bf8-12efec1c6bc5","year":2020},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-14T06:19:39.931283Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T21:53:02.042318Z"},"links":{"citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:91935ff40341b82e6c872992d4cc67be61c5fbb372aca3b115de7791e7a55999","observation_id":"0c26d983-be1a-410b-ae62-43726fbc61fc","resolution":{"observed_at":"2026-08-06T21:53:10.189030Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:09.883184Z","title":"Adaptive perspective distillation for semantic segmen- tation","venue":null,"work_id":"9c765bd4-2abc-4c77-8d4f-c41795d40434","year":2022},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-14T06:19:39.931283Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T21:53:02.106679Z"},"links":{"citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:ac0a423d781fb1985919d31b0c11b82fd85c44929cf6d7d7c2e25efba9c8112a","observation_id":"8e314eef-7b3c-45b6-b717-432117460287","resolution":{"observed_at":"2026-08-06T21:53:09.980659Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:09.673192Z","title":"Generalized few-shot semantic segmentation","venue":null,"work_id":"ba9fe601-ea8e-4a8e-a01f-458f83749df2","year":2022},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-14T06:19:39.931283Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T21:53:02.173893Z"},"links":{"citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:e92492aca5b1b9210b276972822c99d43dfbbf2e95c47182babe937720c4cd6e","observation_id":"17d04d7b-54fd-4bcc-8dec-367477883c72","resolution":{"observed_at":"2026-08-06T21:53:09.786638Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:09.520794Z","title":"Learning context-aware classifier for semantic segmentation","venue":null,"work_id":"6291194a-edce-4581-9980-2b472e3e1640","year":2023},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-14T06:19:39.931283Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T21:53:02.264287Z"},"links":{"citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:46e702326543701168154fe5462d6895e9f1b6c5866cd086c96f90e5de80e18b","observation_id":"8cc5ac61-fe44-428f-8d39-d6f24a46680b","resolution":{"observed_at":"2026-08-06T21:53:09.577862Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.08769","last_updated":"2023-08-17T03:52:15Z","snapshot_observed_at":"2026-08-13T10:33:17.141989Z","submitted_at":"2023-08-17T03:52:15Z","title":"Chat-3D: Data-efficiently Tuning Large Language Model for Universal Dialogue of 3D Scenes","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.08769","snapshot_observed_at":"2026-08-06T21:53:02.361077Z","title":"Chat-3d: Data-efficiently tuning large language model for universal dialogue of 3d scenes","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-14T06:19:39.931283Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T21:53:02.361077Z"},"links":{"cited_paper":"/paper/2308.08769","citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:2929a49e5efc220cb51dbc6ca9f73bb58fecfbd8c49b82126d242898cfbe1ede","observation_id":"04974178-964d-4fc1-abcf-d397d4456184","resolution":{"observed_at":"2026-08-06T21:53:02.361077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-08-13T20:29:03.722242Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.04671","snapshot_observed_at":"2026-08-06T21:53:02.436049Z","title":"Visual chatgpt: Talking, drawing and editing with visual foundation models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-14T06:19:39.931283Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T21:53:02.436049Z"},"links":{"cited_paper":"/paper/2303.04671","citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:a7c609f28d0ea2cfc5f4b5e7468ec35346d174385b6d9ccfaacf36c10f476b6c","observation_id":"19030596-2323-44f8-bf0a-ff83d7969880","resolution":{"observed_at":"2026-08-06T21:53:02.436049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16911","last_updated":"2024-09-06T22:45:43Z","snapshot_observed_at":"2026-08-13T10:23:06.063904Z","submitted_at":"2023-08-31T17:59:46Z","title":"PointLLM: Empowering Large Language Models to Understand Point Clouds","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.16911","snapshot_observed_at":"2026-08-06T21:53:02.513697Z","title":"Pointllm: Empowering large language models to understand point clouds","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-14T06:19:39.931283Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T21:53:02.513697Z"},"links":{"cited_paper":"/paper/2308.16911","citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:f9d829ef8c6d9b5f85687017ec742c7dd81359c7d8c2d9b58ab40b3f9bae6823","observation_id":"8e24a87e-fa6e-47ec-80aa-350393141259","resolution":{"observed_at":"2026-08-06T21:53:02.513697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:09.351581Z","title":"Llm- grounder: Open-vocabulary 3d visual grounding with large language model as an agent","venue":null,"work_id":"c8eb1879-d152-452d-bfa0-8960cb6018d1","year":2024},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-14T06:19:39.931283Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T21:53:02.621278Z"},"links":{"citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:37cdcef9dbe7fae49057a709bdbb822478d06e77688e496401f3e3194503e33a","observation_id":"cd0acc59-f07b-445c-a6af-dd175fe92d31","resolution":{"observed_at":"2026-08-06T21:53:09.433475Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.17240","last_updated":"2024-01-22T06:53:23Z","snapshot_observed_at":"2026-08-13T04:52:37.935795Z","submitted_at":"2023-12-28T18:58:33Z","title":"LISA++: An Improved Baseline for Reasoning Segmentation with Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.17240","snapshot_observed_at":"2026-08-06T21:53:02.670233Z","title":"Lisa++: An improved baseline for reasoning segmentation with large language model.arXiv preprint arXiv:2312.17240, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-14T06:19:39.931283Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T21:53:02.670233Z"},"links":{"cited_paper":"/paper/2312.17240","citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:a775c227d677d69a2562d7c8967a3d305088bf6d03841a6213959f5c571eadc9","observation_id":"222944e9-9eef-4452-891d-bcb190a9e218","resolution":{"observed_at":"2026-08-06T21:53:02.670233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:09.219874Z","title":"Unified language-driven zero-shot domain adaptation","venue":null,"work_id":"4d130971-04f8-4c52-9e25-d9b6e20c8d2f","year":2024},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-14T06:19:39.931283Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T21:53:02.785477Z"},"links":{"citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:d122914445e9dacbc4b013f49684c739b9e2d33be9eb594356dc21b1be552b3e","observation_id":"691d61e1-8cbe-46c6-bf68-9bd49f55c352","resolution":{"observed_at":"2026-08-06T21:53:09.286190Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:09.076750Z","title":"Visionzip: Longer is better but not necessary in vision language models","venue":null,"work_id":"5ca6c3fa-ec68-4592-80d5-1892f970d439","year":2025},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-14T06:19:39.931283Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T21:53:02.857736Z"},"links":{"citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:c3e50b1bb3f6542f991ed7e4ca9b887dd9ccd44cf9ffa77cb658ffaeef485171","observation_id":"e364c948-8f20-4ccd-9c55-f72f539d2bca","resolution":{"observed_at":"2026-08-06T21:53:09.155714Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.11381","last_updated":"2023-03-20T18:31:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-20T18:31:47Z","title":"MM-REACT: Prompting ChatGPT for Multimodal Reasoning and Action","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.11381","snapshot_observed_at":"2026-08-06T21:53:02.923647Z","title":"Mm-react: Prompting chatgpt for multimodal reasoning and action","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-14T06:19:39.931283Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T21:53:02.923647Z"},"links":{"cited_paper":"/paper/2303.11381","citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:9807e449a7b3ee964d259d829f365e362f146ec8c0884202b663d04b5e6c34b3","observation_id":"59b157f9-8fa1-4d26-9496-c327aeed8fc7","resolution":{"observed_at":"2026-08-06T21:53:02.923647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14178","last_updated":"2024-03-29T08:13:38Z","snapshot_observed_at":"2026-08-13T08:24:19.015641Z","submitted_at":"2023-04-27T13:27:01Z","title":"mPLUG-Owl: Modularization Empowers Large Language Models with Multimodality","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.14178","snapshot_observed_at":"2026-08-06T21:53:02.977100Z","title":"mplug-owl: Modularization empowers large language models with multimodality","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-14T06:19:39.931283Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T21:53:02.977100Z"},"links":{"cited_paper":"/paper/2304.14178","citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:c4259823c6a85240ff5a0c705731057c7ac5c2519cdf3f3fa38216478d7e3a13","observation_id":"5ab31b1a-6074-49f5-a2cf-f4ec5ac7f4da","resolution":{"observed_at":"2026-08-06T21:53:02.977100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-08-06T03:13:37.403059Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-08-06T21:53:03.034745Z","title":"Opt: Open pre-trained trans- former language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-14T06:19:39.931283Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T21:53:03.034745Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:86a7b56bc45d805bcf0a2daa0e24f1ec79fa7e3be2da4e66f92c9bf5b3b26458","observation_id":"944d160a-1c9a-4f48-a492-c43445372d40","resolution":{"observed_at":"2026-08-06T21:53:03.034745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:08.916807Z","title":"Multi3drefer: Grounding text description to multiple 3d objects","venue":null,"work_id":"fda8297b-c292-44b4-bd12-2998a8342e7f","year":2023},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-14T06:19:39.931283Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T21:53:03.093626Z"},"links":{"citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:b2fd55deb3a519967e1d0a61d00d93599b83f60db8edaba7740e6aa32eb4368a","observation_id":"1ea536c1-6748-486c-aed5-8131ee72c7df","resolution":{"observed_at":"2026-08-06T21:53:08.978931Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:08.759363Z","title":"3dvg- transformer: Relation modeling for visual grounding on point clouds","venue":null,"work_id":"4144d986-ebc4-4049-b301-f0515263a069","year":2021},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-14T06:19:39.931283Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T21:53:03.159558Z"},"links":{"citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:bb2017c83e28377f90a491d64890289fa55ee62b468613c6c81ff171894e2d87","observation_id":"ce0c7d61-939f-4525-b2a1-c6a915a0a248","resolution":{"observed_at":"2026-08-06T21:53:08.839030Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01525","last_updated":"2024-07-17T07:07:43Z","snapshot_observed_at":"2026-08-12T23:31:02.336155Z","submitted_at":"2024-07-01T17:59:35Z","title":"ScanReason: Empowering 3D Visual Grounding with Reasoning Capabilities","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01525","snapshot_observed_at":"2026-08-06T21:53:03.225641Z","title":"Empowering 3d visual grounding with reasoning capabilities","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-14T06:19:39.931283Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T21:53:03.225641Z"},"links":{"cited_paper":"/paper/2407.01525","citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:ddb383e5d40c1bad6e2a9c40c01b6139eb439441a48a10d0b0fb2f9283b789b8","observation_id":"5fd12392-a455-441a-8630-a817b0b433fe","resolution":{"observed_at":"2026-08-06T21:53:03.225641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-06T21:53:03.285974Z","title":"Minigpt-4: Enhancing vision-language understanding with advanced large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-14T06:19:39.931283Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T21:53:03.285974Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:834d6158e232f987a1f5a8ab0892134f3f8cc0e9f0171dcd89748004869d6978","observation_id":"8820c6be-a73e-4ae8-a85b-38ae4e588bf0","resolution":{"observed_at":"2026-08-06T21:53:03.285974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:08.560310Z","title":"in the right of","venue":null,"work_id":"e3efdace-61c7-4881-a0ca-365a958812a4","year":2023},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-14T06:19:39.931283Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T21:53:03.364743Z"},"links":{"citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:6288518ea39862652c99e6ac4f0f6a477ca5517883bbc37c9468181d7db8fb09","observation_id":"c264643a-7b76-4de0-9b77-f692ca3febba","resolution":{"observed_at":"2026-08-06T21:53:08.641534Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:08.409073Z","title":"Focus on detecting and distinguishing objects","venue":null,"work_id":"7c57570b-7690-4c73-b6b3-b89d7ca63673","year":null},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-14T06:19:39.931283Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T21:53:03.415149Z"},"links":{"citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:415a9c1eea83d9e4773b12ef2403ec28008bdf26e44cd8849e12e0275f2345cf","observation_id":"79c14c01-dd42-438c-8312-73dd76869e8b","resolution":{"observed_at":"2026-08-06T21:53:08.491329Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:08.258244Z","title":null,"venue":null,"work_id":"6c529cca-ee5c-47e3-a393-953b7e164914","year":null},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-14T06:19:39.931283Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T21:53:03.466751Z"},"links":{"citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:33f180b61fe665e4ed62c6cb863e252dbac9080d1cd810f927aa1f34fbbc84c7","observation_id":"325f6a96-a76f-4951-8e96-bad0ba2a8387","resolution":{"observed_at":"2026-08-06T21:53:08.344472Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:08.083986Z","title":null,"venue":null,"work_id":"02620e1d-4f84-437b-92b6-8cdd92a39d6e","year":null},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-14T06:19:39.931283Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T21:53:03.522108Z"},"links":{"citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:e9ceb64bfbdb1e6e16c2316892370d9ac4a14f5c49a22206e313ca097b3b9e4d","observation_id":"05db9656-4a26-484c-add9-192c02bf0113","resolution":{"observed_at":"2026-08-06T21:53:08.151275Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:07.944779Z","title":null,"venue":null,"work_id":"2dc41ce9-addf-43ad-a1b0-ca78cc69ebc9","year":null},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-14T06:19:39.931283Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T21:53:03.581218Z"},"links":{"citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:443490ac7684d82f5f20d82e52e28ba00540cb58193cee8777b6b107ca90e74a","observation_id":"560ad566-91ec-441d-af03-e42af7682409","resolution":{"observed_at":"2026-08-06T21:53:08.004162Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:07.737904Z","title":null,"venue":null,"work_id":"1afa169b-07d3-4c92-ad55-126e3a0a53c2","year":null},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-14T06:19:39.931283Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T21:53:03.628077Z"},"links":{"citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:25e18fac144b385e685387216d5928fd760f7ffa42058d02057797ae90cfa54a","observation_id":"61cf7d28-9358-4867-85b6-8c1c07519fab","resolution":{"observed_at":"2026-08-06T21:53:07.821554Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:07.597115Z","title":null,"venue":null,"work_id":"f8d44fc5-f9ba-4014-a1eb-988eb99f504d","year":null},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-14T06:19:39.931283Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T21:53:03.675226Z"},"links":{"citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:28a852a83e18332e9ba398c38f3236e41bcc206ee2cee6867dda6fee980bf5a9","observation_id":"ac8e90e1-e941-4283-8a6f-0a8799e076db","resolution":{"observed_at":"2026-08-06T21:53:07.673168Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:07.307565Z","title":"For multiple objects of the same category, use [<ins_id>][<ins_id>][<ins_id>], etc","venue":null,"work_id":"f8abeb94-bb9b-4a39-bdb8-3fb2bdd8b99b","year":null},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-14T06:19:39.931283Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T21:53:03.739329Z"},"links":{"citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:442f9753ba40554fb7005af9b6e47826f99eeb818324c1adec09673080b9bc11","observation_id":"ba3b2e56-4854-4d61-ad78-6809cc68d482","resolution":{"observed_at":"2026-08-06T21:53:07.463313Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:06.963959Z","title":null,"venue":null,"work_id":"929158fd-cbf0-4d99-a210-ea36ca744855","year":null},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-14T06:19:39.931283Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T21:53:03.785678Z"},"links":{"citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:637f52e42fa33ede15e69f5028b8853fbaceb307b4d9c9b5c01a5ef8b94704f7","observation_id":"90115f2d-f5d1-4533-8061-275982f0466d","resolution":{"observed_at":"2026-08-06T21:53:07.134037Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:06.648244Z","title":null,"venue":null,"work_id":"b39d25d0-3117-4b0e-bc01-bece9656d388","year":null},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-14T06:19:39.931283Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T21:53:03.839144Z"},"links":{"citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:4b578da7bff7630a508589dcf08e6095cb60e60e54dc4f8c5fe6d03f3fd98c59","observation_id":"83c98ba2-e58d-42af-8cde-eca333407c73","resolution":{"observed_at":"2026-08-06T21:53:06.791230Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:06.355297Z","title":"Don't output anything else","venue":null,"work_id":"8771a57c-2523-4587-87b7-f7058898442a","year":null},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-14T06:19:39.931283Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T21:53:03.898635Z"},"links":{"citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:ef9ae38cb54e6ef6582088c559bec2a3ec2e1dca2ab930f0133f4146af9c84fd","observation_id":"684938be-0073-4770-8639-a5573a11fc08","resolution":{"observed_at":"2026-08-06T21:53:06.518179Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:06.034235Z","title":"Analyze the properties and spatial relationship of objects in the scene","venue":null,"work_id":"cb70d54a-c9b3-4ecd-8ab7-2f741f01549d","year":null},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-14T06:19:39.931283Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T21:53:03.961199Z"},"links":{"citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:b9ad1557899ee74787ef491a95cb54613bade2f8859a288c33d535f784511396","observation_id":"dfe122b5-8d40-4404-9fa1-d59bf2f82354","resolution":{"observed_at":"2026-08-06T21:53:06.182178Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:05.817853Z","title":"Don't output anything else","venue":null,"work_id":"71244d5c-3465-476f-b230-f02120b0c719","year":null},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-14T06:19:39.931283Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-06T21:53:04.025687Z"},"links":{"citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:df03b4cb8d1fb926878c48a0db3824417be597ebb0fee3b5443c88f176faee61","observation_id":"555da127-ea1a-47e9-93b8-43a22e8f0a3c","resolution":{"observed_at":"2026-08-06T21:53:05.893817Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:05.613628Z","title":null,"venue":null,"work_id":"d8aed0b1-580a-4b31-a8de-e167c798cd72","year":null},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-14T06:19:39.931283Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-06T21:53:04.088203Z"},"links":{"citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:cfb1f4bbe86174ee67667521168662a2257bbfa9f3cfac8e811e83a65f2a77c5","observation_id":"1dc3a3b7-e30e-4d0a-a3b0-e4bf029bbf62","resolution":{"observed_at":"2026-08-06T21:53:05.705709Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:05.413608Z","title":"Analyze the description and identify description-related objects","venue":null,"work_id":"ef4f85ff-bbaa-492a-9a91-4deb9c417ce7","year":null},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-14T06:19:39.931283Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-06T21:53:04.123579Z"},"links":{"citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:910c82e615e92264d4038fb8a63053d321bb7f43e2f0c1daa5675bb0046bc7da","observation_id":"0c966068-2eff-4233-b2eb-aea3fb3858e4","resolution":{"observed_at":"2026-08-06T21:53:05.526378Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:05.149101Z","title":"Don't output any other things","venue":null,"work_id":"44872d76-9a90-47f2-b837-4a86fb8afa58","year":null},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-14T06:19:39.931283Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-06T21:53:04.127385Z"},"links":{"citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:39c32deada190560654222341e0279d3da28fc17498d6df10ef9aa1381a7b299","observation_id":"4ab6c0e7-5250-42a7-a73c-9fe22efa05d4","resolution":{"observed_at":"2026-08-06T21:53:05.267420Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-14T06:19:39.931283Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation"},"reference_resolution":{"displayed":77,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":34,"verified_exact":2,"verified_fuzzy":41},"total_outbound_references":77},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 77 of 77 outbound references and 1 inbound Pith citation observation for arXiv:2506.23120."}