{"as_of":"2026-08-15T06:39:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:767450df700b063d16afef77efbdb6ddb25addfd8dfd509d3d649fe1186d2e61","coverage":[{"denominator":108,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:37:28.194043Z","state":"measured"},{"denominator":111,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":111,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":11,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":11,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T00:33:58.615197Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":1,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.01853","last_updated":"2025-06-02T16:40:50Z","snapshot_observed_at":"2026-08-15T01:34:26.509428Z","submitted_at":"2025-06-02T16:40:50Z","title":"ShapeLLM-Omni: A Native Multimodal LLM for 3D Generation and Understanding","version":1},"cited_work":{"arxiv_id":"2506.01853","doi":"10.48550/arxiv.2506.01853","metadata_source":"pith","pith_arxiv_id":"2506.01853","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Shapellm-omni: A native multimodal llm for 3d generation and understanding","venue":"cs.CV","work_id":"73f433f2-f35d-451f-9b31-253bb2f4edc6","year":2025},"citing_paper":{"arxiv_id":"2512.13030","last_updated":"2025-12-25T08:16:05Z","snapshot_observed_at":"2026-07-06T22:38:59.725645Z","submitted_at":"2025-12-15T06:58:40Z","title":"Motus: A Unified Latent Action World Model","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-12T18:44:36.636455Z"},"links":{"cited_paper":"/paper/2506.01853","citing_paper":"/paper/2512.13030"},"observation_digest":"sha256:3131101dbf0d04ded779ecfc7d5fda8bea421f8b76c81d778c9aa366a2586cc2","observation_id":"49058870-ee52-4be4-a8da-900f9056dd8e","resolution":{"observed_at":"2026-05-12T18:44:36.865476Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01853","last_updated":"2025-06-02T16:40:50Z","snapshot_observed_at":"2026-08-15T01:34:26.509428Z","submitted_at":"2025-06-02T16:40:50Z","title":"ShapeLLM-Omni: A Native Multimodal LLM for 3D Generation and Understanding","version":1},"cited_work":{"arxiv_id":"2506.01853","doi":"10.48550/arxiv.2506.01853","metadata_source":"pith","pith_arxiv_id":"2506.01853","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Shapellm-omni: A native multimodal llm for 3d generation and understanding","venue":"cs.CV","work_id":"73f433f2-f35d-451f-9b31-253bb2f4edc6","year":2025},"citing_paper":{"arxiv_id":"2601.21798","last_updated":"2026-05-15T11:47:00Z","snapshot_observed_at":"2026-08-02T04:56:07.337606Z","submitted_at":"2026-01-29T14:42:46Z","title":"CG-MLLM: Captioning and Generating 3D content via Multi-modal Large Language Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-21T14:48:21.787919Z"},"links":{"cited_paper":"/paper/2506.01853","citing_paper":"/paper/2601.21798"},"observation_digest":"sha256:d745aa3b5bf606fabd2722ec70119727d980f29a34d2afee5f471b492f6a3c1e","observation_id":"6e979359-e9ca-4a99-8336-e3b74fc31a21","resolution":{"observed_at":"2026-05-21T14:50:14.832521Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01853","last_updated":"2025-06-02T16:40:50Z","snapshot_observed_at":"2026-08-15T01:34:26.509428Z","submitted_at":"2025-06-02T16:40:50Z","title":"ShapeLLM-Omni: A Native Multimodal LLM for 3D Generation and Understanding","version":1},"cited_work":{"arxiv_id":"2506.01853","doi":"10.48550/arxiv.2506.01853","metadata_source":"pith","pith_arxiv_id":"2506.01853","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Shapellm-omni: A native multimodal llm for 3d generation and understanding","venue":"cs.CV","work_id":"73f433f2-f35d-451f-9b31-253bb2f4edc6","year":2025},"citing_paper":{"arxiv_id":"2604.11789","last_updated":"2026-04-20T14:38:53Z","snapshot_observed_at":"2026-08-09T05:10:13.009841Z","submitted_at":"2026-04-13T17:55:02Z","title":"LMMs Meet Object-Centric Vision: Understanding, Segmentation, Editing and Generation","version":2},"reference_index":206,"source":"pdf_text","source_observed_at":"2026-05-10T15:35:37.095627Z"},"links":{"cited_paper":"/paper/2506.01853","citing_paper":"/paper/2604.11789"},"observation_digest":"sha256:1bb1811d26fe1c3b2d69488995adc95e0fd6ab2f98e3a73c7014801abbb97008","observation_id":"1205b8f5-5fd6-45e7-9e5a-66869ba40c08","resolution":{"observed_at":"2026-05-11T10:11:04.533037Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01853","last_updated":"2025-06-02T16:40:50Z","snapshot_observed_at":"2026-08-15T01:34:26.509428Z","submitted_at":"2025-06-02T16:40:50Z","title":"ShapeLLM-Omni: A Native Multimodal LLM for 3D Generation and Understanding","version":1},"cited_work":{"arxiv_id":"2506.01853","doi":"10.48550/arxiv.2506.01853","metadata_source":"pith","pith_arxiv_id":"2506.01853","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Shapellm-omni: A native multimodal llm for 3d generation and understanding","venue":"cs.CV","work_id":"73f433f2-f35d-451f-9b31-253bb2f4edc6","year":2025},"citing_paper":{"arxiv_id":"2605.01365","last_updated":"2026-05-02T10:21:13Z","snapshot_observed_at":"2026-07-06T23:14:38.379875Z","submitted_at":"2026-05-02T10:21:13Z","title":"VoxAfford: Multi-Scale Voxel-Token Fusion for Open-Vocabulary 3D Affordance Detection","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-09T15:26:50.289626Z"},"links":{"cited_paper":"/paper/2506.01853","citing_paper":"/paper/2605.01365"},"observation_digest":"sha256:983cb1723f89c049a618e88acdf8bbab63aa0269cf9f7382b32c4960b3d59741","observation_id":"b674a98d-3a17-4bfc-bbc8-a7776f48ac9e","resolution":{"observed_at":"2026-05-11T16:41:12.157141Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01853","last_updated":"2025-06-02T16:40:50Z","snapshot_observed_at":"2026-08-15T01:34:26.509428Z","submitted_at":"2025-06-02T16:40:50Z","title":"ShapeLLM-Omni: A Native Multimodal LLM for 3D Generation and Understanding","version":1},"cited_work":{"arxiv_id":"2506.01853","doi":"10.48550/arxiv.2506.01853","metadata_source":"pith","pith_arxiv_id":"2506.01853","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Shapellm-omni: A native multimodal llm for 3d generation and understanding","venue":"cs.CV","work_id":"73f433f2-f35d-451f-9b31-253bb2f4edc6","year":2025},"citing_paper":{"arxiv_id":"2605.16745","last_updated":"2026-05-16T01:55:03Z","snapshot_observed_at":"2026-08-14T15:45:22.257635Z","submitted_at":"2026-05-16T01:55:03Z","title":"EVA01: Unified Native 3D Understanding and Generation via Mixture-of-Transformers","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-05-19T21:26:36.707554Z"},"links":{"cited_paper":"/paper/2506.01853","citing_paper":"/paper/2605.16745"},"observation_digest":"sha256:4ccbb9c667a727f35936b99cab2d91bdf0a5c3604df37bd238730499b34c6dc4","observation_id":"be4efb64-eb67-4096-88c9-579956d8c3fc","resolution":{"observed_at":"2026-05-19T21:27:47.816722Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01853","last_updated":"2025-06-02T16:40:50Z","snapshot_observed_at":"2026-08-15T01:34:26.509428Z","submitted_at":"2025-06-02T16:40:50Z","title":"ShapeLLM-Omni: A Native Multimodal LLM for 3D Generation and Understanding","version":1},"cited_work":{"arxiv_id":"2506.01853","doi":"10.48550/arxiv.2506.01853","metadata_source":"pith","pith_arxiv_id":"2506.01853","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Shapellm-omni: A native multimodal llm for 3d generation and understanding","venue":"cs.CV","work_id":"73f433f2-f35d-451f-9b31-253bb2f4edc6","year":2025},"citing_paper":{"arxiv_id":"2605.21572","last_updated":"2026-05-20T17:59:01Z","snapshot_observed_at":"2026-08-12T21:19:57.922603Z","submitted_at":"2026-05-20T17:59:01Z","title":"PhysX-Omni: Unified Simulation-Ready Physical 3D Generation for Rigid, Deformable, and Articulated Objects","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-22T09:39:48.573379Z"},"links":{"cited_paper":"/paper/2506.01853","citing_paper":"/paper/2605.21572"},"observation_digest":"sha256:61803adc787e7023dd7c660ff3ec5763d689a899fffca6496612d26fed44cdaa","observation_id":"f772d536-8266-4d3e-a899-6807867d5ea2","resolution":{"observed_at":"2026-05-22T09:41:21.940604Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01853","last_updated":"2025-06-02T16:40:50Z","snapshot_observed_at":"2026-08-15T01:34:26.509428Z","submitted_at":"2025-06-02T16:40:50Z","title":"ShapeLLM-Omni: A Native Multimodal LLM for 3D Generation and Understanding","version":1},"cited_work":{"arxiv_id":"2506.01853","doi":"10.48550/arxiv.2506.01853","metadata_source":"pith","pith_arxiv_id":"2506.01853","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Shapellm-omni: A native multimodal llm for 3d generation and understanding","venue":"cs.CV","work_id":"73f433f2-f35d-451f-9b31-253bb2f4edc6","year":2025},"citing_paper":{"arxiv_id":"2605.28548","last_updated":"2026-05-27T14:39:42Z","snapshot_observed_at":"2026-08-05T18:31:00.706002Z","submitted_at":"2026-05-27T14:39:42Z","title":"GEM: Generative Supervision Helps Embodied Intelligence","version":1},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-06-29T13:38:27.263726Z"},"links":{"cited_paper":"/paper/2506.01853","citing_paper":"/paper/2605.28548"},"observation_digest":"sha256:0fa84e307d0814980fdf8a4b11605b3f4e583d9f42ab9d947d8f435c3e328275","observation_id":"34de4d10-d593-4454-b3e4-34752fbae90a","resolution":{"observed_at":"2026-06-29T13:43:28.911677Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01853","last_updated":"2025-06-02T16:40:50Z","snapshot_observed_at":"2026-08-15T01:34:26.509428Z","submitted_at":"2025-06-02T16:40:50Z","title":"ShapeLLM-Omni: A Native Multimodal LLM for 3D Generation and Understanding","version":1},"cited_work":{"arxiv_id":"2506.01853","doi":"10.48550/arxiv.2506.01853","metadata_source":"pith","pith_arxiv_id":"2506.01853","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Shapellm-omni: A native multimodal llm for 3d generation and understanding","venue":"cs.CV","work_id":"73f433f2-f35d-451f-9b31-253bb2f4edc6","year":2025},"citing_paper":{"arxiv_id":"2606.30673","last_updated":"2026-06-25T18:29:06Z","snapshot_observed_at":"2026-08-14T13:37:58.542803Z","submitted_at":"2026-06-25T18:29:06Z","title":"PolyFlow: Continuous Topology Embedding Flow Matching for Artist-style Mesh Generation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-01T06:54:22.727115Z"},"links":{"cited_paper":"/paper/2506.01853","citing_paper":"/paper/2606.30673"},"observation_digest":"sha256:c8c4e8c7bdf134b6247db6991bec5b247c0a269fdf3d8ee2025c28182514ed5a","observation_id":"286806b0-ee16-4238-944e-efafdf6ea434","resolution":{"observed_at":"2026-07-01T06:55:28.946818Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01853","last_updated":"2025-06-02T16:40:50Z","snapshot_observed_at":"2026-08-15T01:34:26.509428Z","submitted_at":"2025-06-02T16:40:50Z","title":"ShapeLLM-Omni: A Native Multimodal LLM for 3D Generation and Understanding","version":1},"cited_work":{"arxiv_id":"2506.01853","doi":"10.48550/arxiv.2506.01853","metadata_source":"pith","pith_arxiv_id":"2506.01853","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Shapellm-omni: A native multimodal llm for 3d generation and understanding","venue":"cs.CV","work_id":"73f433f2-f35d-451f-9b31-253bb2f4edc6","year":2025},"citing_paper":{"arxiv_id":"2607.06565","last_updated":"2026-07-07T17:59:50Z","snapshot_observed_at":"2026-08-12T23:58:05.299670Z","submitted_at":"2026-07-07T17:59:50Z","title":"ELSA3D: Elastic Semantic Anchoring for Unified 3D Understanding and Generation","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-07-08T01:40:40.690020Z"},"links":{"cited_paper":"/paper/2506.01853","citing_paper":"/paper/2607.06565"},"observation_digest":"sha256:1ace3ea021a47bbf7f28115c5fbca694d452dd82bb6b16fa4e70b670ce558474","observation_id":"2b0a997f-e45c-4d49-a429-70802dad9b4d","resolution":{"observed_at":"2026-07-08T01:44:26.235368Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01853","last_updated":"2025-06-02T16:40:50Z","snapshot_observed_at":"2026-08-15T01:34:26.509428Z","submitted_at":"2025-06-02T16:40:50Z","title":"ShapeLLM-Omni: A Native Multimodal LLM for 3D Generation and Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.01853","snapshot_observed_at":"2026-08-07T00:13:47.730082Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02711","last_updated":"2026-08-13T08:47:57Z","snapshot_observed_at":"2026-08-15T06:15:08.969911Z","submitted_at":"2026-08-03T17:57:11Z","title":"Hunyuan3D-Buffalo 1.0: A Unified Multimodal Model for Scalable 3D Generation, Understanding, and Editing","version":1},"reference_index":102,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:47.730082Z"},"links":{"cited_paper":"/paper/2506.01853","citing_paper":"/paper/2608.02711"},"observation_digest":"sha256:38a61a7b0b37bb72743a3f14125a694addfed7fb43d6f05484819413e915fffb","observation_id":"ee48ee27-38cd-4b2b-bd55-0b9d0bbe1f9d","resolution":{"observed_at":"2026-08-07T00:13:47.730082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01853","last_updated":"2025-06-02T16:40:50Z","snapshot_observed_at":"2026-08-15T01:34:26.509428Z","submitted_at":"2025-06-02T16:40:50Z","title":"ShapeLLM-Omni: A Native Multimodal LLM for 3D Generation and Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.01853","snapshot_observed_at":"2026-08-12T00:33:58.615197Z","title":"ShapeLLM-Omni: A native multimodal llm for 3d generation and understanding.arXiv preprint arXiv:2506.01853, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.08053","last_updated":"2026-08-08T10:39:09Z","snapshot_observed_at":"2026-08-15T06:00:45.269822Z","submitted_at":"2026-08-08T10:39:09Z","title":"PhysX-CoT: Structured Physical Reasoning from a Single Image to Simulation-Ready 3D Assets","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T00:33:58.615197Z"},"links":{"cited_paper":"/paper/2506.01853","citing_paper":"/paper/2608.08053"},"observation_digest":"sha256:7b5bf7371845252a3b11733e517e7735baa90cfb8fc05e913977dc69ae66758c","observation_id":"ffd247c5-ee90-44c9-a736-bfad8d98e0fd","resolution":{"observed_at":"2026-08-12T00:33:58.615197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.01853/citation-record","integrity":"/paper/2506.01853/integrity","json":"/paper/2506.01853/citation-record.json","paper":"/paper/2506.01853"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T11:37:27.654734Z","title":"Gpt-4 technical report.arXiv preprint arXiv:2303.08774, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01853","last_updated":"2025-06-02T16:40:50Z","snapshot_observed_at":"2026-08-15T01:34:26.509428Z","submitted_at":"2025-06-02T16:40:50Z","title":"ShapeLLM-Omni: A Native Multimodal LLM for 3D Generation and Understanding","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:27.654734Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.01853"},"observation_digest":"sha256:2af0fd2debd369b7eb0ff3507fcee24644984efb8ce4493f30531ed0fdfb7236","observation_id":"ba8c87c7-db74-4930-87fd-38483b2ac911","resolution":{"observed_at":"2026-08-07T11:37:27.654734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:37:27.660428Z","title":"Flamingo: a visual language model for few-shot learning.Advances in neural information processing systems, 35:23716–23736, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.01853","last_updated":"2025-06-02T16:40:50Z","snapshot_observed_at":"2026-08-15T01:34:26.509428Z","submitted_at":"2025-06-02T16:40:50Z","title":"ShapeLLM-Omni: A Native Multimodal LLM for 3D Generation and Understanding","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:27.660428Z"},"links":{"citing_paper":"/paper/2506.01853"},"observation_digest":"sha256:f3c3be3b5eb34614c786005ac466cac631b010a1b063a895b3fc41abc8b8a408","observation_id":"26e67a45-0d95-49d2-ad57-f6878b600c9b","resolution":{"observed_at":"2026-08-07T11:37:27.660428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-07T11:37:27.664880Z","title":"Qwen technical report.arXiv preprint arXiv:2309.16609, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01853","last_updated":"2025-06-02T16:40:50Z","snapshot_observed_at":"2026-08-15T01:34:26.509428Z","submitted_at":"2025-06-02T16:40:50Z","title":"ShapeLLM-Omni: A Native Multimodal LLM for 3D Generation and Understanding","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:27.664880Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2506.01853"},"observation_digest":"sha256:ded13fc04a9f329ba180776707ea1916bb3e61dc45a86cf93fe4bfa2df5ad560","observation_id":"98ae7833-6501-422f-982d-d66f178fedaf","resolution":{"observed_at":"2026-08-07T11:37:27.664880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-14T04:17:22.593941Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-07T11:37:27.669361Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01853","last_updated":"2025-06-02T16:40:50Z","snapshot_observed_at":"2026-08-15T01:34:26.509428Z","submitted_at":"2025-06-02T16:40:50Z","title":"ShapeLLM-Omni: A Native Multimodal LLM for 3D Generation and Understanding","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:27.669361Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2506.01853"},"observation_digest":"sha256:4d62ee4b9d8ec18ebcba138f75dbe8b7c1d07595ce92faef97cb4691d1069c34","observation_id":"431a6cff-ab11-49c0-a0af-cbcc2a26e144","resolution":{"observed_at":"2026-08-07T11:37:27.669361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.01401","last_updated":"2021-01-14T05:36:59Z","snapshot_observed_at":"2026-08-13T06:40:48.610500Z","submitted_at":"2018-01-04T15:25:26Z","title":"Demystifying MMD GANs","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.01401","snapshot_observed_at":"2026-08-07T11:37:27.673540Z","title":"Demystifying mmd gans","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.01853","last_updated":"2025-06-02T16:40:50Z","snapshot_observed_at":"2026-08-15T01:34:26.509428Z","submitted_at":"2025-06-02T16:40:50Z","title":"ShapeLLM-Omni: A Native Multimodal LLM for 3D Generation and Understanding","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:27.673540Z"},"links":{"cited_paper":"/paper/1801.01401","citing_paper":"/paper/2506.01853"},"observation_digest":"sha256:a110ed79b050ea42d67892debe3f865eb14ab9bfdcb0af0258702aa613e10db7","observation_id":"7ff1d3cc-2991-4aaa-8022-55e05ba1df37","resolution":{"observed_at":"2026-08-07T11:37:27.673540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:37:27.678469Z","title":"Piqa: Reasoning about physical common- sense in natural language","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.01853","last_updated":"2025-06-02T16:40:50Z","snapshot_observed_at":"2026-08-15T01:34:26.509428Z","submitted_at":"2025-06-02T16:40:50Z","title":"ShapeLLM-Omni: A Native Multimodal LLM for 3D Generation and Understanding","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:27.678469Z"},"links":{"citing_paper":"/paper/2506.01853"},"observation_digest":"sha256:5c0542e810e7ba3ebe0fd8c74b5d26d1a2ddeb2549256a9d8dd7e5714836f814","observation_id":"15a240ce-734a-4bff-a78c-99f5c6ffb750","resolution":{"observed_at":"2026-08-07T11:37:27.678469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1512.03012","last_updated":"2015-12-09T19:42:48Z","snapshot_observed_at":"2026-08-14T23:08:26.232837Z","submitted_at":"2015-12-09T19:42:48Z","title":"ShapeNet: An Information-Rich 3D Model Repository","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1512.03012","snapshot_observed_at":"2026-08-07T11:37:27.683058Z","title":"Shapenet: An information-rich 3d model repository","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.01853","last_updated":"2025-06-02T16:40:50Z","snapshot_observed_at":"2026-08-15T01:34:26.509428Z","submitted_at":"2025-06-02T16:40:50Z","title":"ShapeLLM-Omni: A Native Multimodal LLM for 3D Generation and Understanding","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:27.683058Z"},"links":{"cited_paper":"/paper/1512.03012","citing_paper":"/paper/2506.01853"},"observation_digest":"sha256:3a84f7e4f3545042690ab183d557be0e13bbbd0936e22be2562f39ae7d045cf9","observation_id":"e4c94635-96c4-4813-9bcb-98c590cdd290","resolution":{"observed_at":"2026-08-07T11:37:27.683058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:37:27.687548Z","title":"Pointgpt: Auto-regressively generative pre-training from point clouds.Advances in Neural Information Processing Systems, 36: 29667–29679, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01853","last_updated":"2025-06-02T16:40:50Z","snapshot_observed_at":"2026-08-15T01:34:26.509428Z","submitted_at":"2025-06-02T16:40:50Z","title":"ShapeLLM-Omni: A Native Multimodal LLM for 3D Generation and Understanding","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:27.687548Z"},"links":{"citing_paper":"/paper/2506.01853"},"observation_digest":"sha256:2db38c755adfe161d66d37bfac04faee20156875071cdc7d0c2e2dae71082f5d","observation_id":"df554099-ae9d-42df-8865-559aacaa6905","resolution":{"observed_at":"2026-08-07T11:37:27.687548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:37:27.691522Z","title":"Microdreamer: Zero- shot 3d generation in 20 seconds by score-based iterative reconstruction.arXiv e-prints, pages arXiv–2404, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01853","last_updated":"2025-06-02T16:40:50Z","snapshot_observed_at":"2026-08-15T01:34:26.509428Z","submitted_at":"2025-06-02T16:40:50Z","title":"ShapeLLM-Omni: A Native Multimodal LLM for 3D Generation and Understanding","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:27.691522Z"},"links":{"citing_paper":"/paper/2506.01853"},"observation_digest":"sha256:a9abd18f9f55e591bbf1aa30b89b8265882684c7c9ca0c284c02c43ffb8491c1","observation_id":"fac3dbdc-9738-4617-a4b5-69380ddb9b01","resolution":{"observed_at":"2026-08-07T11:37:27.691522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.13873","last_updated":"2023-09-27T10:35:49Z","snapshot_observed_at":"2026-08-13T12:17:50.971831Z","submitted_at":"2023-03-24T09:30:09Z","title":"Fantasia3D: Disentangling Geometry and Appearance for High-quality Text-to-3D Content Creation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.13873","snapshot_observed_at":"2026-08-07T11:37:27.696648Z","title":"Fantasia3d: Disentangling geometry and appearance for high-quality text-to-3d content creation.arXiv preprint arXiv:2303.13873, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01853","last_updated":"2025-06-02T16:40:50Z","snapshot_observed_at":"2026-08-15T01:34:26.509428Z","submitted_at":"2025-06-02T16:40:50Z","title":"ShapeLLM-Omni: A Native Multimodal LLM for 3D Generation and Understanding","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:27.696648Z"},"links":{"cited_paper":"/paper/2303.13873","citing_paper":"/paper/2506.01853"},"observation_digest":"sha256:48fa378b0a84c29eaaeb272c79b8ab900e029cf069a12c3fc9514aa0ff03a2be","observation_id":"d73be3a2-3ba7-4eed-98d7-a5312da0811e","resolution":{"observed_at":"2026-08-07T11:37:27.696648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:37:27.701108Z","title":"Meshxl: Neural coordinate field for generative 3d foundation models.Advances in Neural Information Processing Systems, 37:97141–97166, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01853","last_updated":"2025-06-02T16:40:50Z","snapshot_observed_at":"2026-08-15T01:34:26.509428Z","submitted_at":"2025-06-02T16:40:50Z","title":"ShapeLLM-Omni: A Native Multimodal LLM for 3D Generation and Understanding","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:27.701108Z"},"links":{"citing_paper":"/paper/2506.01853"},"observation_digest":"sha256:27b28cd114e537a8b59809f52e3a9aa9ee6c6384fa150588d59d4d34f6ff9768","observation_id":"82e4238e-3e26-437d-86a1-3efcac9a38d8","resolution":{"observed_at":"2026-08-07T11:37:27.701108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10163","last_updated":"2024-10-09T05:00:16Z","snapshot_observed_at":"2026-08-14T15:44:06.509659Z","submitted_at":"2024-06-14T16:30:25Z","title":"MeshAnything: Artist-Created Mesh Generation with Autoregressive Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10163","snapshot_observed_at":"2026-08-07T11:37:27.705114Z","title":"Meshanything: Artist-created mesh generation with autoregressive transformers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01853","last_updated":"2025-06-02T16:40:50Z","snapshot_observed_at":"2026-08-15T01:34:26.509428Z","submitted_at":"2025-06-02T16:40:50Z","title":"ShapeLLM-Omni: A Native Multimodal LLM for 3D Generation and Understanding","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:27.705114Z"},"links":{"cited_paper":"/paper/2406.10163","citing_paper":"/paper/2506.01853"},"observation_digest":"sha256:fc5cf41eb1a2bb8f5cc5d1eeb96f8ac8f081fefe46fe64435a21aa17e47b850a","observation_id":"896097ac-e20f-4d87-b711-5026c9c62f5f","resolution":{"observed_at":"2026-08-07T11:37:27.705114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02555","last_updated":"2024-12-01T14:34:01Z","snapshot_observed_at":"2026-08-13T08:56:03.730568Z","submitted_at":"2024-08-05T15:33:45Z","title":"MeshAnything V2: Artist-Created Mesh Generation With Adjacent Mesh Tokenization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.02555","snapshot_observed_at":"2026-08-07T11:37:27.709245Z","title":"Meshanything v2: Artist-created mesh generation with adjacent mesh tokenization.arXiv preprint arXiv:2408.02555, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01853","last_updated":"2025-06-02T16:40:50Z","snapshot_observed_at":"2026-08-15T01:34:26.509428Z","submitted_at":"2025-06-02T16:40:50Z","title":"ShapeLLM-Omni: A Native Multimodal LLM for 3D Generation and Understanding","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:27.709245Z"},"links":{"cited_paper":"/paper/2408.02555","citing_paper":"/paper/2506.01853"},"observation_digest":"sha256:3f634965da34312d0386a9e9a7e3facf4b7144a4306800a21bf3581e2d45173f","observation_id":"44a6bc40-8c86-42a6-9dcf-d5c03422d69d","resolution":{"observed_at":"2026-08-07T11:37:27.709245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:37:27.713269Z","title":"Sar3d: Autoregressive 3d object generation and understanding via multi-scale 3d vqvae","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01853","last_updated":"2025-06-02T16:40:50Z","snapshot_observed_at":"2026-08-15T01:34:26.509428Z","submitted_at":"2025-06-02T16:40:50Z","title":"ShapeLLM-Omni: A Native Multimodal LLM for 3D Generation and Understanding","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:27.713269Z"},"links":{"citing_paper":"/paper/2506.01853"},"observation_digest":"sha256:0edbde74b26521b009e026790b9a1461a491b3cde13cc123438426274e90f750","observation_id":"0f24bea8-e00b-49f2-9e4e-4107916a9cfe","resolution":{"observed_at":"2026-08-07T11:37:27.713269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12957","last_updated":"2025-03-17T07:20:02Z","snapshot_observed_at":"2026-08-13T06:27:33.404551Z","submitted_at":"2024-09-19T17:59:06Z","title":"3DTopia-XL: Scaling High-quality 3D Asset Generation via Primitive Diffusion","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12957","snapshot_observed_at":"2026-08-07T11:37:27.717242Z","title":"3dtopia-xl: Scaling high-quality 3d asset generation via primitive diffusion.arXiv preprint arXiv:2409.12957, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01853","last_updated":"2025-06-02T16:40:50Z","snapshot_observed_at":"2026-08-15T01:34:26.509428Z","submitted_at":"2025-06-02T16:40:50Z","title":"ShapeLLM-Omni: A Native Multimodal LLM for 3D Generation and Understanding","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:27.717242Z"},"links":{"cited_paper":"/paper/2409.12957","citing_paper":"/paper/2506.01853"},"observation_digest":"sha256:d0db3af83021b5297ecbc1ed3ca8d1eb37842beb993eb7ed5b72c33ca4888265","observation_id":"fcf52c9d-a488-486a-b3a3-e457db965fcf","resolution":{"observed_at":"2026-08-07T11:37:27.717242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:37:27.721752Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01853","last_updated":"2025-06-02T16:40:50Z","snapshot_observed_at":"2026-08-15T01:34:26.509428Z","submitted_at":"2025-06-02T16:40:50Z","title":"ShapeLLM-Omni: A Native Multimodal LLM for 3D Generation and Understanding","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:27.721752Z"},"links":{"citing_paper":"/paper/2506.01853"},"observation_digest":"sha256:a09ad047b1f23f12287658ed397dbe3112e96526989483841e6c1e6cda63e9e2","observation_id":"c88e12a0-259d-48eb-8b96-c7327300499a","resolution":{"observed_at":"2026-08-07T11:37:27.721752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:37:27.726222Z","title":"Text-to-3d using gaussian splatting","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01853","last_updated":"2025-06-02T16:40:50Z","snapshot_observed_at":"2026-08-15T01:34:26.509428Z","submitted_at":"2025-06-02T16:40:50Z","title":"ShapeLLM-Omni: A Native Multimodal LLM for 3D Generation and Understanding","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:27.726222Z"},"links":{"citing_paper":"/paper/2506.01853"},"observation_digest":"sha256:0493af8918fa652403546b59fea8b8ccf56861dfbbbd55eb20431f52395657a2","observation_id":"d961ad31-b56e-46e5-b363-1a4cdeb8319d","resolution":{"observed_at":"2026-08-07T11:37:27.726222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.06738","last_updated":"2024-03-11T14:03:36Z","snapshot_observed_at":"2026-08-13T00:57:37.478128Z","submitted_at":"2024-03-11T14:03:36Z","title":"V3D: Video Diffusion Models are Effective 3D Generators","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.06738","snapshot_observed_at":"2026-08-07T11:37:27.730398Z","title":"V3d: Video diffusion models are effective 3d generators.arXiv preprint arXiv:2403.06738, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01853","last_updated":"2025-06-02T16:40:50Z","snapshot_observed_at":"2026-08-15T01:34:26.509428Z","submitted_at":"2025-06-02T16:40:50Z","title":"ShapeLLM-Omni: A Native Multimodal LLM for 3D Generation and Understanding","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:27.730398Z"},"links":{"cited_paper":"/paper/2403.06738","citing_paper":"/paper/2506.01853"},"observation_digest":"sha256:61dc0936908d1055491e88df1a5dba60b925afe61de59fd9106757fed4691a5c","observation_id":"48d4bde8-b383-4712-ab79-1700c8d3854a","resolution":{"observed_at":"2026-08-07T11:37:27.730398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-08-14T16:25:22.654846Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-08-07T11:37:27.734517Z","title":"Videollama 2: Advancing spatial-temporal modeling and audio understanding in video-llms.arXiv preprint arXiv:2406.07476, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01853","last_updated":"2025-06-02T16:40:50Z","snapshot_observed_at":"2026-08-15T01:34:26.509428Z","submitted_at":"2025-06-02T16:40:50Z","title":"ShapeLLM-Omni: A Native Multimodal LLM for 3D Generation and Understanding","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:27.734517Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2506.01853"},"observation_digest":"sha256:3d92c52eb41f474c01db91018c172ab43d487ef181b1fe6f3a738e9f4af57bba","observation_id":"2572e5a1-cca0-42b4-a625-31633d5ce4c8","resolution":{"observed_at":"2026-08-07T11:37:27.734517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-07T11:37:27.738665Z","title":"Training verifiers to solve math word problems, 2021.URL https://arxiv","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.01853","last_updated":"2025-06-02T16:40:50Z","snapshot_observed_at":"2026-08-15T01:34:26.509428Z","submitted_at":"2025-06-02T16:40:50Z","title":"ShapeLLM-Omni: A Native Multimodal LLM for 3D Generation and Understanding","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:27.738665Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2506.01853"},"observation_digest":"sha256:d8d1a3fa4ac141c1df0e408af54e1ecab75908eefb5ee8ba10a7b46add09285f","observation_id":"9ac3aefb-c295-4021-91ca-5abc2230011a","resolution":{"observed_at":"2026-08-07T11:37:27.738665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:37:27.742712Z","title":"Abo: Dataset and benchmarks for real-world 3d object understanding","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.01853","last_updated":"2025-06-02T16:40:50Z","snapshot_observed_at":"2026-08-15T01:34:26.509428Z","submitted_at":"2025-06-02T16:40:50Z","title":"ShapeLLM-Omni: A Native Multimodal LLM for 3D Generation and Understanding","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:27.742712Z"},"links":{"citing_paper":"/paper/2506.01853"},"observation_digest":"sha256:d749776f7b71e551a5ee54b53eae8c57d3bbbe00e3de11ba528946bc82f8083f","observation_id":"b60ef697-a219-4f90-bfa1-d5bc904e71e4","resolution":{"observed_at":"2026-08-07T11:37:27.742712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:37:27.750433Z","title":"Objaverse-xl: A universe of 10m+ 3d objects.Advances in Neural Information Processing Systems, 36:35799–35813, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01853","last_updated":"2025-06-02T16:40:50Z","snapshot_observed_at":"2026-08-15T01:34:26.509428Z","submitted_at":"2025-06-02T16:40:50Z","title":"ShapeLLM-Omni: A Native Multimodal LLM for 3D Generation and Understanding","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:27.750433Z"},"links":{"citing_paper":"/paper/2506.01853"},"observation_digest":"sha256:cb2a00e70a68d8c5f781d9f887d9836bf2adfd1c255d738e94c7cfeae7398f23","observation_id":"639067a0-0b5d-49b2-8d36-6e581760bd8c","resolution":{"observed_at":"2026-08-07T11:37:27.750433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14233","last_updated":"2023-05-23T16:49:14Z","snapshot_observed_at":"2026-08-14T22:24:15.551461Z","submitted_at":"2023-05-23T16:49:14Z","title":"Enhancing Chat Language Models by Scaling High-quality Instructional Conversations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14233","snapshot_observed_at":"2026-08-07T11:37:27.755217Z","title":"Enhancing chat language models by scaling high-quality instructional conversations","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01853","last_updated":"2025-06-02T16:40:50Z","snapshot_observed_at":"2026-08-15T01:34:26.509428Z","submitted_at":"2025-06-02T16:40:50Z","title":"ShapeLLM-Omni: A Native Multimodal LLM for 3D Generation and Understanding","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:27.755217Z"},"links":{"cited_paper":"/paper/2305.14233","citing_paper":"/paper/2506.01853"},"observation_digest":"sha256:1e34ef76153e0306a105c4860214efdf2cec05c1e13f73fdcd6f4639d9a11063","observation_id":"3ad52bd0-0fca-4016-a5be-4de7f1d9c053","resolution":{"observed_at":"2026-08-07T11:37:27.755217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12793","last_updated":"2024-07-30T03:58:11Z","snapshot_observed_at":"2026-08-14T09:56:00.692687Z","submitted_at":"2024-06-18T16:58:21Z","title":"ChatGLM: A Family of Large Language Models from GLM-130B to GLM-4 All Tools","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12793","snapshot_observed_at":"2026-08-07T11:37:27.760327Z","title":"Chatglm: A family of large language models from glm-130b to glm-4 all tools.arXiv preprint arXiv:2406.12793, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01853","last_updated":"2025-06-02T16:40:50Z","snapshot_observed_at":"2026-08-15T01:34:26.509428Z","submitted_at":"2025-06-02T16:40:50Z","title":"ShapeLLM-Omni: A Native Multimodal LLM for 3D Generation and Understanding","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:27.760327Z"},"links":{"cited_paper":"/paper/2406.12793","citing_paper":"/paper/2506.01853"},"observation_digest":"sha256:5224235004f1b61a1ed6b67347685600b9aad59ce41c945cf26b8cdb82d4f74e","observation_id":"54825719-4198-4040-90f9-a9b38724e13e","resolution":{"observed_at":"2026-08-07T11:37:27.760327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.20384","last_updated":"2025-04-29T03:09:46Z","snapshot_observed_at":"2026-08-07T15:58:23.453354Z","submitted_at":"2025-04-29T03:09:46Z","title":"FiLA-Video: Spatio-Temporal Compression for Fine-Grained Long Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.20384","snapshot_observed_at":"2026-08-07T11:37:27.764649Z","title":"Fila-video: Spatio-temporal compression for fine-grained long video understanding.arXiv preprint arXiv:2504.20384, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01853","last_updated":"2025-06-02T16:40:50Z","snapshot_observed_at":"2026-08-15T01:34:26.509428Z","submitted_at":"2025-06-02T16:40:50Z","title":"ShapeLLM-Omni: A Native Multimodal LLM for 3D Generation and Understanding","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:27.764649Z"},"links":{"cited_paper":"/paper/2504.20384","citing_paper":"/paper/2506.01853"},"observation_digest":"sha256:8477610009bbcd699dfe59c5948a1db8f35da30f17e64a726ed4404e19b21f66","observation_id":"e4f9af82-9a08-4a1f-9e1a-9e4809b1ea4a","resolution":{"observed_at":"2026-08-07T11:37:27.764649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09548","last_updated":"2024-12-12T18:38:42Z","snapshot_observed_at":"2026-08-14T09:33:31.443132Z","submitted_at":"2024-12-12T18:38:42Z","title":"Meshtron: High-Fidelity, Artist-Like 3D Mesh Generation at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09548","snapshot_observed_at":"2026-08-07T11:37:27.769279Z","title":"Meshtron: High-fidelity, artist-like 3d mesh generation at scale.arXiv preprint arXiv:2412.09548, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01853","last_updated":"2025-06-02T16:40:50Z","snapshot_observed_at":"2026-08-15T01:34:26.509428Z","submitted_at":"2025-06-02T16:40:50Z","title":"ShapeLLM-Omni: A Native Multimodal LLM for 3D Generation and Understanding","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:27.769279Z"},"links":{"cited_paper":"/paper/2412.09548","citing_paper":"/paper/2506.01853"},"observation_digest":"sha256:4a7ac54041fdd3338f33e1f0ad2dd6e68b30a7ba6d38e43de2ebc8e6072674f1","observation_id":"103e5f92-6dfd-4379-9e05-f70539c4e620","resolution":{"observed_at":"2026-08-07T11:37:27.769279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-08-13T20:44:28.824685Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-07T11:37:27.773382Z","title":"Measuring massive multitask language understanding.arXiv preprint arXiv:2009.03300, 2020","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2506.01853","last_updated":"2025-06-02T16:40:50Z","snapshot_observed_at":"2026-08-15T01:34:26.509428Z","submitted_at":"2025-06-02T16:40:50Z","title":"ShapeLLM-Omni: A Native Multimodal LLM for 3D Generation and Understanding","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:27.773382Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2506.01853"},"observation_digest":"sha256:bc5a7b2d359c1fde9427b424152b5025358391e4a42cf8f828ea4461efd8703c","observation_id":"9147454a-076a-417b-9476-b1b865b8706c","resolution":{"observed_at":"2026-08-07T11:37:27.773382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:37:27.777736Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilibrium.Advances in neural information processing systems, 30, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.01853","last_updated":"2025-06-02T16:40:50Z","snapshot_observed_at":"2026-08-15T01:34:26.509428Z","submitted_at":"2025-06-02T16:40:50Z","title":"ShapeLLM-Omni: A Native Multimodal LLM for 3D Generation and Understanding","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:27.777736Z"},"links":{"citing_paper":"/paper/2506.01853"},"observation_digest":"sha256:8ea0a35a88cc82ef40e8795436e6e82fc7b6d5f0c78ec698b4e4e54bd375eb91","observation_id":"cdbbf27a-5a48-497c-90c3-e5c75d8961ff","resolution":{"observed_at":"2026-08-07T11:37:27.777736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:37:27.781209Z","title":"Denoising diffusion probabilistic models.Advances in neural information processing systems, 33:6840–6851, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.01853","last_updated":"2025-06-02T16:40:50Z","snapshot_observed_at":"2026-08-15T01:34:26.509428Z","submitted_at":"2025-06-02T16:40:50Z","title":"ShapeLLM-Omni: A Native Multimodal LLM for 3D Generation and Understanding","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:27.781209Z"},"links":{"citing_paper":"/paper/2506.01853"},"observation_digest":"sha256:392fb0283d8370b2031fe9aef37080c0dd5bea5bda06072f1ec0aa70571231db","observation_id":"6fd4d6fc-20cc-4b7e-97b1-1f8de06e6372","resolution":{"observed_at":"2026-08-07T11:37:27.781209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04400","last_updated":"2024-03-09T10:47:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-08T00:03:52Z","title":"LRM: Large Reconstruction Model for Single Image to 3D","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.04400","snapshot_observed_at":"2026-08-07T11:37:27.784805Z","title":"Lrm: Large reconstruction model for single image to 3d.arXiv preprint arXiv:2311.04400, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01853","last_updated":"2025-06-02T16:40:50Z","snapshot_observed_at":"2026-08-15T01:34:26.509428Z","submitted_at":"2025-06-02T16:40:50Z","title":"ShapeLLM-Omni: A Native Multimodal LLM for 3D Generation and Understanding","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:27.784805Z"},"links":{"cited_paper":"/paper/2311.04400","citing_paper":"/paper/2506.01853"},"observation_digest":"sha256:025f05c66788d3b30a64537daa86372f2cfeec508a3b5d305d1cdcebdc514e74","observation_id":"942049f0-3b07-40fa-97f4-6a14fc2b7c8c","resolution":{"observed_at":"2026-08-07T11:37:27.784805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:37:27.789046Z","title":"3d-llm: Injecting the 3d world into large language models.Advances in Neural Information Processing Systems, 36:20482–20494, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01853","last_updated":"2025-06-02T16:40:50Z","snapshot_observed_at":"2026-08-15T01:34:26.509428Z","submitted_at":"2025-06-02T16:40:50Z","title":"ShapeLLM-Omni: A Native Multimodal LLM for 3D Generation and Understanding","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:27.789046Z"},"links":{"citing_paper":"/paper/2506.01853"},"observation_digest":"sha256:554cc8e64379788cf87908715a72f57140e3df99b21225eb7e5cb105d372bbdd","observation_id":"0fe629d8-23a1-4183-9b5d-0ee7fa08a603","resolution":{"observed_at":"2026-08-07T11:37:27.789046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04689","last_updated":"2025-01-08T18:52:03Z","snapshot_observed_at":"2026-08-14T05:07:16.451779Z","submitted_at":"2025-01-08T18:52:03Z","title":"SPAR3D: Stable Point-Aware Reconstruction of 3D Objects from Single Images","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.04689","snapshot_observed_at":"2026-08-07T11:37:27.792792Z","title":"Spar3d: Stable point-aware reconstruction of 3d objects from single images.arXiv preprint arXiv:2501.04689, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01853","last_updated":"2025-06-02T16:40:50Z","snapshot_observed_at":"2026-08-15T01:34:26.509428Z","submitted_at":"2025-06-02T16:40:50Z","title":"ShapeLLM-Omni: A Native Multimodal LLM for 3D Generation and Understanding","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:27.792792Z"},"links":{"cited_paper":"/paper/2501.04689","citing_paper":"/paper/2506.01853"},"observation_digest":"sha256:f7e4fa23f8233558e74a0bb76c03e49b6f4591cca6e20e732f890398e78fecbc","observation_id":"b15196e8-a502-435d-90cc-8b359ff2eb5a","resolution":{"observed_at":"2026-08-07T11:37:27.792792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-08-15T05:02:49.183338Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-07T11:37:27.800204Z","title":"Gpt-4o system card.arXiv preprint arXiv:2410.21276, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01853","last_updated":"2025-06-02T16:40:50Z","snapshot_observed_at":"2026-08-15T01:34:26.509428Z","submitted_at":"2025-06-02T16:40:50Z","title":"ShapeLLM-Omni: A Native Multimodal LLM for 3D Generation and Understanding","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:27.800204Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2506.01853"},"observation_digest":"sha256:b66b582fb5303a50976be7d1a46580ad953768d18ed780847f6d331eec163667","observation_id":"9076281c-26af-4d9f-8c9c-8c3da0f7ccf9","resolution":{"observed_at":"2026-08-07T11:37:27.800204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:37:27.803830Z","title":"3d gaussian splatting for real-time radiance field rendering.ACM Trans","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01853","last_updated":"2025-06-02T16:40:50Z","snapshot_observed_at":"2026-08-15T01:34:26.509428Z","submitted_at":"2025-06-02T16:40:50Z","title":"ShapeLLM-Omni: A Native Multimodal LLM for 3D Generation and Understanding","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:27.803830Z"},"links":{"citing_paper":"/paper/2506.01853"},"observation_digest":"sha256:e2c2caf649f9dd29accdf18b705eb04ef5f7d650eab6dd290298e0f7d77026df","observation_id":"a76dd746-bd58-48b0-906a-ebe47ea4b7bf","resolution":{"observed_at":"2026-08-07T11:37:27.803830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.06214","last_updated":"2023-11-23T08:55:49Z","snapshot_observed_at":"2026-08-13T19:48:57.736358Z","submitted_at":"2023-11-10T18:03:44Z","title":"Instant3D: Fast Text-to-3D with Sparse-View Generation and Large Reconstruction Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.06214","snapshot_observed_at":"2026-08-07T11:37:27.807634Z","title":"Instant3d: Fast text-to-3d with sparse-view generation and large reconstruction model.arXiv preprint arXiv:2311.06214, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01853","last_updated":"2025-06-02T16:40:50Z","snapshot_observed_at":"2026-08-15T01:34:26.509428Z","submitted_at":"2025-06-02T16:40:50Z","title":"ShapeLLM-Omni: A Native Multimodal LLM for 3D Generation and Understanding","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:27.807634Z"},"links":{"cited_paper":"/paper/2311.06214","citing_paper":"/paper/2506.01853"},"observation_digest":"sha256:6310d8c141779edb68e9258af659c927bb95d005d3df4e4239353dbf89b9c6d9","observation_id":"a7d9d9cc-4934-4b58-a423-07e87fe83476","resolution":{"observed_at":"2026-08-07T11:37:27.807634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02596","last_updated":"2023-10-20T04:02:22Z","snapshot_observed_at":"2026-08-14T03:10:27.017077Z","submitted_at":"2023-10-04T05:59:50Z","title":"SweetDreamer: Aligning Geometric Priors in 2D Diffusion for Consistent Text-to-3D","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02596","snapshot_observed_at":"2026-08-07T11:37:27.811750Z","title":"Sweetdreamer: Aligning geometric priors in 2d diffusion for consistent text-to-3d.arxiv:2310.02596, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01853","last_updated":"2025-06-02T16:40:50Z","snapshot_observed_at":"2026-08-15T01:34:26.509428Z","submitted_at":"2025-06-02T16:40:50Z","title":"ShapeLLM-Omni: A Native Multimodal LLM for 3D Generation and Understanding","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:27.811750Z"},"links":{"cited_paper":"/paper/2310.02596","citing_paper":"/paper/2506.01853"},"observation_digest":"sha256:d866f785e6e9156304c9293a87a56559f91b2b652738cd70c705c812c6ea7fdb","observation_id":"b3efcc19-5340-44bd-804b-4b8b5892457c","resolution":{"observed_at":"2026-08-07T11:37:27.811750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14979","last_updated":"2025-05-30T10:22:03Z","snapshot_observed_at":"2026-08-12T23:59:26.256718Z","submitted_at":"2024-05-23T18:30:12Z","title":"CraftsMan3D: High-fidelity Mesh Generation with 3D Native Generation and Interactive Geometry Refiner","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14979","snapshot_observed_at":"2026-08-07T11:37:27.815679Z","title":"Craftsman: High-fidelity mesh generation with 3d native generation and interactive geometry refiner.arXiv preprint arXiv:2405.14979, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01853","last_updated":"2025-06-02T16:40:50Z","snapshot_observed_at":"2026-08-15T01:34:26.509428Z","submitted_at":"2025-06-02T16:40:50Z","title":"ShapeLLM-Omni: A Native Multimodal LLM for 3D Generation and Understanding","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:27.815679Z"},"links":{"cited_paper":"/paper/2405.14979","citing_paper":"/paper/2506.01853"},"observation_digest":"sha256:b60c1db9374680d2bfe8dd92fb953bf1fa57a62b544fbd68cc31af2ec4eb0323","observation_id":"c0a9fc0b-18f2-4d97-92e7-b9b3b34eae23","resolution":{"observed_at":"2026-08-07T11:37:27.815679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:37:27.819869Z","title":"Llama-vid: An image is worth 2 tokens in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01853","last_updated":"2025-06-02T16:40:50Z","snapshot_observed_at":"2026-08-15T01:34:26.509428Z","submitted_at":"2025-06-02T16:40:50Z","title":"ShapeLLM-Omni: A Native Multimodal LLM for 3D Generation and Understanding","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:27.819869Z"},"links":{"citing_paper":"/paper/2506.01853"},"observation_digest":"sha256:5d4516be3d838da745a68c339a421546d323afad0c99047aaeab097487a6cb5a","observation_id":"03f2517b-494e-4742-9d66-8ec00652d90c","resolution":{"observed_at":"2026-08-07T11:37:27.819869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:37:27.823750Z","title":"Magic3d: High-resolution text-to-3d content creation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01853","last_updated":"2025-06-02T16:40:50Z","snapshot_observed_at":"2026-08-15T01:34:26.509428Z","submitted_at":"2025-06-02T16:40:50Z","title":"ShapeLLM-Omni: A Native Multimodal LLM for 3D Generation and Understanding","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:27.823750Z"},"links":{"citing_paper":"/paper/2506.01853"},"observation_digest":"sha256:6139402ba6f894d9fdcefb382454ceb3310896b5af9b60f68d525a75efb71db0","observation_id":"8c7c7950-2d39-4754-8b51-66a2a9e8d4bf","resolution":{"observed_at":"2026-08-07T11:37:27.823750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-11T01:48:59.557045Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-07T11:37:27.827900Z","title":"Deepseek-v3 technical report.arXiv preprint arXiv:2412.19437, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01853","last_updated":"2025-06-02T16:40:50Z","snapshot_observed_at":"2026-08-15T01:34:26.509428Z","submitted_at":"2025-06-02T16:40:50Z","title":"ShapeLLM-Omni: A Native Multimodal LLM for 3D Generation and Understanding","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:27.827900Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2506.01853"},"observation_digest":"sha256:f93b3a4f7177c7732d3b0b85b7f6eae693a356f4745f31f0721948546fa3ec5e","observation_id":"13da5421-ef5a-463f-b0d1-d0baabc52e3b","resolution":{"observed_at":"2026-08-07T11:37:27.827900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16767","last_updated":"2025-06-25T07:19:44Z","snapshot_observed_at":"2026-08-15T03:14:34.369767Z","submitted_at":"2024-08-29T17:59:40Z","title":"ReconX: Reconstruct Any Scene from Sparse Views with Video Diffusion Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16767","snapshot_observed_at":"2026-08-07T11:37:27.831955Z","title":"Reconx: Reconstruct any scene from sparse views with video diffusion model, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01853","last_updated":"2025-06-02T16:40:50Z","snapshot_observed_at":"2026-08-15T01:34:26.509428Z","submitted_at":"2025-06-02T16:40:50Z","title":"ShapeLLM-Omni: A Native Multimodal LLM for 3D Generation and Understanding","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:27.831955Z"},"links":{"cited_paper":"/paper/2408.16767","citing_paper":"/paper/2506.01853"},"observation_digest":"sha256:d1550538db2c9ba5b76035726fc8cd2ef6af11498442cf40b1c75d73bb87a6a7","observation_id":"74095d9c-1ffe-4bd6-b19c-4e50f8bf22b6","resolution":{"observed_at":"2026-08-07T11:37:27.831955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08268","last_updated":"2025-02-03T21:47:31Z","snapshot_observed_at":"2026-08-14T09:16:47.522119Z","submitted_at":"2024-02-13T07:47:36Z","title":"World Model on Million-Length Video And Language With Blockwise RingAttention","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08268","snapshot_observed_at":"2026-08-07T11:37:27.835988Z","title":"World model on million-length video and language with blockwise ringattention.arXiv preprint arXiv:2402.08268, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01853","last_updated":"2025-06-02T16:40:50Z","snapshot_observed_at":"2026-08-15T01:34:26.509428Z","submitted_at":"2025-06-02T16:40:50Z","title":"ShapeLLM-Omni: A Native Multimodal LLM for 3D Generation and Understanding","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:27.835988Z"},"links":{"cited_paper":"/paper/2402.08268","citing_paper":"/paper/2506.01853"},"observation_digest":"sha256:58766df6ee1b2d53d288122d3f18a342774c32c23d10f76c285053d53644a890","observation_id":"2116498f-7835-4ec4-aaca-8038acba5261","resolution":{"observed_at":"2026-08-07T11:37:27.835988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:37:27.840516Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36:34892–34916, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01853","last_updated":"2025-06-02T16:40:50Z","snapshot_observed_at":"2026-08-15T01:34:26.509428Z","submitted_at":"2025-06-02T16:40:50Z","title":"ShapeLLM-Omni: A Native Multimodal LLM for 3D Generation and Understanding","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:27.840516Z"},"links":{"citing_paper":"/paper/2506.01853"},"observation_digest":"sha256:4cab628c5f04938b37e2c49149e6d6a2f203d020c5903165d82659575e2ac652","observation_id":"257ffe6e-744b-4afd-8b31-b8d531ce6a18","resolution":{"observed_at":"2026-08-07T11:37:27.840516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:37:27.844476Z","title":"One-2- 3-45: Any single image to 3d mesh in 45 seconds without per-shape optimization.Advances in Neural Information Processing Systems, 36:22226–22246, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01853","last_updated":"2025-06-02T16:40:50Z","snapshot_observed_at":"2026-08-15T01:34:26.509428Z","submitted_at":"2025-06-02T16:40:50Z","title":"ShapeLLM-Omni: A Native Multimodal LLM for 3D Generation and Understanding","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:27.844476Z"},"links":{"citing_paper":"/paper/2506.01853"},"observation_digest":"sha256:3e777acad48d997c4cffeed42e42e71aa77724661dbb8a356bc6ad153b21390c","observation_id":"3f9a76d7-4f34-4e0d-b007-b63ab93000e0","resolution":{"observed_at":"2026-08-07T11:37:27.844476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:37:27.849128Z","title":"Zero-1-to-3: Zero-shot one image to 3d object","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01853","last_updated":"2025-06-02T16:40:50Z","snapshot_observed_at":"2026-08-15T01:34:26.509428Z","submitted_at":"2025-06-02T16:40:50Z","title":"ShapeLLM-Omni: A Native Multimodal LLM for 3D Generation and Understanding","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:27.849128Z"},"links":{"citing_paper":"/paper/2506.01853"},"observation_digest":"sha256:34f61a241db201870cb27aec4e3bbea5362092f8fb687b2375a7accd52e78336","observation_id":"546aa401-5af1-4c68-8e73-6e704e7a80b6","resolution":{"observed_at":"2026-08-07T11:37:27.849128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.03453","last_updated":"2024-04-15T10:28:44Z","snapshot_observed_at":"2026-08-12T22:52:54.817720Z","submitted_at":"2023-09-07T02:28:04Z","title":"SyncDreamer: Generating Multiview-consistent Images from a Single-view Image","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.03453","snapshot_observed_at":"2026-08-07T11:37:27.854089Z","title":"Syncdreamer: Generating multiview-consistent images from a single-view image.arXiv preprint arXiv:2309.03453, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01853","last_updated":"2025-06-02T16:40:50Z","snapshot_observed_at":"2026-08-15T01:34:26.509428Z","submitted_at":"2025-06-02T16:40:50Z","title":"ShapeLLM-Omni: A Native Multimodal LLM for 3D Generation and Understanding","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:27.854089Z"},"links":{"cited_paper":"/paper/2309.03453","citing_paper":"/paper/2506.01853"},"observation_digest":"sha256:171b6154063d3dc8cd968fb3f3396719119d791074ee040a062b7293d4093947","observation_id":"b4e66ff1-2c0d-4203-a7bb-7eeab6e9ddf9","resolution":{"observed_at":"2026-08-07T11:37:27.854089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:37:27.858378Z","title":"Wonder3d: Single image to 3d using cross-domain diffusion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01853","last_updated":"2025-06-02T16:40:50Z","snapshot_observed_at":"2026-08-15T01:34:26.509428Z","submitted_at":"2025-06-02T16:40:50Z","title":"ShapeLLM-Omni: A Native Multimodal LLM for 3D Generation and Understanding","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:27.858378Z"},"links":{"citing_paper":"/paper/2506.01853"},"observation_digest":"sha256:48fcafeb725e8f912ccd20724210bf1f1b46e84e08dcb832dd51beb6a5c37275","observation_id":"797de06d-30b3-4924-9935-285baa29eb8d","resolution":{"observed_at":"2026-08-07T11:37:27.858378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:37:27.862454Z","title":"Marching cubes: A high resolution 3d surface construction algorithm","venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2506.01853","last_updated":"2025-06-02T16:40:50Z","snapshot_observed_at":"2026-08-15T01:34:26.509428Z","submitted_at":"2025-06-02T16:40:50Z","title":"ShapeLLM-Omni: A Native Multimodal LLM for 3D Generation and Understanding","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:27.862454Z"},"links":{"citing_paper":"/paper/2506.01853"},"observation_digest":"sha256:73072d3e7037b92424191c4228661a22b32e63e108de5a319d10d83f37f112a4","observation_id":"062289b7-18e4-485a-b8c9-7f645c9fd044","resolution":{"observed_at":"2026-08-07T11:37:27.862454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05424","last_updated":"2024-06-10T01:36:53Z","snapshot_observed_at":"2026-07-06T15:40:24.127663Z","submitted_at":"2023-06-08T17:59:56Z","title":"Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05424","snapshot_observed_at":"2026-08-07T11:37:27.866814Z","title":"Video-chatgpt: Towards detailed video understanding via large vision and language models.arXiv preprint arXiv:2306.05424, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01853","last_updated":"2025-06-02T16:40:50Z","snapshot_observed_at":"2026-08-15T01:34:26.509428Z","submitted_at":"2025-06-02T16:40:50Z","title":"ShapeLLM-Omni: A Native Multimodal LLM for 3D Generation and Understanding","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:27.866814Z"},"links":{"cited_paper":"/paper/2306.05424","citing_paper":"/paper/2506.01853"},"observation_digest":"sha256:de4b6b5fe0cd566658d65ee15580b2ba672c4e21ab8542267dc04132e8510c16","observation_id":"c5bd8967-5b5b-4e3c-a510-0b481d94d934","resolution":{"observed_at":"2026-08-07T11:37:27.866814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:37:27.871119Z","title":"Nerf: Representing scenes as neural radiance fields for view synthesis.Communications of the ACM, 65(1):99–106, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.01853","last_updated":"2025-06-02T16:40:50Z","snapshot_observed_at":"2026-08-15T01:34:26.509428Z","submitted_at":"2025-06-02T16:40:50Z","title":"ShapeLLM-Omni: A Native Multimodal LLM for 3D Generation and Understanding","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:27.871119Z"},"links":{"citing_paper":"/paper/2506.01853"},"observation_digest":"sha256:25d7d9d0ad808a8aba22503b4f1d12579e6297006e1ceb786f8466668e4ce233","observation_id":"b9f363de-9fd6-48ae-ac56-afed71cacb67","resolution":{"observed_at":"2026-08-07T11:37:27.871119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.13711","last_updated":"2022-04-16T20:47:45Z","snapshot_observed_at":"2026-08-13T17:45:37.225309Z","submitted_at":"2021-10-26T14:00:49Z","title":"Hierarchical Transformers Are More Efficient Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.13711","snapshot_observed_at":"2026-08-07T11:37:27.875673Z","title":"Hierarchical transformers are more efficient language models.arXiv preprint arXiv:2110.13711, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.01853","last_updated":"2025-06-02T16:40:50Z","snapshot_observed_at":"2026-08-15T01:34:26.509428Z","submitted_at":"2025-06-02T16:40:50Z","title":"ShapeLLM-Omni: A Native Multimodal LLM for 3D Generation and Understanding","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:27.875673Z"},"links":{"cited_paper":"/paper/2110.13711","citing_paper":"/paper/2506.01853"},"observation_digest":"sha256:4252d257f751865f4e4e0446f6f59b706f6bbb99620aa2370600a26a9cc19409","observation_id":"c1ece4fd-c453-4518-829b-b590bc230090","resolution":{"observed_at":"2026-08-07T11:37:27.875673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:37:27.879675Z","title":"Barron, and Ben Mildenhall","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.01853","last_updated":"2025-06-02T16:40:50Z","snapshot_observed_at":"2026-08-15T01:34:26.509428Z","submitted_at":"2025-06-02T16:40:50Z","title":"ShapeLLM-Omni: A Native Multimodal LLM for 3D Generation and Understanding","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:27.879675Z"},"links":{"citing_paper":"/paper/2506.01853"},"observation_digest":"sha256:0be2dd4244c1a3382e21bb7b141e9714539d379a1c7ba852a36a3fac92aaa9d1","observation_id":"ffb870eb-21a7-4369-9200-2d15c9bd6605","resolution":{"observed_at":"2026-08-07T11:37:27.879675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:37:27.883351Z","title":"Shapellm: Universal 3d object understanding for embodied interaction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01853","last_updated":"2025-06-02T16:40:50Z","snapshot_observed_at":"2026-08-15T01:34:26.509428Z","submitted_at":"2025-06-02T16:40:50Z","title":"ShapeLLM-Omni: A Native Multimodal LLM for 3D Generation and Understanding","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:27.883351Z"},"links":{"citing_paper":"/paper/2506.01853"},"observation_digest":"sha256:8075bbef4ea0818f4b651416e9ec82ce9e5dee832bef59d16c19200f6bf4a205","observation_id":"b290a26a-c611-4aeb-917e-a03990121824","resolution":{"observed_at":"2026-08-07T11:37:27.883351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:37:27.887417Z","title":"Richdreamer: A generalizable normal-depth diffusion model for detail richness in text-to-3d","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01853","last_updated":"2025-06-02T16:40:50Z","snapshot_observed_at":"2026-08-15T01:34:26.509428Z","submitted_at":"2025-06-02T16:40:50Z","title":"ShapeLLM-Omni: A Native Multimodal LLM for 3D Generation and Understanding","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:27.887417Z"},"links":{"citing_paper":"/paper/2506.01853"},"observation_digest":"sha256:0775730da363001391d944e558de1fc32ef51be920acd846c02d5d1e242957c9","observation_id":"a3e9253d-e0d0-4a72-a5c2-ad447b622c28","resolution":{"observed_at":"2026-08-07T11:37:27.887417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:37:27.891434Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.01853","last_updated":"2025-06-02T16:40:50Z","snapshot_observed_at":"2026-08-15T01:34:26.509428Z","submitted_at":"2025-06-02T16:40:50Z","title":"ShapeLLM-Omni: A Native Multimodal LLM for 3D Generation and Understanding","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:27.891434Z"},"links":{"citing_paper":"/paper/2506.01853"},"observation_digest":"sha256:bbc70a81fb6fdac43b161e0fdc6c3d6d3364836be60960ab9ea080e6f4eef94f","observation_id":"1af2ac5e-da91-4d85-917b-fa425a63a366","resolution":{"observed_at":"2026-08-07T11:37:27.891434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:37:27.895233Z","title":"Dreambooth3d: Subject-driven text-to- 3d generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01853","last_updated":"2025-06-02T16:40:50Z","snapshot_observed_at":"2026-08-15T01:34:26.509428Z","submitted_at":"2025-06-02T16:40:50Z","title":"ShapeLLM-Omni: A Native Multimodal LLM for 3D Generation and Understanding","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:27.895233Z"},"links":{"citing_paper":"/paper/2506.01853"},"observation_digest":"sha256:1b6dd6f71eb7bffb72251dcbcaa238972e2f08df953a7b01e793113b36e404a1","observation_id":"e3505aa5-dc7a-42e5-b561-7b8c755a4dfb","resolution":{"observed_at":"2026-08-07T11:37:27.895233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:37:27.898979Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.01853","last_updated":"2025-06-02T16:40:50Z","snapshot_observed_at":"2026-08-15T01:34:26.509428Z","submitted_at":"2025-06-02T16:40:50Z","title":"ShapeLLM-Omni: A Native Multimodal LLM for 3D Generation and Understanding","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:27.898979Z"},"links":{"citing_paper":"/paper/2506.01853"},"observation_digest":"sha256:53892c23abda4f208e58515a108d835a94282781889135e2197132d8236dc9eb","observation_id":"730b779a-3d70-4221-b63b-758239a60fc9","resolution":{"observed_at":"2026-08-07T11:37:27.898979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.09728","last_updated":"2019-09-09T17:29:55Z","snapshot_observed_at":"2026-08-12T21:45:41.485479Z","submitted_at":"2019-04-22T05:36:37Z","title":"SocialIQA: Commonsense Reasoning about Social Interactions","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.09728","snapshot_observed_at":"2026-08-07T11:37:27.902878Z","title":"Socialiqa: Commonsense reasoning about social interactions.arXiv preprint arXiv:1904.09728, 2019","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2506.01853","last_updated":"2025-06-02T16:40:50Z","snapshot_observed_at":"2026-08-15T01:34:26.509428Z","submitted_at":"2025-06-02T16:40:50Z","title":"ShapeLLM-Omni: A Native Multimodal LLM for 3D Generation and Understanding","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:27.902878Z"},"links":{"cited_paper":"/paper/1904.09728","citing_paper":"/paper/2506.01853"},"observation_digest":"sha256:49f27da17e1af2b73828abcd7f1b14198549772d06deb31fe8ec1c1a18cd6230","observation_id":"3ba98690-c867-4fe3-85c5-c59f27da9e74","resolution":{"observed_at":"2026-08-07T11:37:27.902878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.15110","last_updated":"2023-10-23T17:18:59Z","snapshot_observed_at":"2026-08-15T06:11:26.743203Z","submitted_at":"2023-10-23T17:18:59Z","title":"Zero123++: a Single Image to Consistent Multi-view Diffusion Base Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.15110","snapshot_observed_at":"2026-08-07T11:37:27.906927Z","title":"Zero123++: a single image to consistent multi-view diffusion base model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01853","last_updated":"2025-06-02T16:40:50Z","snapshot_observed_at":"2026-08-15T01:34:26.509428Z","submitted_at":"2025-06-02T16:40:50Z","title":"ShapeLLM-Omni: A Native Multimodal LLM for 3D Generation and Understanding","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:27.906927Z"},"links":{"cited_paper":"/paper/2310.15110","citing_paper":"/paper/2506.01853"},"observation_digest":"sha256:4641e5cdaef172d6bf8ecfd7691db18cfa7412f55b4edbd4bcb0579ac925c40b","observation_id":"e85a51f8-1b74-4af5-9364-79b437d50b68","resolution":{"observed_at":"2026-08-07T11:37:27.906927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16512","last_updated":"2024-04-18T04:12:32Z","snapshot_observed_at":"2026-08-14T19:33:54.756989Z","submitted_at":"2023-08-31T07:49:06Z","title":"MVDream: Multi-view Diffusion for 3D Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.16512","snapshot_observed_at":"2026-08-07T11:37:27.910859Z","title":"Mvdream: Multi-view diffusion for 3d generation.arXiv preprint arXiv:2308.16512, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01853","last_updated":"2025-06-02T16:40:50Z","snapshot_observed_at":"2026-08-15T01:34:26.509428Z","submitted_at":"2025-06-02T16:40:50Z","title":"ShapeLLM-Omni: A Native Multimodal LLM for 3D Generation and Understanding","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:27.910859Z"},"links":{"cited_paper":"/paper/2308.16512","citing_paper":"/paper/2506.01853"},"observation_digest":"sha256:49f05baceb5cffd8826c9f4d0fa77b8b686dec08f07545a7bb7629d0aa206a3d","observation_id":"e9b6bf24-129d-4c69-bcb3-d12693b51df2","resolution":{"observed_at":"2026-08-07T11:37:27.910859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:37:29.320262Z","title":"Meshgpt: Generating triangle meshes with decoder-only transformers","venue":null,"work_id":"4c72442c-6a15-4ae7-a414-bda6cb2cccdd","year":2024},"citing_paper":{"arxiv_id":"2506.01853","last_updated":"2025-06-02T16:40:50Z","snapshot_observed_at":"2026-08-15T01:34:26.509428Z","submitted_at":"2025-06-02T16:40:50Z","title":"ShapeLLM-Omni: A Native Multimodal LLM for 3D Generation and Understanding","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:27.914925Z"},"links":{"citing_paper":"/paper/2506.01853"},"observation_digest":"sha256:c7c1eccc6de8aadddc301588b406a9416b863c13a2310f97e4369fbc3e54242d","observation_id":"8d8f952e-a96c-4781-97be-45bc86f02bcc","resolution":{"observed_at":"2026-08-07T11:37:29.325646Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:37:29.304731Z","title":"Meta 3d assetgen: Text-to-mesh generation with high-quality geometry, texture, and pbr materials","venue":null,"work_id":"0187663f-980f-4ecf-8639-ac4d3d20f87e","year":2024},"citing_paper":{"arxiv_id":"2506.01853","last_updated":"2025-06-02T16:40:50Z","snapshot_observed_at":"2026-08-15T01:34:26.509428Z","submitted_at":"2025-06-02T16:40:50Z","title":"ShapeLLM-Omni: A Native Multimodal LLM for 3D Generation and Understanding","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:27.919555Z"},"links":{"citing_paper":"/paper/2506.01853"},"observation_digest":"sha256:530b7321a29b24c4fd76066e62a94dd64bad9081603f9fe334f46d0280bc6eba","observation_id":"98441879-1280-47a4-bcb3-dd9ed5f42fd4","resolution":{"observed_at":"2026-08-07T11:37:29.310511Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:37:29.289735Z","title":"Using shape to categorize: Low-shot learning with an explicit shape bias","venue":null,"work_id":"aeb1a3fc-b97e-4538-950b-b7ac6c1e752e","year":2021},"citing_paper":{"arxiv_id":"2506.01853","last_updated":"2025-06-02T16:40:50Z","snapshot_observed_at":"2026-08-15T01:34:26.509428Z","submitted_at":"2025-06-02T16:40:50Z","title":"ShapeLLM-Omni: A Native Multimodal LLM for 3D Generation and Understanding","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:27.923782Z"},"links":{"citing_paper":"/paper/2506.01853"},"observation_digest":"sha256:38959081d517956c443c3558c1a509958ea6d12197e483d2dfe8ffcc21d7cb41","observation_id":"ad398fcf-12eb-46a6-8c73-02d32654f82d","resolution":{"observed_at":"2026-08-07T11:37:29.294237Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.16818","last_updated":"2023-10-26T06:54:22Z","snapshot_observed_at":"2026-08-14T11:12:41.791244Z","submitted_at":"2023-10-25T17:50:10Z","title":"DreamCraft3D: Hierarchical 3D Generation with Bootstrapped Diffusion Prior","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.16818","snapshot_observed_at":"2026-08-07T11:37:27.927781Z","title":"Dreamcraft3d: Hierarchical 3d generation with bootstrapped diffusion prior.arXiv preprint arXiv:2310.16818, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01853","last_updated":"2025-06-02T16:40:50Z","snapshot_observed_at":"2026-08-15T01:34:26.509428Z","submitted_at":"2025-06-02T16:40:50Z","title":"ShapeLLM-Omni: A Native Multimodal LLM for 3D Generation and Understanding","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:27.927781Z"},"links":{"cited_paper":"/paper/2310.16818","citing_paper":"/paper/2506.01853"},"observation_digest":"sha256:bef1eef1c644cf64b9399fefc6628865241f7bc510312b1e886fafa2ddb39bf7","observation_id":"7b342ea8-2d4e-45ea-856d-8beb961b26ca","resolution":{"observed_at":"2026-08-07T11:37:27.927781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:37:27.931926Z","title":"Rethinking the inception architecture for computer vision","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.01853","last_updated":"2025-06-02T16:40:50Z","snapshot_observed_at":"2026-08-15T01:34:26.509428Z","submitted_at":"2025-06-02T16:40:50Z","title":"ShapeLLM-Omni: A Native Multimodal LLM for 3D Generation and Understanding","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:27.931926Z"},"links":{"citing_paper":"/paper/2506.01853"},"observation_digest":"sha256:a31e567e16bb472514a20c065f4d6cf528c183c15f1c900f27321c5cc31fdc8d","observation_id":"0bfa94b3-8baf-440e-86eb-08db26dc9238","resolution":{"observed_at":"2026-08-07T11:37:27.931926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16653","last_updated":"2024-03-29T08:39:23Z","snapshot_observed_at":"2026-07-06T16:25:05.493379Z","submitted_at":"2023-09-28T17:55:05Z","title":"DreamGaussian: Generative Gaussian Splatting for Efficient 3D Content Creation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16653","snapshot_observed_at":"2026-08-07T11:37:27.935654Z","title":"Dreamgaussian: Generative gaussian splatting for efficient 3d content creation.arXiv preprint arXiv:2309.16653, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01853","last_updated":"2025-06-02T16:40:50Z","snapshot_observed_at":"2026-08-15T01:34:26.509428Z","submitted_at":"2025-06-02T16:40:50Z","title":"ShapeLLM-Omni: A Native Multimodal LLM for 3D Generation and Understanding","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:27.935654Z"},"links":{"cited_paper":"/paper/2309.16653","citing_paper":"/paper/2506.01853"},"observation_digest":"sha256:99b405cec8e0107e2250a13a4f93d2872c6d741188aafd68296d3bd13d2ba707","observation_id":"69950d54-7dc1-499d-a15c-a6f8348e83e6","resolution":{"observed_at":"2026-08-07T11:37:27.935654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05054","last_updated":"2024-02-07T17:57:03Z","snapshot_observed_at":"2026-08-13T04:24:03.548014Z","submitted_at":"2024-02-07T17:57:03Z","title":"LGM: Large Multi-View Gaussian Model for High-Resolution 3D Content Creation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.05054","snapshot_observed_at":"2026-08-07T11:37:27.939831Z","title":"Lgm: Large multi-view gaussian model for high-resolution 3d content creation.arXiv preprint arXiv:2402.05054, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01853","last_updated":"2025-06-02T16:40:50Z","snapshot_observed_at":"2026-08-15T01:34:26.509428Z","submitted_at":"2025-06-02T16:40:50Z","title":"ShapeLLM-Omni: A Native Multimodal LLM for 3D Generation and Understanding","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:27.939831Z"},"links":{"cited_paper":"/paper/2402.05054","citing_paper":"/paper/2506.01853"},"observation_digest":"sha256:89f1b95c476e49f204f87544e950f56d5dbed20af1a0d51ba83aca5d298a5105","observation_id":"ab3c4712-7db3-4395-a871-b1b142448e63","resolution":{"observed_at":"2026-08-07T11:37:27.939831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18114","last_updated":"2024-09-26T17:55:02Z","snapshot_observed_at":"2026-08-12T22:36:38.836475Z","submitted_at":"2024-09-26T17:55:02Z","title":"EdgeRunner: Auto-regressive Auto-encoder for Artistic Mesh Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18114","snapshot_observed_at":"2026-08-07T11:37:27.943894Z","title":"Edgerunner: Auto-regressive auto-encoder for artistic mesh generation.arXiv preprint arXiv:2409.18114, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01853","last_updated":"2025-06-02T16:40:50Z","snapshot_observed_at":"2026-08-15T01:34:26.509428Z","submitted_at":"2025-06-02T16:40:50Z","title":"ShapeLLM-Omni: A Native Multimodal LLM for 3D Generation and Understanding","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:27.943894Z"},"links":{"cited_paper":"/paper/2409.18114","citing_paper":"/paper/2506.01853"},"observation_digest":"sha256:88a8136fcd8e62e99fa1807ea68f30c67447c324364309a0bdb1d3bb979e0fe3","observation_id":"24096128-49eb-46d1-b74e-bc34832ef2c2","resolution":{"observed_at":"2026-08-07T11:37:27.943894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09818","last_updated":"2025-03-21T05:54:00Z","snapshot_observed_at":"2026-08-12T11:54:14.007649Z","submitted_at":"2024-05-16T05:23:41Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09818","snapshot_observed_at":"2026-08-07T11:37:27.947973Z","title":"Chameleon: Mixed-modal early-fusion foundation models.arXiv preprint arXiv:2405.09818, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01853","last_updated":"2025-06-02T16:40:50Z","snapshot_observed_at":"2026-08-15T01:34:26.509428Z","submitted_at":"2025-06-02T16:40:50Z","title":"ShapeLLM-Omni: A Native Multimodal LLM for 3D Generation and Understanding","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:27.947973Z"},"links":{"cited_paper":"/paper/2405.09818","citing_paper":"/paper/2506.01853"},"observation_digest":"sha256:4a39dae2918c1f838e60cdba9c00deaf151bce3e0f8823dfdd283d8247485ae2","observation_id":"023147e7-e977-4526-9975-2b55d0234824","resolution":{"observed_at":"2026-08-07T11:37:27.947973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-07T11:37:27.952820Z","title":"Llama: Open and efficient foundation language models.arXiv preprint arXiv:2302.13971, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01853","last_updated":"2025-06-02T16:40:50Z","snapshot_observed_at":"2026-08-15T01:34:26.509428Z","submitted_at":"2025-06-02T16:40:50Z","title":"ShapeLLM-Omni: A Native Multimodal LLM for 3D Generation and Understanding","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:27.952820Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2506.01853"},"observation_digest":"sha256:d2ca801324b292ca4426676fa47c720a9ec82c0a0fea8c2a3c1db3a1723f112f","observation_id":"0918483a-fa5d-4cf2-99d5-fe69eb2e92af","resolution":{"observed_at":"2026-08-07T11:37:27.952820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:37:27.957223Z","title":"Neural discrete representation learning.Advances in neural information processing systems, 30, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.01853","last_updated":"2025-06-02T16:40:50Z","snapshot_observed_at":"2026-08-15T01:34:26.509428Z","submitted_at":"2025-06-02T16:40:50Z","title":"ShapeLLM-Omni: A Native Multimodal LLM for 3D Generation and Understanding","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:27.957223Z"},"links":{"citing_paper":"/paper/2506.01853"},"observation_digest":"sha256:4e9412a3feee8132f2bd3d262afdb7efc224924a97537d83039278a6b09a6044","observation_id":"59ea2661-bbee-4ba1-977c-2e8fcb81a3c5","resolution":{"observed_at":"2026-08-07T11:37:27.957223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:37:27.961196Z","title":"Sv3d: Novel multi-view synthesis and 3d generation from a single image using latent video diffusion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01853","last_updated":"2025-06-02T16:40:50Z","snapshot_observed_at":"2026-08-15T01:34:26.509428Z","submitted_at":"2025-06-02T16:40:50Z","title":"ShapeLLM-Omni: A Native Multimodal LLM for 3D Generation and Understanding","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:27.961196Z"},"links":{"citing_paper":"/paper/2506.01853"},"observation_digest":"sha256:8edadf3857443a53dfc4d422c6b742fbc35c5033efb39c37eb05c975e6f7bba1","observation_id":"ae417b46-ae3d-485a-8264-6912330d817c","resolution":{"observed_at":"2026-08-07T11:37:27.961196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.00774","last_updated":"2022-12-01T18:56:37Z","snapshot_observed_at":"2026-08-13T13:29:49.342543Z","submitted_at":"2022-12-01T18:56:37Z","title":"Score Jacobian Chaining: Lifting Pretrained 2D Diffusion Models for 3D Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.00774","snapshot_observed_at":"2026-08-07T11:37:27.965143Z","title":"Yeh, and Greg Shakhnarovich","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.01853","last_updated":"2025-06-02T16:40:50Z","snapshot_observed_at":"2026-08-15T01:34:26.509428Z","submitted_at":"2025-06-02T16:40:50Z","title":"ShapeLLM-Omni: A Native Multimodal LLM for 3D Generation and Understanding","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:27.965143Z"},"links":{"cited_paper":"/paper/2212.00774","citing_paper":"/paper/2506.01853"},"observation_digest":"sha256:523066d448304e775b69c776ee994bf0be8a5c48a84fadfb2d206b2ad0bcb1cd","observation_id":"4584e442-efc3-4f67-a60d-f7f128ddc773","resolution":{"observed_at":"2026-08-07T11:37:27.965143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02201","last_updated":"2023-12-02T20:41:27Z","snapshot_observed_at":"2026-08-13T05:11:47.980346Z","submitted_at":"2023-12-02T20:41:27Z","title":"ImageDream: Image-Prompt Multi-view Diffusion for 3D Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.02201","snapshot_observed_at":"2026-08-07T11:37:27.969205Z","title":"Imagedream: Image-prompt multi-view diffusion for 3d generation.arXiv preprint arXiv:2312.02201, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01853","last_updated":"2025-06-02T16:40:50Z","snapshot_observed_at":"2026-08-15T01:34:26.509428Z","submitted_at":"2025-06-02T16:40:50Z","title":"ShapeLLM-Omni: A Native Multimodal LLM for 3D Generation and Understanding","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:27.969205Z"},"links":{"cited_paper":"/paper/2312.02201","citing_paper":"/paper/2506.01853"},"observation_digest":"sha256:dfdcd56475655354f6a117e500a2fc43bcfe541656e8374a19459b12beada6c8","observation_id":"9ac3ca65-a9ac-48c4-83a5-05eac76d239e","resolution":{"observed_at":"2026-08-07T11:37:27.969205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12024","last_updated":"2023-11-23T17:59:42Z","snapshot_observed_at":"2026-08-13T05:21:00.788507Z","submitted_at":"2023-11-20T18:57:55Z","title":"PF-LRM: Pose-Free Large Reconstruction Model for Joint Pose and Shape Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12024","snapshot_observed_at":"2026-08-07T11:37:27.973250Z","title":"Pf-lrm: Pose-free large reconstruction model for joint pose and shape prediction.arXiv preprint arXiv:2311.12024, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01853","last_updated":"2025-06-02T16:40:50Z","snapshot_observed_at":"2026-08-15T01:34:26.509428Z","submitted_at":"2025-06-02T16:40:50Z","title":"ShapeLLM-Omni: A Native Multimodal LLM for 3D Generation and Understanding","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:27.973250Z"},"links":{"cited_paper":"/paper/2311.12024","citing_paper":"/paper/2506.01853"},"observation_digest":"sha256:7204445274e61ab99de432a40d764b10ba726e1a0c39cfe31074655c96b3a142","observation_id":"cc377646-8cf4-46df-998f-cb695723e7c8","resolution":{"observed_at":"2026-08-07T11:37:27.973250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:37:29.250186Z","title":"Rodin: A generative model for sculpting 3d digital avatars using diffusion","venue":null,"work_id":"3b177b3f-7930-40ff-a3ae-2884884f9583","year":2023},"citing_paper":{"arxiv_id":"2506.01853","last_updated":"2025-06-02T16:40:50Z","snapshot_observed_at":"2026-08-15T01:34:26.509428Z","submitted_at":"2025-06-02T16:40:50Z","title":"ShapeLLM-Omni: A Native Multimodal LLM for 3D Generation and Understanding","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:27.977321Z"},"links":{"citing_paper":"/paper/2506.01853"},"observation_digest":"sha256:98a1bcdc647e72202d167fb49fb91c608699da557fd50b19b6d8f7ff2d12212f","observation_id":"f0d35027-5f05-495c-8e8b-feb8f919aa34","resolution":{"observed_at":"2026-08-07T11:37:29.254652Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18869","last_updated":"2024-09-27T16:06:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T16:06:11Z","title":"Emu3: Next-Token Prediction is All You Need","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18869","snapshot_observed_at":"2026-08-07T11:37:27.981864Z","title":"Emu3: Next-token prediction is all you need.arXiv preprint arXiv:2409.18869, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01853","last_updated":"2025-06-02T16:40:50Z","snapshot_observed_at":"2026-08-15T01:34:26.509428Z","submitted_at":"2025-06-02T16:40:50Z","title":"ShapeLLM-Omni: A Native Multimodal LLM for 3D Generation and Understanding","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:27.981864Z"},"links":{"cited_paper":"/paper/2409.18869","citing_paper":"/paper/2506.01853"},"observation_digest":"sha256:5ea84dd40b930f2e89d4e820a46879db56e30b89e6f137b07595c642b9d1a194","observation_id":"24cdf760-9d93-4149-b3ce-c53b97e3e2bc","resolution":{"observed_at":"2026-08-07T11:37:27.981864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.03795","last_updated":"2024-03-28T09:40:08Z","snapshot_observed_at":"2026-08-13T05:08:44.972538Z","submitted_at":"2023-12-06T14:13:54Z","title":"AnimatableDreamer: Text-Guided Non-rigid 3D Model Generation and Reconstruction with Canonical Score Distillation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.03795","snapshot_observed_at":"2026-08-07T11:37:28.099457Z","title":"Animatabledreamer: Text-guided non-rigid 3d model generation and reconstruction with canonical score distillation.arXiv preprint arXiv:2312.03795, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01853","last_updated":"2025-06-02T16:40:50Z","snapshot_observed_at":"2026-08-15T01:34:26.509428Z","submitted_at":"2025-06-02T16:40:50Z","title":"ShapeLLM-Omni: A Native Multimodal LLM for 3D Generation and Understanding","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:28.099457Z"},"links":{"cited_paper":"/paper/2312.03795","citing_paper":"/paper/2506.01853"},"observation_digest":"sha256:2601b62cb9024e6b896c2027748f8877e56faa2ef21e69640e165289d7e64bd0","observation_id":"1b2bb92d-a1ce-4c3a-9e50-3f5acc78d6ae","resolution":{"observed_at":"2026-08-07T11:37:28.099457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:37:29.236426Z","title":"Prolificdreamer: High-fidelity and diverse text-to-3d generation with variational score distillation","venue":null,"work_id":"f17f347c-61c8-4e43-a2ac-6ed45353de71","year":2023},"citing_paper":{"arxiv_id":"2506.01853","last_updated":"2025-06-02T16:40:50Z","snapshot_observed_at":"2026-08-15T01:34:26.509428Z","submitted_at":"2025-06-02T16:40:50Z","title":"ShapeLLM-Omni: A Native Multimodal LLM for 3D Generation and Understanding","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:28.104174Z"},"links":{"citing_paper":"/paper/2506.01853"},"observation_digest":"sha256:14d468ab611ad49c07656f7069d7da1f2c88fc8c1e89e5430574578d978c63ca","observation_id":"f5491dbc-1144-45c2-8e25-78dfb6672c7d","resolution":{"observed_at":"2026-08-07T11:37:29.241422Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.09595","last_updated":"2024-11-14T17:08:23Z","snapshot_observed_at":"2026-08-12T20:26:30.915864Z","submitted_at":"2024-11-14T17:08:23Z","title":"LLaMA-Mesh: Unifying 3D Mesh Generation with Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.09595","snapshot_observed_at":"2026-08-07T11:37:28.108498Z","title":"Llama-mesh: Unifying 3d mesh generation with language models.arXiv preprint arXiv:2411.09595, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01853","last_updated":"2025-06-02T16:40:50Z","snapshot_observed_at":"2026-08-15T01:34:26.509428Z","submitted_at":"2025-06-02T16:40:50Z","title":"ShapeLLM-Omni: A Native Multimodal LLM for 3D Generation and Understanding","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:28.108498Z"},"links":{"cited_paper":"/paper/2411.09595","citing_paper":"/paper/2506.01853"},"observation_digest":"sha256:badab216fe564db51c437d78b8984f151e166f6b251bf0e67fb12e3cb46daf0f","observation_id":"7c388385-c785-46f1-8863-7b6063936576","resolution":{"observed_at":"2026-08-07T11:37:28.108498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05034","last_updated":"2024-03-08T04:25:29Z","snapshot_observed_at":"2026-08-13T00:59:35.990568Z","submitted_at":"2024-03-08T04:25:29Z","title":"CRM: Single Image to 3D Textured Mesh with Convolutional Reconstruction Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05034","snapshot_observed_at":"2026-08-07T11:37:28.112744Z","title":"Crm: Single image to 3d textured mesh with convolutional reconstruction model.arXiv preprint arXiv:2403.05034, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01853","last_updated":"2025-06-02T16:40:50Z","snapshot_observed_at":"2026-08-15T01:34:26.509428Z","submitted_at":"2025-06-02T16:40:50Z","title":"ShapeLLM-Omni: A Native Multimodal LLM for 3D Generation and Understanding","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:28.112744Z"},"links":{"cited_paper":"/paper/2403.05034","citing_paper":"/paper/2506.01853"},"observation_digest":"sha256:5c43ae8631783ac9b5a473d40ea853f3260cb27d582585b334d60eb79ef30290","observation_id":"b0000ef5-a4f6-44b7-b7e4-d8ae783ebf64","resolution":{"observed_at":"2026-08-07T11:37:28.112744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12385","last_updated":"2025-01-23T01:55:24Z","snapshot_observed_at":"2026-08-13T00:27:11.509443Z","submitted_at":"2024-04-18T17:59:41Z","title":"MeshLRM: Large Reconstruction Model for High-Quality Meshes","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12385","snapshot_observed_at":"2026-08-07T11:37:28.117281Z","title":"Meshlrm: Large reconstruction model for high-quality meshes.arXiv preprint arXiv:2404.12385, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01853","last_updated":"2025-06-02T16:40:50Z","snapshot_observed_at":"2026-08-15T01:34:26.509428Z","submitted_at":"2025-06-02T16:40:50Z","title":"ShapeLLM-Omni: A Native Multimodal LLM for 3D Generation and Understanding","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:28.117281Z"},"links":{"cited_paper":"/paper/2404.12385","citing_paper":"/paper/2506.01853"},"observation_digest":"sha256:3e7c5d4553c5089dda8cce24ce396124fa435c3e2ca59c40c555e0758e23de5b","observation_id":"44bd630b-97db-4f4b-9c5d-e36a6ac0bb3c","resolution":{"observed_at":"2026-08-07T11:37:28.117281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08092","last_updated":"2023-10-12T07:38:28Z","snapshot_observed_at":"2026-08-13T05:50:55.217640Z","submitted_at":"2023-10-12T07:38:28Z","title":"Consistent123: Improve Consistency for One Image to 3D Object Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08092","snapshot_observed_at":"2026-08-07T11:37:28.121774Z","title":"Consistent123: Improve consistency for one image to 3d object synthesis.arXiv preprint arXiv:2310.08092, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01853","last_updated":"2025-06-02T16:40:50Z","snapshot_observed_at":"2026-08-15T01:34:26.509428Z","submitted_at":"2025-06-02T16:40:50Z","title":"ShapeLLM-Omni: A Native Multimodal LLM for 3D Generation and Understanding","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:28.121774Z"},"links":{"cited_paper":"/paper/2310.08092","citing_paper":"/paper/2506.01853"},"observation_digest":"sha256:00d21ca73e5674e1b9775fc27d1fb0c8fccd12ed4db2d3f182b83d037d7aee22","observation_id":"07fba7ca-3dda-4c42-b7dc-25eeac45eda7","resolution":{"observed_at":"2026-08-07T11:37:28.121774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16890","last_updated":"2024-05-27T07:13:13Z","snapshot_observed_at":"2026-08-14T23:30:21.533880Z","submitted_at":"2024-05-27T07:13:13Z","title":"PivotMesh: Generic 3D Mesh Generation via Pivot Vertices Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16890","snapshot_observed_at":"2026-08-07T11:37:28.126162Z","title":"Pivotmesh: Generic 3d mesh generation via pivot vertices guidance.arXiv preprint arXiv:2405.16890, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01853","last_updated":"2025-06-02T16:40:50Z","snapshot_observed_at":"2026-08-15T01:34:26.509428Z","submitted_at":"2025-06-02T16:40:50Z","title":"ShapeLLM-Omni: A Native Multimodal LLM for 3D Generation and Understanding","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:28.126162Z"},"links":{"cited_paper":"/paper/2405.16890","citing_paper":"/paper/2506.01853"},"observation_digest":"sha256:8a6e8406680051aa16ffc991c58b8305c1703207f450686c938266e504a122ab","observation_id":"55c8ad8b-06b0-453b-8a8e-43df60ec9c9a","resolution":{"observed_at":"2026-08-07T11:37:28.126162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.07025","last_updated":"2024-11-11T14:30:35Z","snapshot_observed_at":"2026-08-12T22:03:18.157248Z","submitted_at":"2024-11-11T14:30:35Z","title":"Scaling Mesh Generation via Compressive Tokenization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.07025","snapshot_observed_at":"2026-08-07T11:37:28.130354Z","title":"Scaling mesh generation via compressive tokenization.arXiv preprint arXiv:2411.07025, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01853","last_updated":"2025-06-02T16:40:50Z","snapshot_observed_at":"2026-08-15T01:34:26.509428Z","submitted_at":"2025-06-02T16:40:50Z","title":"ShapeLLM-Omni: A Native Multimodal LLM for 3D Generation and Understanding","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:28.130354Z"},"links":{"cited_paper":"/paper/2411.07025","citing_paper":"/paper/2506.01853"},"observation_digest":"sha256:d1ef06e143942889b234f2e0c7441a6e096ce233ecd44c28bbd77bf4882c46e8","observation_id":"3263c51f-e5c3-4123-b0de-d29da82cab29","resolution":{"observed_at":"2026-08-07T11:37:28.130354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:37:29.221035Z","title":"Instructblip: Towards general-purpose vision-language models with instruction tuning [c]","venue":null,"work_id":"17e95762-a8c8-43ba-a331-4beb32952c17","year":2023},"citing_paper":{"arxiv_id":"2506.01853","last_updated":"2025-06-02T16:40:50Z","snapshot_observed_at":"2026-08-15T01:34:26.509428Z","submitted_at":"2025-06-02T16:40:50Z","title":"ShapeLLM-Omni: A Native Multimodal LLM for 3D Generation and Understanding","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:28.134585Z"},"links":{"citing_paper":"/paper/2506.01853"},"observation_digest":"sha256:961e39613a5290d9f1dbf3194de61135ee6c975f2843f69db661ca100d28f69e","observation_id":"5ef0d01b-adfe-4c8e-b14a-e045329109c9","resolution":{"observed_at":"2026-08-07T11:37:29.226115Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:37:29.205254Z","title":"Unique3d: High-quality and efficient 3d mesh generation from a single image","venue":null,"work_id":"250679d6-130c-4b0f-8270-8c0375949fcc","year":2024},"citing_paper":{"arxiv_id":"2506.01853","last_updated":"2025-06-02T16:40:50Z","snapshot_observed_at":"2026-08-15T01:34:26.509428Z","submitted_at":"2025-06-02T16:40:50Z","title":"ShapeLLM-Omni: A Native Multimodal LLM for 3D Generation and Understanding","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:28.138377Z"},"links":{"citing_paper":"/paper/2506.01853"},"observation_digest":"sha256:7be828f3024b64892630f347b0578e4dcfef683a222bc5e74935bda9fdb2394c","observation_id":"5b00c8d3-f7c8-4d21-b935-8441a953c2ea","resolution":{"observed_at":"2026-08-07T11:37:29.210607Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14832","last_updated":"2024-06-01T16:18:53Z","snapshot_observed_at":"2026-08-12T23:59:32.733928Z","submitted_at":"2024-05-23T17:49:37Z","title":"Direct3D: Scalable Image-to-3D Generation via 3D Latent Diffusion Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14832","snapshot_observed_at":"2026-08-07T11:37:28.142230Z","title":"Direct3d: Scalable image-to-3d generation via 3d latent diffusion transformer.arXiv preprint arXiv:2405.14832, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01853","last_updated":"2025-06-02T16:40:50Z","snapshot_observed_at":"2026-08-15T01:34:26.509428Z","submitted_at":"2025-06-02T16:40:50Z","title":"ShapeLLM-Omni: A Native Multimodal LLM for 3D Generation and Understanding","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:28.142230Z"},"links":{"cited_paper":"/paper/2405.14832","citing_paper":"/paper/2506.01853"},"observation_digest":"sha256:e8f9a0a80532b7b8c4fa2838ce3f05e0c8aed811a316fad625b9889627212ae6","observation_id":"42565f75-fbb4-4cd2-9e10-26813377ff33","resolution":{"observed_at":"2026-08-07T11:37:28.142230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01506","last_updated":"2025-05-30T11:13:13Z","snapshot_observed_at":"2026-08-12T21:21:00.340696Z","submitted_at":"2024-12-02T13:58:38Z","title":"Structured 3D Latents for Scalable and Versatile 3D Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.01506","snapshot_observed_at":"2026-08-07T11:37:28.146343Z","title":"Structured 3d latents for scalable and versatile 3d generation.arXiv preprint arXiv:2412.01506, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01853","last_updated":"2025-06-02T16:40:50Z","snapshot_observed_at":"2026-08-15T01:34:26.509428Z","submitted_at":"2025-06-02T16:40:50Z","title":"ShapeLLM-Omni: A Native Multimodal LLM for 3D Generation and Understanding","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:28.146343Z"},"links":{"cited_paper":"/paper/2412.01506","citing_paper":"/paper/2506.01853"},"observation_digest":"sha256:f105ab5fd51665e1fb8d4f9947c85bb013dc652e908c5cf6fe04b5b25351ebec","observation_id":"79cc8c9e-cd5c-4b99-8491-f56d2fcf006a","resolution":{"observed_at":"2026-08-07T11:37:28.146343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12528","last_updated":"2025-09-08T02:42:57Z","snapshot_observed_at":"2026-07-06T19:04:43.716629Z","submitted_at":"2024-08-22T16:32:32Z","title":"Show-o: One Single Transformer to Unify Multimodal Understanding and Generation","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.12528","snapshot_observed_at":"2026-08-07T11:37:28.150610Z","title":"Show-o: One single transformer to unify multimodal understanding and generation.arXiv preprint arXiv:2408.12528, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01853","last_updated":"2025-06-02T16:40:50Z","snapshot_observed_at":"2026-08-15T01:34:26.509428Z","submitted_at":"2025-06-02T16:40:50Z","title":"ShapeLLM-Omni: A Native Multimodal LLM for 3D Generation and Understanding","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:28.150610Z"},"links":{"cited_paper":"/paper/2408.12528","citing_paper":"/paper/2506.01853"},"observation_digest":"sha256:d2c195beea5969d70d007473de8254cfb5a552f3d3a512e95b756c28c6d09022","observation_id":"d7bd91bf-fc85-464e-b05d-50badb484302","resolution":{"observed_at":"2026-08-07T11:37:28.150610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07191","last_updated":"2024-04-14T16:54:24Z","snapshot_observed_at":"2026-08-13T18:57:44.379289Z","submitted_at":"2024-04-10T17:48:37Z","title":"InstantMesh: Efficient 3D Mesh Generation from a Single Image with Sparse-view Large Reconstruction Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07191","snapshot_observed_at":"2026-08-07T11:37:28.155632Z","title":"Instantmesh: Efficient 3d mesh generation from a single image with sparse-view large reconstruction models.arXiv preprint arXiv:2404.07191, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01853","last_updated":"2025-06-02T16:40:50Z","snapshot_observed_at":"2026-08-15T01:34:26.509428Z","submitted_at":"2025-06-02T16:40:50Z","title":"ShapeLLM-Omni: A Native Multimodal LLM for 3D Generation and Understanding","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:28.155632Z"},"links":{"cited_paper":"/paper/2404.07191","citing_paper":"/paper/2506.01853"},"observation_digest":"sha256:490b59b71a411a1e8399ad420ef4616d6369839fd5c38a5a348a0d3487c73e34","observation_id":"a0a569b7-a257-4d1a-9ce9-4b18ca190283","resolution":{"observed_at":"2026-08-07T11:37:28.155632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:37:29.190829Z","title":"Pointllm: Empow- ering large language models to understand point clouds","venue":null,"work_id":"22c80216-6ca2-487f-a865-80c070ef7812","year":2024},"citing_paper":{"arxiv_id":"2506.01853","last_updated":"2025-06-02T16:40:50Z","snapshot_observed_at":"2026-08-15T01:34:26.509428Z","submitted_at":"2025-06-02T16:40:50Z","title":"ShapeLLM-Omni: A Native Multimodal LLM for 3D Generation and Understanding","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:28.159995Z"},"links":{"citing_paper":"/paper/2506.01853"},"observation_digest":"sha256:95e31b148a1aeb32e050ce4f832c328cff5f5049bb2be05fe8d05ef000453482","observation_id":"4f68bb29-47c1-4b6f-9b10-3749e0f69e84","resolution":{"observed_at":"2026-08-07T11:37:29.195514Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.09217","last_updated":"2023-11-15T18:58:41Z","snapshot_observed_at":"2026-08-15T03:58:25.802831Z","submitted_at":"2023-11-15T18:58:41Z","title":"DMV3D: Denoising Multi-View Diffusion using 3D Large Reconstruction Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.09217","snapshot_observed_at":"2026-08-07T11:37:28.163979Z","title":"Dmv3d: Denoising multi-view diffusion using 3d large reconstruction model.arXiv preprint arXiv:2311.09217, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01853","last_updated":"2025-06-02T16:40:50Z","snapshot_observed_at":"2026-08-15T01:34:26.509428Z","submitted_at":"2025-06-02T16:40:50Z","title":"ShapeLLM-Omni: A Native Multimodal LLM for 3D Generation and Understanding","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:28.163979Z"},"links":{"cited_paper":"/paper/2311.09217","citing_paper":"/paper/2506.01853"},"observation_digest":"sha256:fab29348f742a6bb035b46c178c50d76e6b6f9083b8085b51f84835d3d4aaac5","observation_id":"248e081b-02e5-43b8-93d4-c0415496802f","resolution":{"observed_at":"2026-08-07T11:37:28.163979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:37:29.175705Z","title":"Ulip: Learning a unified representation of language, images, and point clouds for 3d understanding","venue":null,"work_id":"2935d571-6148-435d-8c6e-43343346bbb7","year":2023},"citing_paper":{"arxiv_id":"2506.01853","last_updated":"2025-06-02T16:40:50Z","snapshot_observed_at":"2026-08-15T01:34:26.509428Z","submitted_at":"2025-06-02T16:40:50Z","title":"ShapeLLM-Omni: A Native Multimodal LLM for 3D Generation and Understanding","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:28.168417Z"},"links":{"citing_paper":"/paper/2506.01853"},"observation_digest":"sha256:f42ef6347a1720cd7ae4b29eb5bd5c9b3836c50abbe12d36384508325d225cc9","observation_id":"35c12590-3fb0-410a-8e52-c71e84238aa7","resolution":{"observed_at":"2026-08-07T11:37:29.181138Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02293","last_updated":"2025-01-23T09:51:37Z","snapshot_observed_at":"2026-08-12T22:08:04.306356Z","submitted_at":"2024-11-04T17:21:42Z","title":"Hunyuan3D 1.0: A Unified Framework for Text-to-3D and Image-to-3D Generation","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02293","snapshot_observed_at":"2026-08-07T11:37:28.173079Z","title":"Hunyuan3d 1.0: A unified framework for text-to-3d and image-to-3d generation.arXiv preprint arXiv:2411.02293, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01853","last_updated":"2025-06-02T16:40:50Z","snapshot_observed_at":"2026-08-15T01:34:26.509428Z","submitted_at":"2025-06-02T16:40:50Z","title":"ShapeLLM-Omni: A Native Multimodal LLM for 3D Generation and Understanding","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:28.173079Z"},"links":{"cited_paper":"/paper/2411.02293","citing_paper":"/paper/2506.01853"},"observation_digest":"sha256:e6d0dbcd7cbbcc95b8599698c9634a3f39fae91a6efa8cbc7c77d45a0fcde796","observation_id":"7341f3c5-bcf7-41d6-8fb0-f87f3d62177f","resolution":{"observed_at":"2026-08-07T11:37:28.173079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:37:29.162356Z","title":"Stablenormal: Reducing diffusion variance for stable and sharp normal.ACM Transactions on Graphics (TOG), 2024","venue":null,"work_id":"bda6d2b4-592c-4a38-ab9b-826f0efc9c1f","year":2024},"citing_paper":{"arxiv_id":"2506.01853","last_updated":"2025-06-02T16:40:50Z","snapshot_observed_at":"2026-08-15T01:34:26.509428Z","submitted_at":"2025-06-02T16:40:50Z","title":"ShapeLLM-Omni: A Native Multimodal LLM for 3D Generation and Understanding","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:28.178056Z"},"links":{"citing_paper":"/paper/2506.01853"},"observation_digest":"sha256:c07667b02d8e5720e7455a9d1e4f1ad385d3f556a9f501ea5b74545df4362d6b","observation_id":"9e7b8e8c-facb-4bb0-a876-ad901c364d41","resolution":{"observed_at":"2026-08-07T11:37:29.166583Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.22236","last_updated":"2025-03-31T03:41:01Z","snapshot_observed_at":"2026-08-07T16:30:49.890051Z","submitted_at":"2025-03-28T08:39:20Z","title":"Hi3DGen: High-fidelity 3D Geometry Generation from Images via Normal Bridging","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.22236","snapshot_observed_at":"2026-08-07T11:37:28.182157Z","title":"Hi3dgen: High-fidelity 3d geometry generation from images via normal bridging.arXiv preprint arXiv:2503.22236, 3, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01853","last_updated":"2025-06-02T16:40:50Z","snapshot_observed_at":"2026-08-15T01:34:26.509428Z","submitted_at":"2025-06-02T16:40:50Z","title":"ShapeLLM-Omni: A Native Multimodal LLM for 3D Generation and Understanding","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:28.182157Z"},"links":{"cited_paper":"/paper/2503.22236","citing_paper":"/paper/2506.01853"},"observation_digest":"sha256:2d34064ff49b6210c8e96dc2605ca55aa88a26fe6e8c571a846eff9ed402cf64","observation_id":"58f0e69d-0225-4bb6-b596-1ff0dadb5337","resolution":{"observed_at":"2026-08-07T11:37:28.182157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:37:29.147076Z","title":"Dreamreward: Text-to-3d generation with human preference","venue":null,"work_id":"8c52bdc9-0e65-40be-a0d2-e7b4f577a20c","year":2024},"citing_paper":{"arxiv_id":"2506.01853","last_updated":"2025-06-02T16:40:50Z","snapshot_observed_at":"2026-08-15T01:34:26.509428Z","submitted_at":"2025-06-02T16:40:50Z","title":"ShapeLLM-Omni: A Native Multimodal LLM for 3D Generation and Understanding","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:28.186239Z"},"links":{"citing_paper":"/paper/2506.01853"},"observation_digest":"sha256:52656e1a9e355261e6dcbaaa9c0b71979c8fffdb4099c147ee293e549d0f6123","observation_id":"9aa9e4a7-b61b-45d7-9a7e-dcc7c9c80f0d","resolution":{"observed_at":"2026-08-07T11:37:29.152175Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:37:28.190244Z","title":"Gaussiandreamer: Fast generation from text to 3d gaussians by bridging 2d and 3d diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01853","last_updated":"2025-06-02T16:40:50Z","snapshot_observed_at":"2026-08-15T01:34:26.509428Z","submitted_at":"2025-06-02T16:40:50Z","title":"ShapeLLM-Omni: A Native Multimodal LLM for 3D Generation and Understanding","version":1},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:28.190244Z"},"links":{"citing_paper":"/paper/2506.01853"},"observation_digest":"sha256:b347a3618f4e59f218f6a6b1735696e2b12423e0a92bcffaceb21e2a77fdf440","observation_id":"519efb95-2708-446d-8153-02e02ec65380","resolution":{"observed_at":"2026-08-07T11:37:28.190244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15333","last_updated":"2024-10-28T08:33:02Z","snapshot_observed_at":"2026-08-12T23:37:20.581758Z","submitted_at":"2024-06-21T17:49:31Z","title":"GeoLRM: Geometry-Aware Large Reconstruction Model for High-Quality 3D Gaussian Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15333","snapshot_observed_at":"2026-08-07T11:37:28.194043Z","title":"Geolrm: Geometry-aware large reconstruction model for high-quality 3d gaussian generation.arXiv preprint arXiv:2406.15333, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01853","last_updated":"2025-06-02T16:40:50Z","snapshot_observed_at":"2026-08-15T01:34:26.509428Z","submitted_at":"2025-06-02T16:40:50Z","title":"ShapeLLM-Omni: A Native Multimodal LLM for 3D Generation and Understanding","version":1},"reference_index":102,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:28.194043Z"},"links":{"cited_paper":"/paper/2406.15333","citing_paper":"/paper/2506.01853"},"observation_digest":"sha256:4896c843b9bb6d78473d3b5ab23b45b9ac1db70f9bb431c8168522b7beacbe96","observation_id":"033307e0-27f1-49de-92b0-ea735b1e2f90","resolution":{"observed_at":"2026-08-07T11:37:28.194043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.01853","last_updated":"2025-06-02T16:40:50Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T01:34:26.509428Z","submitted_at":"2025-06-02T16:40:50Z","title":"ShapeLLM-Omni: A Native Multimodal LLM for 3D Generation and Understanding"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":89,"verified_exact":0,"verified_fuzzy":11},"total_outbound_references":108},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 100 of 108 outbound references and 11 inbound Pith citation observations for arXiv:2506.01853."}