{"as_of":"2026-08-15T13:44:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:45c6c17235b394b92be15e9e507371b9e15e504a7d34049896a51db53aee25a4","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":27,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":27,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":27,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":27,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T10:10:38.185094Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":3,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.11832","last_updated":"2024-10-29T06:44:36Z","snapshot_observed_at":"2026-08-12T23:40:46.200424Z","submitted_at":"2024-06-17T17:59:44Z","title":"Unveiling Encoder-Free Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2406.11832","doi":"10.48550/arxiv.2406.11832","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.11832","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Pixart-sigma: Weak-to-strong training of diffusion transformer for 4k text-to-image generation","venue":"arXiv (Cornell University)","work_id":"89919d42-8c59-4aa5-8229-9d3bed0670e3","year":2024},"citing_paper":{"arxiv_id":"2407.07726","last_updated":"2024-10-10T17:28:23Z","snapshot_observed_at":"2026-08-08T07:16:45.596308Z","submitted_at":"2024-07-10T14:57:46Z","title":"PaliGemma: A versatile 3B VLM for transfer","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-11T13:10:19.972353Z"},"links":{"cited_paper":"/paper/2406.11832","citing_paper":"/paper/2407.07726"},"observation_digest":"sha256:6172f701837375299723508dbc0f32577350f7e3cdd483eabcc0ef3580bde330","observation_id":"b1462b5b-21a8-4213-ba81-c3c614305d62","resolution":{"observed_at":"2026-05-11T13:10:20.790119Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11832","last_updated":"2024-10-29T06:44:36Z","snapshot_observed_at":"2026-08-12T23:40:46.200424Z","submitted_at":"2024-06-17T17:59:44Z","title":"Unveiling Encoder-Free Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2406.11832","doi":"10.48550/arxiv.2406.11832","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.11832","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Pixart-sigma: Weak-to-strong training of diffusion transformer for 4k text-to-image generation","venue":"arXiv (Cornell University)","work_id":"89919d42-8c59-4aa5-8229-9d3bed0670e3","year":2024},"citing_paper":{"arxiv_id":"2409.18869","last_updated":"2024-09-27T16:06:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T16:06:11Z","title":"Emu3: Next-Token Prediction is All You Need","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-11T10:56:06.418360Z"},"links":{"cited_paper":"/paper/2406.11832","citing_paper":"/paper/2409.18869"},"observation_digest":"sha256:74fdf0b792dc4ebd3398578129b3879d183c65bbe7b57e508089531c4c3c39f0","observation_id":"66838fd0-dab7-475e-b7dd-0ad5dc33381b","resolution":{"observed_at":"2026-05-11T10:56:07.501418Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11832","last_updated":"2024-10-29T06:44:36Z","snapshot_observed_at":"2026-08-12T23:40:46.200424Z","submitted_at":"2024-06-17T17:59:44Z","title":"Unveiling Encoder-Free Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11832","snapshot_observed_at":"2026-08-12T10:10:38.185094Z","title":"Unveiling encoder-free vision-language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.19488","last_updated":"2025-03-17T09:01:38Z","snapshot_observed_at":"2026-08-12T21:26:33.151349Z","submitted_at":"2024-11-29T06:06:35Z","title":"Interleaved-Modal Chain-of-Thought","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T10:10:38.185094Z"},"links":{"cited_paper":"/paper/2406.11832","citing_paper":"/paper/2411.19488"},"observation_digest":"sha256:ff0a7e9af777d0dd08807e7b50721d0671034a3a8391082eef4735129486e13b","observation_id":"81d5e71b-6d5f-4eef-9a8a-2c6473d63b89","resolution":{"observed_at":"2026-08-12T10:10:38.185094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11832","last_updated":"2024-10-29T06:44:36Z","snapshot_observed_at":"2026-08-12T23:40:46.200424Z","submitted_at":"2024-06-17T17:59:44Z","title":"Unveiling Encoder-Free Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11832","snapshot_observed_at":"2026-08-11T17:00:08.661560Z","title":"Unveiling encoder-free vision-language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.09604","last_updated":"2024-12-12T18:59:26Z","snapshot_observed_at":"2026-08-13T21:41:53.471697Z","submitted_at":"2024-12-12T18:59:26Z","title":"SynerGen-VL: Towards Synergistic Image Understanding and Generation with Vision Experts and Token Folding","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T17:00:08.661560Z"},"links":{"cited_paper":"/paper/2406.11832","citing_paper":"/paper/2412.09604"},"observation_digest":"sha256:780ee1f4d7a130b08d128c8a555aa9ce81bea5e9f18573ac633f06705e20d5a2","observation_id":"16ee3840-c0b6-4cfc-b6cd-a81b11080e4d","resolution":{"observed_at":"2026-08-11T17:00:08.661560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11832","last_updated":"2024-10-29T06:44:36Z","snapshot_observed_at":"2026-08-12T23:40:46.200424Z","submitted_at":"2024-06-17T17:59:44Z","title":"Unveiling Encoder-Free Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11832","snapshot_observed_at":"2026-08-11T15:41:07.405342Z","title":"Unveili ng encoder-free vision-language models,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.10758","last_updated":"2024-12-14T09:04:32Z","snapshot_observed_at":"2026-08-14T23:38:29.329686Z","submitted_at":"2024-12-14T09:04:32Z","title":"Optimizing Vision-Language Interactions Through Decoder-Only Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T15:41:07.405342Z"},"links":{"cited_paper":"/paper/2406.11832","citing_paper":"/paper/2412.10758"},"observation_digest":"sha256:0783450406706fc62773cefbe1bbc8d47123673cbfc1a84482b4233d12edae78","observation_id":"de7930ef-f9ba-4cdf-8795-e67183fa8da3","resolution":{"observed_at":"2026-08-11T15:41:07.405342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11832","last_updated":"2024-10-29T06:44:36Z","snapshot_observed_at":"2026-08-12T23:40:46.200424Z","submitted_at":"2024-06-17T17:59:44Z","title":"Unveiling Encoder-Free Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11832","snapshot_observed_at":"2026-08-11T15:41:07.412311Z","title":"Available: https://doi.org/10.48550/ar Xiv.2406.11832","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.10758","last_updated":"2024-12-14T09:04:32Z","snapshot_observed_at":"2026-08-14T23:38:29.329686Z","submitted_at":"2024-12-14T09:04:32Z","title":"Optimizing Vision-Language Interactions Through Decoder-Only Models","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-11T15:41:07.412311Z"},"links":{"cited_paper":"/paper/2406.11832","citing_paper":"/paper/2412.10758"},"observation_digest":"sha256:4d5d21e283b44e06dede65cc745bc8b106711ba97c8aa195850514f8f8c9635c","observation_id":"d9efcc2f-8978-4d23-97a8-97fad21a7f40","resolution":{"observed_at":"2026-08-11T15:41:07.412311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11832","last_updated":"2024-10-29T06:44:36Z","snapshot_observed_at":"2026-08-12T23:40:46.200424Z","submitted_at":"2024-06-17T17:59:44Z","title":"Unveiling Encoder-Free Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11832","snapshot_observed_at":"2026-08-11T14:13:24.448179Z","title":"Unveiling encoder-free vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12359","last_updated":"2025-01-07T15:36:54Z","snapshot_observed_at":"2026-08-13T23:35:02.697596Z","submitted_at":"2024-12-16T21:14:11Z","title":"LLaVA Steering: Visual Instruction Tuning with 500x Fewer Parameters through Modality Linear Representation-Steering","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-11T14:13:24.448179Z"},"links":{"cited_paper":"/paper/2406.11832","citing_paper":"/paper/2412.12359"},"observation_digest":"sha256:ab1761ee038d787467808b1b08b8c42209dab27e2f2fa4c5788b2be2cbe15a83","observation_id":"b77644af-4a32-4f32-9ec4-3fc6f4dbf302","resolution":{"observed_at":"2026-08-11T14:13:24.448179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11832","last_updated":"2024-10-29T06:44:36Z","snapshot_observed_at":"2026-08-12T23:40:46.200424Z","submitted_at":"2024-06-17T17:59:44Z","title":"Unveiling Encoder-Free Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11832","snapshot_observed_at":"2026-08-11T13:19:23.160965Z","title":"Unveiling encoder-free vision-language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.13303","last_updated":"2025-05-15T22:00:19Z","snapshot_observed_at":"2026-08-15T01:32:05.414283Z","submitted_at":"2024-12-17T20:09:55Z","title":"FastVLM: Efficient Vision Encoding for Vision Language Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T13:19:23.160965Z"},"links":{"cited_paper":"/paper/2406.11832","citing_paper":"/paper/2412.13303"},"observation_digest":"sha256:8e17b48d856f024e792c3eca251a59fe76eeeca11b36fc5ca9825631af42fd76","observation_id":"f2eaaa8b-b60f-4334-adcf-1a09a07d5bea","resolution":{"observed_at":"2026-08-11T13:19:23.160965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11832","last_updated":"2024-10-29T06:44:36Z","snapshot_observed_at":"2026-08-12T23:40:46.200424Z","submitted_at":"2024-06-17T17:59:44Z","title":"Unveiling Encoder-Free Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2406.11832","doi":"10.48550/arxiv.2406.11832","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.11832","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Pixart-sigma: Weak-to-strong training of diffusion transformer for 4k text-to-image generation","venue":"arXiv (Cornell University)","work_id":"89919d42-8c59-4aa5-8229-9d3bed0670e3","year":2024},"citing_paper":{"arxiv_id":"2412.14169","last_updated":"2025-03-02T08:09:39Z","snapshot_observed_at":"2026-08-13T00:09:27.237577Z","submitted_at":"2024-12-18T18:59:53Z","title":"Autoregressive Video Generation without Vector Quantization","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-17T15:07:39.718555Z"},"links":{"cited_paper":"/paper/2406.11832","citing_paper":"/paper/2412.14169"},"observation_digest":"sha256:7738bfb6021dc0cec44d9438f5a87d203138741d73dd2d634f9f48932918d68c","observation_id":"7d57e557-7d78-405d-89fe-b6177df03839","resolution":{"observed_at":"2026-05-17T15:07:39.775119Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11832","last_updated":"2024-10-29T06:44:36Z","snapshot_observed_at":"2026-08-12T23:40:46.200424Z","submitted_at":"2024-06-17T17:59:44Z","title":"Unveiling Encoder-Free Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11832","snapshot_observed_at":"2026-08-11T12:20:25.637117Z","title":"Unveiling encoder-free vision-language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14373","last_updated":"2025-07-29T21:20:14Z","snapshot_observed_at":"2026-08-15T10:32:35.619255Z","submitted_at":"2024-12-18T22:13:21Z","title":"ECG-Byte: A Tokenizer for End-to-End Generative Electrocardiogram Language Modeling","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-11T12:20:25.637117Z"},"links":{"cited_paper":"/paper/2406.11832","citing_paper":"/paper/2412.14373"},"observation_digest":"sha256:fbbb392ae7625fc53131ebe28306248a1c1a56f4f596cda9f3013c69c9fa5eb8","observation_id":"7e1bbfec-005f-4607-b11a-17934885a95c","resolution":{"observed_at":"2026-08-11T12:20:25.637117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11832","last_updated":"2024-10-29T06:44:36Z","snapshot_observed_at":"2026-08-12T23:40:46.200424Z","submitted_at":"2024-06-17T17:59:44Z","title":"Unveiling Encoder-Free Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11832","snapshot_observed_at":"2026-08-11T10:49:08.009009Z","title":"Unveiling encoder-free 13 vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.16158","last_updated":"2025-02-09T05:35:18Z","snapshot_observed_at":"2026-08-15T07:37:36.527948Z","submitted_at":"2024-12-20T18:59:59Z","title":"HoVLE: Unleashing the Power of Monolithic Vision-Language Models with Holistic Vision-Language Embedding","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:08.009009Z"},"links":{"cited_paper":"/paper/2406.11832","citing_paper":"/paper/2412.16158"},"observation_digest":"sha256:6e6cf8cb6af29689b4c44c8eda4fc3385c3a278cecad31ca3ed42bee6d9cfe87","observation_id":"09609b9d-e3e4-4981-bc3b-3ab8bd6810fa","resolution":{"observed_at":"2026-08-11T10:49:08.009009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11832","last_updated":"2024-10-29T06:44:36Z","snapshot_observed_at":"2026-08-12T23:40:46.200424Z","submitted_at":"2024-06-17T17:59:44Z","title":"Unveiling Encoder-Free Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11832","snapshot_observed_at":"2026-08-11T14:59:01.509004Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18619","last_updated":"2024-12-30T03:00:30Z","snapshot_observed_at":"2026-08-13T14:56:43.704817Z","submitted_at":"2024-12-16T05:02:25Z","title":"Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:01.509004Z"},"links":{"cited_paper":"/paper/2406.11832","citing_paper":"/paper/2412.18619"},"observation_digest":"sha256:1e75d0ae0e0287f3236249087915fdbe740ff9da6140d6107720b76d5de0cbdb","observation_id":"45336d13-7523-4ecb-a115-66b85f1dd4c4","resolution":{"observed_at":"2026-08-11T14:59:01.509004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11832","last_updated":"2024-10-29T06:44:36Z","snapshot_observed_at":"2026-08-12T23:40:46.200424Z","submitted_at":"2024-06-17T17:59:44Z","title":"Unveiling Encoder-Free Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11832","snapshot_observed_at":"2026-08-08T14:25:30.501449Z","title":"Unveiling encoder-free vision-language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06779","last_updated":"2025-02-10T18:56:14Z","snapshot_observed_at":"2026-08-14T22:56:51.692051Z","submitted_at":"2025-02-10T18:56:14Z","title":"KARST: Multi-Kernel Kronecker Adaptation with Re-Scaling Transmission for Visual Classification","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-08T14:25:30.501449Z"},"links":{"cited_paper":"/paper/2406.11832","citing_paper":"/paper/2502.06779"},"observation_digest":"sha256:90ca23d34dae7a2a181e9293e63f45be5f092d4469a26e831e84ead40a9204d2","observation_id":"353cc42d-074c-4cc4-a546-351ab013e0d6","resolution":{"observed_at":"2026-08-08T14:25:30.501449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11832","last_updated":"2024-10-29T06:44:36Z","snapshot_observed_at":"2026-08-12T23:40:46.200424Z","submitted_at":"2024-06-17T17:59:44Z","title":"Unveiling Encoder-Free Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11832","snapshot_observed_at":"2026-08-08T14:25:55.616853Z","title":"Unveiling encoder-free vision-language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06788","last_updated":"2025-07-24T10:29:52Z","snapshot_observed_at":"2026-08-09T02:10:24.105469Z","submitted_at":"2025-02-10T18:59:58Z","title":"EVEv2: Improved Baselines for Encoder-Free Vision-Language Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-08T14:25:55.616853Z"},"links":{"cited_paper":"/paper/2406.11832","citing_paper":"/paper/2502.06788"},"observation_digest":"sha256:14416b649922e1bad81acba9e87a3fd19cc8ce9fbcc93625d3c0e6a2372753dc","observation_id":"ae6bffc1-ee39-4e33-abcb-314b493cca86","resolution":{"observed_at":"2026-08-08T14:25:55.616853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11832","last_updated":"2024-10-29T06:44:36Z","snapshot_observed_at":"2026-08-12T23:40:46.200424Z","submitted_at":"2024-06-17T17:59:44Z","title":"Unveiling Encoder-Free Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2406.11832","doi":"10.48550/arxiv.2406.11832","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.11832","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Pixart-sigma: Weak-to-strong training of diffusion transformer for 4k text-to-image generation","venue":"arXiv (Cornell University)","work_id":"89919d42-8c59-4aa5-8229-9d3bed0670e3","year":2024},"citing_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-11T05:26:04.960844Z"},"links":{"cited_paper":"/paper/2406.11832","citing_paper":"/paper/2505.07062"},"observation_digest":"sha256:246f921048e370239821b1c0160dd43620d78d58bdfef291acba7856fc3cd633","observation_id":"5c81fc57-ac1e-4e04-81bb-c0024add02cb","resolution":{"observed_at":"2026-05-11T05:26:05.462877Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11832","last_updated":"2024-10-29T06:44:36Z","snapshot_observed_at":"2026-08-12T23:40:46.200424Z","submitted_at":"2024-06-17T17:59:44Z","title":"Unveiling Encoder-Free Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2406.11832","doi":"10.48550/arxiv.2406.11832","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.11832","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Pixart-sigma: Weak-to-strong training of diffusion transformer for 4k text-to-image generation","venue":"arXiv (Cornell University)","work_id":"89919d42-8c59-4aa5-8229-9d3bed0670e3","year":2024},"citing_paper":{"arxiv_id":"2506.01844","last_updated":"2025-06-02T16:30:19Z","snapshot_observed_at":"2026-08-13T11:17:54.365190Z","submitted_at":"2025-06-02T16:30:19Z","title":"SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-11T21:22:36.902119Z"},"links":{"cited_paper":"/paper/2406.11832","citing_paper":"/paper/2506.01844"},"observation_digest":"sha256:5f81515d18dad7c607411d72aed033e9ee27b38cbbdc958fdc2bf9c33ca44b08","observation_id":"7778795f-6ccf-4f52-8b8e-cc97d9ed29f7","resolution":{"observed_at":"2026-05-11T21:22:37.309970Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11832","last_updated":"2024-10-29T06:44:36Z","snapshot_observed_at":"2026-08-12T23:40:46.200424Z","submitted_at":"2024-06-17T17:59:44Z","title":"Unveiling Encoder-Free Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11832","snapshot_observed_at":"2026-08-07T11:16:15.700721Z","title":"arXiv:2406.11832 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02975","last_updated":"2025-06-03T15:14:00Z","snapshot_observed_at":"2026-08-14T12:37:41.784002Z","submitted_at":"2025-06-03T15:14:00Z","title":"HaploOmni: Unified Single Transformer for Multimodal Video Understanding and Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T11:16:15.700721Z"},"links":{"cited_paper":"/paper/2406.11832","citing_paper":"/paper/2506.02975"},"observation_digest":"sha256:ca563449879bbde21d598aa55407df2f6b29532fd3399c772087fc948d1af624","observation_id":"9713abf4-f732-4f4c-9f1b-cdedf42b3fbf","resolution":{"observed_at":"2026-08-07T11:16:15.700721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11832","last_updated":"2024-10-29T06:44:36Z","snapshot_observed_at":"2026-08-12T23:40:46.200424Z","submitted_at":"2024-06-17T17:59:44Z","title":"Unveiling Encoder-Free Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11832","snapshot_observed_at":"2026-08-07T00:23:47.368477Z","title":"Unveiling encoder-free vision-language models.arXiv preprint arXiv:2406.11832, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14471","last_updated":"2025-06-17T12:35:23Z","snapshot_observed_at":"2026-08-15T10:12:22.968481Z","submitted_at":"2025-06-17T12:35:23Z","title":"Dense360: Dense Understanding from Omnidirectional Panoramas","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:47.368477Z"},"links":{"cited_paper":"/paper/2406.11832","citing_paper":"/paper/2506.14471"},"observation_digest":"sha256:bead5cf75467e5d032d9502ee35143cefaeff8c21da6a894438a140d3692e87f","observation_id":"6a10af03-a77f-46dc-9977-4ebbbfb433b1","resolution":{"observed_at":"2026-08-07T00:23:47.368477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11832","last_updated":"2024-10-29T06:44:36Z","snapshot_observed_at":"2026-08-12T23:40:46.200424Z","submitted_at":"2024-06-17T17:59:44Z","title":"Unveiling Encoder-Free Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2406.11832","doi":"10.48550/arxiv.2406.11832","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.11832","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Pixart-sigma: Weak-to-strong training of diffusion transformer for 4k text-to-image generation","venue":"arXiv (Cornell University)","work_id":"89919d42-8c59-4aa5-8229-9d3bed0670e3","year":2024},"citing_paper":{"arxiv_id":"2506.15564","last_updated":"2025-09-22T01:24:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-18T15:39:15Z","title":"Show-o2: Improved Native Unified Multimodal Models","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-12T18:51:15.428692Z"},"links":{"cited_paper":"/paper/2406.11832","citing_paper":"/paper/2506.15564"},"observation_digest":"sha256:4d17a7200dc5379ee77c8b80f10a4939ce2f64eba925bd0f3156bbcaace6adbc","observation_id":"077632fb-0668-46c5-a881-19e25638e747","resolution":{"observed_at":"2026-05-12T18:51:16.044495Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11832","last_updated":"2024-10-29T06:44:36Z","snapshot_observed_at":"2026-08-12T23:40:46.200424Z","submitted_at":"2024-06-17T17:59:44Z","title":"Unveiling Encoder-Free Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11832","snapshot_observed_at":"2026-08-06T21:19:44.483409Z","title":"Unveiling encoder-free vision-language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.00505","last_updated":"2025-07-04T13:15:34Z","snapshot_observed_at":"2026-08-13T05:55:37.114749Z","submitted_at":"2025-07-01T07:20:11Z","title":"LLaVA-SP: Enhancing Visual Representation with Visual Spatial Tokens for MLLMs","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:44.483409Z"},"links":{"cited_paper":"/paper/2406.11832","citing_paper":"/paper/2507.00505"},"observation_digest":"sha256:603abc6ebe0e874bbfc6f7bc473fc7e2b7369557b385dd7cc66a3ec543a2f1ef","observation_id":"e7305b86-daf9-40fe-b4aa-958b5de44d65","resolution":{"observed_at":"2026-08-06T21:19:44.483409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11832","last_updated":"2024-10-29T06:44:36Z","snapshot_observed_at":"2026-08-12T23:40:46.200424Z","submitted_at":"2024-06-17T17:59:44Z","title":"Unveiling Encoder-Free Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11832","snapshot_observed_at":"2026-08-06T19:15:26.468458Z","title":"Unveiling encoder-free vision-language models.arXiv preprint arXiv:2406.11832,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.06137","last_updated":"2025-07-08T16:19:45Z","snapshot_observed_at":"2026-08-08T22:26:24.906449Z","submitted_at":"2025-07-08T16:19:45Z","title":"NeoBabel: A Multilingual Open Tower for Visual Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:26.468458Z"},"links":{"cited_paper":"/paper/2406.11832","citing_paper":"/paper/2507.06137"},"observation_digest":"sha256:c6d6129e3b7c475082e7e6086b6cbd292f3ef51623fba6cae8537f0a7492bb54","observation_id":"9946d252-2a16-4bd1-a9e0-50e93c74d681","resolution":{"observed_at":"2026-08-06T19:15:26.468458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11832","last_updated":"2024-10-29T06:44:36Z","snapshot_observed_at":"2026-08-12T23:40:46.200424Z","submitted_at":"2024-06-17T17:59:44Z","title":"Unveiling Encoder-Free Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11832","snapshot_observed_at":"2026-08-06T16:49:56.218152Z","title":"Unveiling encoder-free vision-language models,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-14T14:21:45.537414Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:56.218152Z"},"links":{"cited_paper":"/paper/2406.11832","citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:986bb52f0ed48baee061a6f5a4519bde3cd7fe21cc430592e8bc9b93c0f88d48","observation_id":"31e4b70e-3842-4761-9ffd-58b30ea63fba","resolution":{"observed_at":"2026-08-06T16:49:56.218152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11832","last_updated":"2024-10-29T06:44:36Z","snapshot_observed_at":"2026-08-12T23:40:46.200424Z","submitted_at":"2024-06-17T17:59:44Z","title":"Unveiling Encoder-Free Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2406.11832","doi":"10.48550/arxiv.2406.11832","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.11832","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Pixart-sigma: Weak-to-strong training of diffusion transformer for 4k text-to-image generation","venue":"arXiv (Cornell University)","work_id":"89919d42-8c59-4aa5-8229-9d3bed0670e3","year":2024},"citing_paper":{"arxiv_id":"2604.09088","last_updated":"2026-04-10T08:16:59Z","snapshot_observed_at":"2026-08-11T16:03:30.442738Z","submitted_at":"2026-04-10T08:16:59Z","title":"Memory-Efficient Transfer Learning with Fading Side Networks via Masked Dual Path Distillation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-10T16:45:36.306400Z"},"links":{"cited_paper":"/paper/2406.11832","citing_paper":"/paper/2604.09088"},"observation_digest":"sha256:a3e7715a7c4b9eb5a74a9a148ab1305c594d6fb2062544b4d8c00296c4d775cf","observation_id":"3412c648-d966-4653-9424-1378125f9dd4","resolution":{"observed_at":"2026-05-11T08:15:58.922895Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11832","last_updated":"2024-10-29T06:44:36Z","snapshot_observed_at":"2026-08-12T23:40:46.200424Z","submitted_at":"2024-06-17T17:59:44Z","title":"Unveiling Encoder-Free Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2406.11832","doi":"10.48550/arxiv.2406.11832","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.11832","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Pixart-sigma: Weak-to-strong training of diffusion transformer for 4k text-to-image generation","venue":"arXiv (Cornell University)","work_id":"89919d42-8c59-4aa5-8229-9d3bed0670e3","year":2024},"citing_paper":{"arxiv_id":"2605.04058","last_updated":"2026-04-10T08:00:28Z","snapshot_observed_at":"2026-07-06T23:16:54.673178Z","submitted_at":"2026-04-10T08:00:28Z","title":"MP-ISMoE: Mixed-Precision Interactive Side Mixture-of-Experts for Efficient Transfer Learning","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-05-10T17:19:59.247074Z"},"links":{"cited_paper":"/paper/2406.11832","citing_paper":"/paper/2605.04058"},"observation_digest":"sha256:c357d266aa72aa226ca1c3a86a5ca5ae81b8a769749da36679faccf455f654f3","observation_id":"6820083f-b286-49e2-9af7-96923cc49188","resolution":{"observed_at":"2026-05-11T07:01:13.486294Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11832","last_updated":"2024-10-29T06:44:36Z","snapshot_observed_at":"2026-08-12T23:40:46.200424Z","submitted_at":"2024-06-17T17:59:44Z","title":"Unveiling Encoder-Free Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2406.11832","doi":"10.48550/arxiv.2406.11832","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.11832","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Pixart-sigma: Weak-to-strong training of diffusion transformer for 4k text-to-image generation","venue":"arXiv (Cornell University)","work_id":"89919d42-8c59-4aa5-8229-9d3bed0670e3","year":2024},"citing_paper":{"arxiv_id":"2605.28820","last_updated":"2026-05-27T17:59:55Z","snapshot_observed_at":"2026-08-13T00:10:15.874365Z","submitted_at":"2026-05-27T17:59:55Z","title":"From Pixels to Words -- Towards Native One-Vision Models at Scale","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-29T13:29:53.006064Z"},"links":{"cited_paper":"/paper/2406.11832","citing_paper":"/paper/2605.28820"},"observation_digest":"sha256:a61c6774398040b85c61f347283b93ff6e7a51afba2d73065e2624b22d614989","observation_id":"3ff67812-984b-4a7f-8fc2-d12182f1d980","resolution":{"observed_at":"2026-06-29T13:33:28.011099Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11832","last_updated":"2024-10-29T06:44:36Z","snapshot_observed_at":"2026-08-12T23:40:46.200424Z","submitted_at":"2024-06-17T17:59:44Z","title":"Unveiling Encoder-Free Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2406.11832","doi":"10.48550/arxiv.2406.11832","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.11832","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Pixart-sigma: Weak-to-strong training of diffusion transformer for 4k text-to-image generation","venue":"arXiv (Cornell University)","work_id":"89919d42-8c59-4aa5-8229-9d3bed0670e3","year":2024},"citing_paper":{"arxiv_id":"2606.07604","last_updated":"2026-05-29T09:40:38Z","snapshot_observed_at":"2026-08-03T04:00:50.272221Z","submitted_at":"2026-05-29T09:40:38Z","title":"Contribution Weights: A Geometrical Analysis of Self-Attention Transformers","version":1},"reference_index":125,"source":"arxiv_source","source_observed_at":"2026-06-28T23:29:02.457697Z"},"links":{"cited_paper":"/paper/2406.11832","citing_paper":"/paper/2606.07604"},"observation_digest":"sha256:d57dd2718f4a454a4f2ef52f3f1d7f7387c75c4cb371d4f3743a42c4d6908097","observation_id":"ba1b7639-e74c-4049-9c4a-0414db2ff596","resolution":{"observed_at":"2026-06-28T23:32:46.758323Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11832","last_updated":"2024-10-29T06:44:36Z","snapshot_observed_at":"2026-08-12T23:40:46.200424Z","submitted_at":"2024-06-17T17:59:44Z","title":"Unveiling Encoder-Free Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11832","snapshot_observed_at":"2026-07-11T16:20:13.303809Z","title":"Unveiling encoder-free vision-language models,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04619","last_updated":"2026-07-06T02:58:47Z","snapshot_observed_at":"2026-08-11T23:49:30.842835Z","submitted_at":"2026-07-06T02:58:47Z","title":"CARD: Cross-component Audio Representation Distillation for Encoder-Free Audio Captioning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-11T16:20:13.303809Z"},"links":{"cited_paper":"/paper/2406.11832","citing_paper":"/paper/2607.04619"},"observation_digest":"sha256:0bc213ce1b060f35a65820de6e3ccc04267e60eb83e4412b1e10c65962c3fd9b","observation_id":"cda596e6-7081-46cb-ba46-9774f1433403","resolution":{"observed_at":"2026-07-11T16:20:13.303809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2406.11832/citation-record","integrity":"/paper/2406.11832/integrity","json":"/paper/2406.11832/citation-record.json","paper":"/paper/2406.11832"},"outbound":[],"paper":{"arxiv_id":"2406.11832","last_updated":"2024-10-29T06:44:36Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T23:40:46.200424Z","submitted_at":"2024-06-17T17:59:44Z","title":"Unveiling Encoder-Free Vision-Language Models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 27 inbound Pith citation observations for arXiv:2406.11832."}