{"as_of":"2026-08-10T03:17:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:11e7561676227c358401f3420a1470b318c9605f4342d871daa2d1446eb94acb","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":46,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":46,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":46,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":46,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T19:21:22.364061Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T01:19:20.350619Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2309.05519","last_updated":"2024-06-25T05:01:09Z","snapshot_observed_at":"2026-08-09T22:04:45.837713Z","submitted_at":"2023-09-11T15:02:25Z","title":"NExT-GPT: Any-to-Any Multimodal LLM","version":3},"cited_work":{"arxiv_id":"2309.05519","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.05519","snapshot_observed_at":"2026-07-04T01:19:20.350619Z","title":"Next-gpt: Any-to-any multimodal llm","venue":null,"work_id":"6a6c38ce-96cf-48b1-9f3d-a69746e904ff","year":2024},"citing_paper":{"arxiv_id":"2306.13549","last_updated":"2024-11-29T15:51:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T15:21:52Z","title":"A Survey on Multimodal Large Language Models","version":4},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-16T02:56:41.658658Z"},"links":{"cited_paper":"/paper/2309.05519","citing_paper":"/paper/2306.13549"},"observation_digest":"sha256:0ab80f0415a4a0f765501d895f32a8648d97f9e1006fb5db99b1e3addaf78de8","observation_id":"3df34cfa-faa2-40dd-8ab2-0d43f0cc918a","resolution":{"observed_at":"2026-05-16T02:56:42.381448Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05519","last_updated":"2024-06-25T05:01:09Z","snapshot_observed_at":"2026-08-09T22:04:45.837713Z","submitted_at":"2023-09-11T15:02:25Z","title":"NExT-GPT: Any-to-Any Multimodal LLM","version":3},"cited_work":{"arxiv_id":"2309.05519","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.05519","snapshot_observed_at":"2026-07-04T01:19:20.350619Z","title":"Next-gpt: Any-to-any multimodal llm","venue":null,"work_id":"6a6c38ce-96cf-48b1-9f3d-a69746e904ff","year":2024},"citing_paper":{"arxiv_id":"2312.14238","last_updated":"2024-01-15T15:23:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-21T18:59:31Z","title":"InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks","version":3},"reference_index":157,"source":"pdf_text","source_observed_at":"2026-05-13T22:46:09.693156Z"},"links":{"cited_paper":"/paper/2309.05519","citing_paper":"/paper/2312.14238"},"observation_digest":"sha256:5777445e65eeb634da1d8aabbff4f9e56f33c407cadae32e833c60c584eff86d","observation_id":"0a8a8608-cd7e-4852-9e53-25befcb570f2","resolution":{"observed_at":"2026-05-13T22:46:10.183385Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05519","last_updated":"2024-06-25T05:01:09Z","snapshot_observed_at":"2026-08-09T22:04:45.837713Z","submitted_at":"2023-09-11T15:02:25Z","title":"NExT-GPT: Any-to-Any Multimodal LLM","version":3},"cited_work":{"arxiv_id":"2309.05519","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.05519","snapshot_observed_at":"2026-07-04T01:19:20.350619Z","title":"Next-gpt: Any-to-any multimodal llm","venue":null,"work_id":"6a6c38ce-96cf-48b1-9f3d-a69746e904ff","year":2024},"citing_paper":{"arxiv_id":"2402.06196","last_updated":"2025-03-23T14:51:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-09T05:37:09Z","title":"Large Language Models: A Survey","version":3},"reference_index":218,"source":"pdf_text","source_observed_at":"2026-05-11T15:22:54.023279Z"},"links":{"cited_paper":"/paper/2309.05519","citing_paper":"/paper/2402.06196"},"observation_digest":"sha256:75fe18e192581f5b14534e5bff2d68ae8c472046dd03b5d97fa1e971d2c6f87e","observation_id":"42510071-7388-47e6-9155-61ae7828ba4b","resolution":{"observed_at":"2026-05-11T15:22:56.001147Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05519","last_updated":"2024-06-25T05:01:09Z","snapshot_observed_at":"2026-08-09T22:04:45.837713Z","submitted_at":"2023-09-11T15:02:25Z","title":"NExT-GPT: Any-to-Any Multimodal LLM","version":3},"cited_work":{"arxiv_id":"2309.05519","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.05519","snapshot_observed_at":"2026-07-04T01:19:20.350619Z","title":"Next-gpt: Any-to-any multimodal llm","venue":null,"work_id":"6a6c38ce-96cf-48b1-9f3d-a69746e904ff","year":2024},"citing_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-05T20:54:58.855446Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-05-13T18:18:27.211034Z"},"links":{"cited_paper":"/paper/2309.05519","citing_paper":"/paper/2403.09631"},"observation_digest":"sha256:17dc7b151fa6aac98ce86db534c0a77b549cb119353e11527ced46cc2556c0b7","observation_id":"db948bda-a4a1-4bf3-85e3-84dacd27d500","resolution":{"observed_at":"2026-05-13T18:18:27.288689Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05519","last_updated":"2024-06-25T05:01:09Z","snapshot_observed_at":"2026-08-09T22:04:45.837713Z","submitted_at":"2023-09-11T15:02:25Z","title":"NExT-GPT: Any-to-Any Multimodal LLM","version":3},"cited_work":{"arxiv_id":"2309.05519","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.05519","snapshot_observed_at":"2026-07-04T01:19:20.350619Z","title":"Next-gpt: Any-to-any multimodal llm","venue":null,"work_id":"6a6c38ce-96cf-48b1-9f3d-a69746e904ff","year":2024},"citing_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-15T22:48:36.010306Z"},"links":{"cited_paper":"/paper/2309.05519","citing_paper":"/paper/2404.14396"},"observation_digest":"sha256:41297498655ead199cbf2ec6e7fab7aa57f7b1ff26050d3658ec8ea643d3cc7b","observation_id":"45692325-04a1-46af-8fe8-1c6a85e747e7","resolution":{"observed_at":"2026-05-15T22:48:36.326697Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05519","last_updated":"2024-06-25T05:01:09Z","snapshot_observed_at":"2026-08-09T22:04:45.837713Z","submitted_at":"2023-09-11T15:02:25Z","title":"NExT-GPT: Any-to-Any Multimodal LLM","version":3},"cited_work":{"arxiv_id":"2309.05519","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.05519","snapshot_observed_at":"2026-07-04T01:19:20.350619Z","title":"Next-gpt: Any-to-any multimodal llm","venue":null,"work_id":"6a6c38ce-96cf-48b1-9f3d-a69746e904ff","year":2024},"citing_paper":{"arxiv_id":"2404.16821","last_updated":"2024-04-29T20:24:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T17:59:19Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","version":2},"reference_index":124,"source":"pdf_text","source_observed_at":"2026-05-12T20:58:58.849040Z"},"links":{"cited_paper":"/paper/2309.05519","citing_paper":"/paper/2404.16821"},"observation_digest":"sha256:62aecef89bd43e8589d5c2e768fb78a8b1d5727cea81fca6a5d0da4b263b651c","observation_id":"2f4d4769-68e1-4ea2-84ef-7833b27cc0eb","resolution":{"observed_at":"2026-05-12T20:58:59.261041Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05519","last_updated":"2024-06-25T05:01:09Z","snapshot_observed_at":"2026-08-09T22:04:45.837713Z","submitted_at":"2023-09-11T15:02:25Z","title":"NExT-GPT: Any-to-Any Multimodal LLM","version":3},"cited_work":{"arxiv_id":"2309.05519","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.05519","snapshot_observed_at":"2026-07-04T01:19:20.350619Z","title":"Next-gpt: Any-to-any multimodal llm","venue":null,"work_id":"6a6c38ce-96cf-48b1-9f3d-a69746e904ff","year":2024},"citing_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-16T14:58:37.383749Z"},"links":{"cited_paper":"/paper/2309.05519","citing_paper":"/paper/2405.08748"},"observation_digest":"sha256:e198396e15d4d28a434b94da035f2d8a3a6df068e31a88d34b4bcf983ed16402","observation_id":"082d8ffd-e82a-4384-9e7f-0bc07055dbf8","resolution":{"observed_at":"2026-05-16T14:58:37.460606Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05519","last_updated":"2024-06-25T05:01:09Z","snapshot_observed_at":"2026-08-09T22:04:45.837713Z","submitted_at":"2023-09-11T15:02:25Z","title":"NExT-GPT: Any-to-Any Multimodal LLM","version":3},"cited_work":{"arxiv_id":"2309.05519","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.05519","snapshot_observed_at":"2026-07-04T01:19:20.350619Z","title":"Next-gpt: Any-to-any multimodal llm","venue":null,"work_id":"6a6c38ce-96cf-48b1-9f3d-a69746e904ff","year":2024},"citing_paper":{"arxiv_id":"2408.12528","last_updated":"2025-09-08T02:42:57Z","snapshot_observed_at":"2026-07-06T19:04:43.716629Z","submitted_at":"2024-08-22T16:32:32Z","title":"Show-o: One Single Transformer to Unify Multimodal Understanding and Generation","version":7},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-11T21:03:33.427939Z"},"links":{"cited_paper":"/paper/2309.05519","citing_paper":"/paper/2408.12528"},"observation_digest":"sha256:7b1651ad8f6a881d76674f9ec63c39a36b3fefd18f7dcb7d95fec7de0113faf5","observation_id":"b2512e14-5851-4017-9d56-dc3c580554a2","resolution":{"observed_at":"2026-05-11T21:03:33.624348Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05519","last_updated":"2024-06-25T05:01:09Z","snapshot_observed_at":"2026-08-09T22:04:45.837713Z","submitted_at":"2023-09-11T15:02:25Z","title":"NExT-GPT: Any-to-Any Multimodal LLM","version":3},"cited_work":{"arxiv_id":"2309.05519","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.05519","snapshot_observed_at":"2026-07-04T01:19:20.350619Z","title":"Next-gpt: Any-to-any multimodal llm","venue":null,"work_id":"6a6c38ce-96cf-48b1-9f3d-a69746e904ff","year":2024},"citing_paper":{"arxiv_id":"2410.13848","last_updated":"2024-10-17T17:58:37Z","snapshot_observed_at":"2026-08-03T03:16:45.693966Z","submitted_at":"2024-10-17T17:58:37Z","title":"Janus: Decoupling Visual Encoding for Unified Multimodal Understanding and Generation","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-05-15T22:09:16.001309Z"},"links":{"cited_paper":"/paper/2309.05519","citing_paper":"/paper/2410.13848"},"observation_digest":"sha256:6f86f5ef962e9a77054a226b0e5938d3da14c1dfb87dc284cf4dc5e68e4f81b9","observation_id":"20c6e468-7285-4dc5-a580-52853293193b","resolution":{"observed_at":"2026-05-15T22:09:16.322185Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05519","last_updated":"2024-06-25T05:01:09Z","snapshot_observed_at":"2026-08-09T22:04:45.837713Z","submitted_at":"2023-09-11T15:02:25Z","title":"NExT-GPT: Any-to-Any Multimodal LLM","version":3},"cited_work":{"arxiv_id":"2309.05519","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.05519","snapshot_observed_at":"2026-07-04T01:19:20.350619Z","title":"Next-gpt: Any-to-any multimodal llm","venue":null,"work_id":"6a6c38ce-96cf-48b1-9f3d-a69746e904ff","year":2024},"citing_paper":{"arxiv_id":"2410.22177","last_updated":"2026-04-08T16:38:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-29T16:15:59Z","title":"Analyzing Multimodal Interaction Strategies for LLM-Assisted Manipulation of 3D Scenes","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-23T18:42:00.624044Z"},"links":{"cited_paper":"/paper/2309.05519","citing_paper":"/paper/2410.22177"},"observation_digest":"sha256:854792b9638cc5166f296b68f996d87e095eadc7c4dcb6a1ec05a966b09a7e0c","observation_id":"2720e999-b49d-4523-96c1-3ad73b20fae7","resolution":{"observed_at":"2026-05-23T18:43:18.972547Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05519","last_updated":"2024-06-25T05:01:09Z","snapshot_observed_at":"2026-08-09T22:04:45.837713Z","submitted_at":"2023-09-11T15:02:25Z","title":"NExT-GPT: Any-to-Any Multimodal LLM","version":3},"cited_work":{"arxiv_id":"2309.05519","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.05519","snapshot_observed_at":"2026-07-04T01:19:20.350619Z","title":"Next-gpt: Any-to-any multimodal llm","venue":null,"work_id":"6a6c38ce-96cf-48b1-9f3d-a69746e904ff","year":2024},"citing_paper":{"arxiv_id":"2501.17811","last_updated":"2025-01-29T18:00:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-29T18:00:19Z","title":"Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-11T08:14:52.890145Z"},"links":{"cited_paper":"/paper/2309.05519","citing_paper":"/paper/2501.17811"},"observation_digest":"sha256:96f38e3541deffcf8609067b2737eba81db48d321b2700b2ffabc5f6b6292349","observation_id":"5f43f488-8b82-49a8-898b-b42f95dcb212","resolution":{"observed_at":"2026-05-11T08:14:53.004260Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05519","last_updated":"2024-06-25T05:01:09Z","snapshot_observed_at":"2026-08-09T22:04:45.837713Z","submitted_at":"2023-09-11T15:02:25Z","title":"NExT-GPT: Any-to-Any Multimodal LLM","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.05519","snapshot_observed_at":"2026-08-09T19:21:22.364061Z","title":"NExT-GPT: Any-to-Any Multimodal LLM, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.00372","last_updated":"2025-08-14T12:58:31Z","snapshot_observed_at":"2026-08-09T19:12:46.915574Z","submitted_at":"2025-02-01T09:19:08Z","title":"NAVER: A Neuro-Symbolic Compositional Automaton for Visual Grounding with Explicit Logic Reasoning","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-09T19:21:22.364061Z"},"links":{"cited_paper":"/paper/2309.05519","citing_paper":"/paper/2502.00372"},"observation_digest":"sha256:f088ea13a5f5dc27c01e923a4b42b36b8a789eb825210e4d79f90ca2946de552","observation_id":"871c4183-e5c8-4bfa-98bc-e6d6e3c02401","resolution":{"observed_at":"2026-08-09T19:21:22.364061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05519","last_updated":"2024-06-25T05:01:09Z","snapshot_observed_at":"2026-08-09T22:04:45.837713Z","submitted_at":"2023-09-11T15:02:25Z","title":"NExT-GPT: Any-to-Any Multimodal LLM","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.05519","snapshot_observed_at":"2026-08-08T19:32:32.021100Z","title":"Next-gpt: Any-to-any multimodal llm","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05415","last_updated":"2025-05-18T14:59:21Z","snapshot_observed_at":"2026-08-09T00:35:30.883689Z","submitted_at":"2025-02-08T02:52:25Z","title":"UniCMs: A Unified Consistency Model For Efficient Multimodal Generation and Understanding","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-08T19:32:32.021100Z"},"links":{"cited_paper":"/paper/2309.05519","citing_paper":"/paper/2502.05415"},"observation_digest":"sha256:b603fbbfd6084c6c0e57adc939bb94e65fd07f51188d2bbbe2c87ddf3db17e1d","observation_id":"eec755af-05c5-4871-b90c-f65d67021776","resolution":{"observed_at":"2026-08-08T19:32:32.021100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05519","last_updated":"2024-06-25T05:01:09Z","snapshot_observed_at":"2026-08-09T22:04:45.837713Z","submitted_at":"2023-09-11T15:02:25Z","title":"NExT-GPT: Any-to-Any Multimodal LLM","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.05519","snapshot_observed_at":"2026-08-08T05:54:16.104506Z","title":"Next-gpt: Any-to-any multimodal llm","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-09T06:09:08.320689Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:16.104506Z"},"links":{"cited_paper":"/paper/2309.05519","citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:6c39b72a2f28f0fe5e66711e32447e483945d95fe8db40d7d0840015c8449f8a","observation_id":"cb9d029c-c0d8-463e-80cb-d7253de4152e","resolution":{"observed_at":"2026-08-08T05:54:16.104506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05519","last_updated":"2024-06-25T05:01:09Z","snapshot_observed_at":"2026-08-09T22:04:45.837713Z","submitted_at":"2023-09-11T15:02:25Z","title":"NExT-GPT: Any-to-Any Multimodal LLM","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.05519","snapshot_observed_at":"2026-08-07T20:21:30.561275Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09838","last_updated":"2025-02-21T17:39:29Z","snapshot_observed_at":"2026-08-08T11:58:23.364847Z","submitted_at":"2025-02-14T00:42:36Z","title":"HealthGPT: A Medical Large Vision-Language Model for Unifying Comprehension and Generation via Heterogeneous Knowledge Adaptation","version":3},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-07T20:21:30.561275Z"},"links":{"cited_paper":"/paper/2309.05519","citing_paper":"/paper/2502.09838"},"observation_digest":"sha256:06997c20ddf180196f10f1e66930c10d5ae132dccced18c0a9ba9af8049ffd3c","observation_id":"02be9b8b-2e7d-40e8-9c38-3db5ebe977c9","resolution":{"observed_at":"2026-08-07T20:21:30.561275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05519","last_updated":"2024-06-25T05:01:09Z","snapshot_observed_at":"2026-08-09T22:04:45.837713Z","submitted_at":"2023-09-11T15:02:25Z","title":"NExT-GPT: Any-to-Any Multimodal LLM","version":3},"cited_work":{"arxiv_id":"2309.05519","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.05519","snapshot_observed_at":"2026-07-04T01:19:20.350619Z","title":"Next-gpt: Any-to-any multimodal llm","venue":null,"work_id":"6a6c38ce-96cf-48b1-9f3d-a69746e904ff","year":2024},"citing_paper":{"arxiv_id":"2503.12937","last_updated":"2025-08-04T04:22:09Z","snapshot_observed_at":"2026-08-06T21:34:54.534751Z","submitted_at":"2025-03-17T08:51:44Z","title":"R1-VL: Learning to Reason with Multimodal Large Language Models via Step-wise Group Relative Policy Optimization","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-16T15:04:22.690503Z"},"links":{"cited_paper":"/paper/2309.05519","citing_paper":"/paper/2503.12937"},"observation_digest":"sha256:016e37a04e3138e19b6a7a8a6ffe57b301b87c130beeb3d451a7c3a5c7ff3107","observation_id":"adc24064-c836-4590-849d-ead80d009c80","resolution":{"observed_at":"2026-05-16T15:04:22.755345Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05519","last_updated":"2024-06-25T05:01:09Z","snapshot_observed_at":"2026-08-09T22:04:45.837713Z","submitted_at":"2023-09-11T15:02:25Z","title":"NExT-GPT: Any-to-Any Multimodal LLM","version":3},"cited_work":{"arxiv_id":"2309.05519","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.05519","snapshot_observed_at":"2026-07-04T01:19:20.350619Z","title":"Next-gpt: Any-to-any multimodal llm","venue":null,"work_id":"6a6c38ce-96cf-48b1-9f3d-a69746e904ff","year":2024},"citing_paper":{"arxiv_id":"2504.06256","last_updated":"2025-04-08T17:58:47Z","snapshot_observed_at":"2026-08-03T00:43:33.310493Z","submitted_at":"2025-04-08T17:58:47Z","title":"Transfer between Modalities with MetaQueries","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-14T22:49:23.074271Z"},"links":{"cited_paper":"/paper/2309.05519","citing_paper":"/paper/2504.06256"},"observation_digest":"sha256:9ec391242cce065e96a48b8facd87b1f5b909521dfe679304c6b0a2efcb229e8","observation_id":"92929f70-6113-4020-9115-e3a98e64831e","resolution":{"observed_at":"2026-05-14T22:49:23.284023Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05519","last_updated":"2024-06-25T05:01:09Z","snapshot_observed_at":"2026-08-09T22:04:45.837713Z","submitted_at":"2023-09-11T15:02:25Z","title":"NExT-GPT: Any-to-Any Multimodal LLM","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.05519","snapshot_observed_at":"2026-08-07T15:42:42.109858Z","title":"Wu et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14197","last_updated":"2025-05-20T10:55:26Z","snapshot_observed_at":"2026-08-08T09:14:04.228753Z","submitted_at":"2025-05-20T10:55:26Z","title":"Towards Omnidirectional Reasoning with 360-R1: A Dataset, Benchmark, and GRPO-based Method","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:42.109858Z"},"links":{"cited_paper":"/paper/2309.05519","citing_paper":"/paper/2505.14197"},"observation_digest":"sha256:7faac118c4360428e378036e7f4dbf990464663eea8126d4369d7cb5d28f8514","observation_id":"a07c77f3-61e7-4fa2-9595-d80b5e5c4b9d","resolution":{"observed_at":"2026-08-07T15:42:42.109858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05519","last_updated":"2024-06-25T05:01:09Z","snapshot_observed_at":"2026-08-09T22:04:45.837713Z","submitted_at":"2023-09-11T15:02:25Z","title":"NExT-GPT: Any-to-Any Multimodal LLM","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.05519","snapshot_observed_at":"2026-08-07T15:23:03.563984Z","title":"Next-gpt: Any-to-any multimodal llm // arXiv preprint arXiv:2309.05519","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15406","last_updated":"2025-05-21T11:47:47Z","snapshot_observed_at":"2026-08-10T01:55:36.393625Z","submitted_at":"2025-05-21T11:47:47Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T15:23:03.563984Z"},"links":{"cited_paper":"/paper/2309.05519","citing_paper":"/paper/2505.15406"},"observation_digest":"sha256:7e6c59866e938f213ee0e44593aed6b5a3a7ffb7d520bc7a109ed96033537287","observation_id":"489727a3-afcd-4908-9d9c-f9f8f5e0b8df","resolution":{"observed_at":"2026-08-07T15:23:03.563984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05519","last_updated":"2024-06-25T05:01:09Z","snapshot_observed_at":"2026-08-09T22:04:45.837713Z","submitted_at":"2023-09-11T15:02:25Z","title":"NExT-GPT: Any-to-Any Multimodal LLM","version":3},"cited_work":{"arxiv_id":"2309.05519","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.05519","snapshot_observed_at":"2026-07-04T01:19:20.350619Z","title":"Next-gpt: Any-to-any multimodal llm","venue":null,"work_id":"6a6c38ce-96cf-48b1-9f3d-a69746e904ff","year":2024},"citing_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-08-05T05:27:10.277230Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-05-15T14:50:59.661153Z"},"links":{"cited_paper":"/paper/2309.05519","citing_paper":"/paper/2505.15809"},"observation_digest":"sha256:2476cf3f6a214db71a299e22f102e89c80eb4c3bc143601d3a3c3bc3ad60c1d3","observation_id":"bfb03666-dc73-483e-a948-ce00f2e52775","resolution":{"observed_at":"2026-05-15T14:50:59.768622Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05519","last_updated":"2024-06-25T05:01:09Z","snapshot_observed_at":"2026-08-09T22:04:45.837713Z","submitted_at":"2023-09-11T15:02:25Z","title":"NExT-GPT: Any-to-Any Multimodal LLM","version":3},"cited_work":{"arxiv_id":"2309.05519","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.05519","snapshot_observed_at":"2026-07-04T01:19:20.350619Z","title":"Next-gpt: Any-to-any multimodal llm","venue":null,"work_id":"6a6c38ce-96cf-48b1-9f3d-a69746e904ff","year":2024},"citing_paper":{"arxiv_id":"2505.19237","last_updated":"2026-04-19T18:56:45Z","snapshot_observed_at":"2026-08-08T14:53:09.954970Z","submitted_at":"2025-05-25T17:26:28Z","title":"Sensorimotor Self-Recognition in Multimodal Large Language Model-Driven Robots","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-19T13:29:34.151546Z"},"links":{"cited_paper":"/paper/2309.05519","citing_paper":"/paper/2505.19237"},"observation_digest":"sha256:9a168b88ea782f5a4943ba1e29e125826a7efa296b3cb8fa0456c676aade08b5","observation_id":"1e3af57e-dd61-4774-a7a4-6d5ab4db2843","resolution":{"observed_at":"2026-05-19T13:32:19.269257Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05519","last_updated":"2024-06-25T05:01:09Z","snapshot_observed_at":"2026-08-09T22:04:45.837713Z","submitted_at":"2023-09-11T15:02:25Z","title":"NExT-GPT: Any-to-Any Multimodal LLM","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.05519","snapshot_observed_at":"2026-08-07T14:06:49.990929Z","title":"Next-gpt: Any-to-any multimodal llm","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20053","last_updated":"2025-05-26T14:42:35Z","snapshot_observed_at":"2026-08-09T14:29:22.266500Z","submitted_at":"2025-05-26T14:42:35Z","title":"Multimodal LLM-Guided Semantic Correction in Text-to-Image Diffusion","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:06:49.990929Z"},"links":{"cited_paper":"/paper/2309.05519","citing_paper":"/paper/2505.20053"},"observation_digest":"sha256:ae41b9b4b9b4d40cf704c6db3a5951c983f531727bb3b1734ef8ed4b5353f1de","observation_id":"f9832be2-b9f5-4fdd-aeac-e089fbae9e01","resolution":{"observed_at":"2026-08-07T14:06:49.990929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05519","last_updated":"2024-06-25T05:01:09Z","snapshot_observed_at":"2026-08-09T22:04:45.837713Z","submitted_at":"2023-09-11T15:02:25Z","title":"NExT-GPT: Any-to-Any Multimodal LLM","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.05519","snapshot_observed_at":"2026-08-07T12:53:26.460651Z","title":"Next-gpt: Any-to-any multimodal llm.arXiv preprint arXiv:2309.05519, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23380","last_updated":"2025-05-29T12:00:15Z","snapshot_observed_at":"2026-08-09T02:35:27.089432Z","submitted_at":"2025-05-29T12:00:15Z","title":"UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T12:53:26.460651Z"},"links":{"cited_paper":"/paper/2309.05519","citing_paper":"/paper/2505.23380"},"observation_digest":"sha256:cbd5f0efb5fb2e4feb0758d96ffe636b07cf51676abd6331772550ef338e381e","observation_id":"727c3c1d-52ce-4d27-bf43-8b46fbc2fb7f","resolution":{"observed_at":"2026-08-07T12:53:26.460651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05519","last_updated":"2024-06-25T05:01:09Z","snapshot_observed_at":"2026-08-09T22:04:45.837713Z","submitted_at":"2023-09-11T15:02:25Z","title":"NExT-GPT: Any-to-Any Multimodal LLM","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.05519","snapshot_observed_at":"2026-08-07T11:16:20.351944Z","title":"arXiv preprint arXiv:2309.05519 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02975","last_updated":"2025-06-03T15:14:00Z","snapshot_observed_at":"2026-08-08T06:27:57.629343Z","submitted_at":"2025-06-03T15:14:00Z","title":"HaploOmni: Unified Single Transformer for Multimodal Video Understanding and Generation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T11:16:20.351944Z"},"links":{"cited_paper":"/paper/2309.05519","citing_paper":"/paper/2506.02975"},"observation_digest":"sha256:59c5ac430a3a8c0e25cc1e6affe25e833b54efe7f20cc3f2443c86fc7176d169","observation_id":"461ee106-6d4a-4934-8cdb-427e0f7fba8f","resolution":{"observed_at":"2026-08-07T11:16:20.351944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05519","last_updated":"2024-06-25T05:01:09Z","snapshot_observed_at":"2026-08-09T22:04:45.837713Z","submitted_at":"2023-09-11T15:02:25Z","title":"NExT-GPT: Any-to-Any Multimodal LLM","version":3},"cited_work":{"arxiv_id":"2309.05519","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.05519","snapshot_observed_at":"2026-07-04T01:19:20.350619Z","title":"Next-gpt: Any-to-any multimodal llm","venue":null,"work_id":"6a6c38ce-96cf-48b1-9f3d-a69746e904ff","year":2024},"citing_paper":{"arxiv_id":"2506.04565","last_updated":"2026-05-08T15:50:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-05T02:34:43Z","title":"From Standalone LLMs to Integrated Intelligence: A Survey of Compound Al Systems","version":2},"reference_index":197,"source":"pdf_text","source_observed_at":"2026-05-19T11:49:36.574471Z"},"links":{"cited_paper":"/paper/2309.05519","citing_paper":"/paper/2506.04565"},"observation_digest":"sha256:b661ad45572820931f8ac45726be441798c7b06c6c557dc3ae7bcb4c07defc95","observation_id":"7684d983-6c48-4c85-9bb7-c98a34ce78cb","resolution":{"observed_at":"2026-05-19T11:52:16.135089Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05519","last_updated":"2024-06-25T05:01:09Z","snapshot_observed_at":"2026-08-09T22:04:45.837713Z","submitted_at":"2023-09-11T15:02:25Z","title":"NExT-GPT: Any-to-Any Multimodal LLM","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.05519","snapshot_observed_at":"2026-08-07T05:08:32.375241Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08774","last_updated":"2026-06-28T14:38:32Z","snapshot_observed_at":"2026-08-09T15:02:40.844890Z","submitted_at":"2025-06-10T13:16:26Z","title":"Multimodal Representation Alignment for Cross-modal Information Retrieval","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T05:08:32.375241Z"},"links":{"cited_paper":"/paper/2309.05519","citing_paper":"/paper/2506.08774"},"observation_digest":"sha256:785746fce4bb5a55b3731b36c2443d6f6a9449dc2c239964fca6e1bac8b0d09c","observation_id":"48c745e6-6456-4854-beba-54ef90eaad78","resolution":{"observed_at":"2026-08-07T05:08:32.375241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05519","last_updated":"2024-06-25T05:01:09Z","snapshot_observed_at":"2026-08-09T22:04:45.837713Z","submitted_at":"2023-09-11T15:02:25Z","title":"NExT-GPT: Any-to-Any Multimodal LLM","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.05519","snapshot_observed_at":"2026-08-07T04:34:09.517877Z","title":"Next-gpt: Any-to-any multimodal LLM","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.10395","last_updated":"2025-07-12T20:42:24Z","snapshot_observed_at":"2026-08-07T04:25:14.940851Z","submitted_at":"2025-06-12T06:37:34Z","title":"Pisces: An Auto-regressive Foundation Model for Image Understanding and Generation","version":2},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-07T04:34:09.517877Z"},"links":{"cited_paper":"/paper/2309.05519","citing_paper":"/paper/2506.10395"},"observation_digest":"sha256:336ff2bf762ebecff3ac79cb713700afe95262c068843e660bd986f7da521b5e","observation_id":"d18c754e-cc81-41f7-95a0-bf11ed74dfb9","resolution":{"observed_at":"2026-08-07T04:34:09.517877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05519","last_updated":"2024-06-25T05:01:09Z","snapshot_observed_at":"2026-08-09T22:04:45.837713Z","submitted_at":"2023-09-11T15:02:25Z","title":"NExT-GPT: Any-to-Any Multimodal LLM","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.05519","snapshot_observed_at":"2026-08-07T04:26:42.724376Z","title":"arXiv preprint arXiv:2309.05519","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10574","last_updated":"2025-08-11T15:10:59Z","snapshot_observed_at":"2026-08-08T23:16:01.561601Z","submitted_at":"2025-06-12T11:03:47Z","title":"DanceChat: Large Language Model-Guided Music-to-Dance Generation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T04:26:42.724376Z"},"links":{"cited_paper":"/paper/2309.05519","citing_paper":"/paper/2506.10574"},"observation_digest":"sha256:7635214e194ec58ea22dcc0120496d31ed1ee4c094f4c191b45017ea61dd92f1","observation_id":"bfead915-d419-4564-9a55-6c6beaa311aa","resolution":{"observed_at":"2026-08-07T04:26:42.724376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05519","last_updated":"2024-06-25T05:01:09Z","snapshot_observed_at":"2026-08-09T22:04:45.837713Z","submitted_at":"2023-09-11T15:02:25Z","title":"NExT-GPT: Any-to-Any Multimodal LLM","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.05519","snapshot_observed_at":"2026-08-06T23:59:09.376377Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.15504","last_updated":"2025-06-18T14:42:34Z","snapshot_observed_at":"2026-08-09T23:10:31.964818Z","submitted_at":"2025-06-18T14:42:34Z","title":"Enhancing Hyperbole and Metaphor Detection with Their Bidirectional Dynamic Interaction and Emotion Knowledge","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-06T23:59:09.376377Z"},"links":{"cited_paper":"/paper/2309.05519","citing_paper":"/paper/2506.15504"},"observation_digest":"sha256:3e9e7fbca98bdf637b3d50725072c070c8f4d4127c14a171d84a03e840b6b943","observation_id":"23ba9004-94bb-42f2-8730-5eecc4029b98","resolution":{"observed_at":"2026-08-06T23:59:09.376377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05519","last_updated":"2024-06-25T05:01:09Z","snapshot_observed_at":"2026-08-09T22:04:45.837713Z","submitted_at":"2023-09-11T15:02:25Z","title":"NExT-GPT: Any-to-Any Multimodal LLM","version":3},"cited_work":{"arxiv_id":"2309.05519","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.05519","snapshot_observed_at":"2026-07-04T01:19:20.350619Z","title":"Next-gpt: Any-to-any multimodal llm","venue":null,"work_id":"6a6c38ce-96cf-48b1-9f3d-a69746e904ff","year":2024},"citing_paper":{"arxiv_id":"2506.15564","last_updated":"2025-09-22T01:24:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-18T15:39:15Z","title":"Show-o2: Improved Native Unified Multimodal Models","version":3},"reference_index":120,"source":"pdf_text","source_observed_at":"2026-05-12T18:51:15.428692Z"},"links":{"cited_paper":"/paper/2309.05519","citing_paper":"/paper/2506.15564"},"observation_digest":"sha256:1f9f020c82c8e1ccd5f813f1075e750b8197342db158d222ce2be083e71d6141","observation_id":"3dc49e84-f5b8-4392-8dd6-9ffc27b499d3","resolution":{"observed_at":"2026-05-12T18:51:15.793866Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05519","last_updated":"2024-06-25T05:01:09Z","snapshot_observed_at":"2026-08-09T22:04:45.837713Z","submitted_at":"2023-09-11T15:02:25Z","title":"NExT-GPT: Any-to-Any Multimodal LLM","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.05519","snapshot_observed_at":"2026-08-06T19:15:29.821240Z","title":"Tune-a-video: One-shot tuning of image diffusion 31 models for text-to-video generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.06137","last_updated":"2025-07-08T16:19:45Z","snapshot_observed_at":"2026-08-08T22:26:24.906449Z","submitted_at":"2025-07-08T16:19:45Z","title":"NeoBabel: A Multilingual Open Tower for Visual Generation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:29.821240Z"},"links":{"cited_paper":"/paper/2309.05519","citing_paper":"/paper/2507.06137"},"observation_digest":"sha256:8073de925f341f07e8d35f76f62a7130e5214afd5bd6ae2a397ccb03a970cb3c","observation_id":"9950c082-bd59-48a2-b4f5-f46c7fa7a7a6","resolution":{"observed_at":"2026-08-06T19:15:29.821240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05519","last_updated":"2024-06-25T05:01:09Z","snapshot_observed_at":"2026-08-09T22:04:45.837713Z","submitted_at":"2023-09-11T15:02:25Z","title":"NExT-GPT: Any-to-Any Multimodal LLM","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.05519","snapshot_observed_at":"2026-08-06T18:55:33.904321Z","title":"Shengqiong Wu, Hao Fei, Leigang Qu, Wei Ji, and Tat- Seng Chua","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.06999","last_updated":"2026-05-27T11:19:51Z","snapshot_observed_at":"2026-08-06T18:47:24.931029Z","submitted_at":"2025-07-09T16:25:44Z","title":"Learning Deliberately, Acting Intuitively: Unlocking Test-Time Reasoning in Multimodal LLMs","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T18:55:33.904321Z"},"links":{"cited_paper":"/paper/2309.05519","citing_paper":"/paper/2507.06999"},"observation_digest":"sha256:fe96b3bbb33aeae30492300972cca49a7ae6b7002f7f9c687741df189f98a809","observation_id":"d056821a-5da2-4023-a2fa-faf90712d6b6","resolution":{"observed_at":"2026-08-06T18:55:33.904321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05519","last_updated":"2024-06-25T05:01:09Z","snapshot_observed_at":"2026-08-09T22:04:45.837713Z","submitted_at":"2023-09-11T15:02:25Z","title":"NExT-GPT: Any-to-Any Multimodal LLM","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.05519","snapshot_observed_at":"2026-08-06T18:19:59.162850Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08648","last_updated":"2025-07-11T14:51:33Z","snapshot_observed_at":"2026-08-07T22:32:35.843142Z","submitted_at":"2025-07-11T14:51:33Z","title":"DatasetAgent: A Novel Multi-Agent System for Auto-Constructing Datasets from Real-World Images","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-06T18:19:59.162850Z"},"links":{"cited_paper":"/paper/2309.05519","citing_paper":"/paper/2507.08648"},"observation_digest":"sha256:6a03248b14b26c8013a0bcb585fbac1e344615c6617cc183a26bbdb452d32e4a","observation_id":"98fc655e-ce05-4da9-9151-2a93f7c08413","resolution":{"observed_at":"2026-08-06T18:19:59.162850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05519","last_updated":"2024-06-25T05:01:09Z","snapshot_observed_at":"2026-08-09T22:04:45.837713Z","submitted_at":"2023-09-11T15:02:25Z","title":"NExT-GPT: Any-to-Any Multimodal LLM","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.05519","snapshot_observed_at":"2026-08-06T05:49:51.608775Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.01274","last_updated":"2025-08-02T09:10:15Z","snapshot_observed_at":"2026-08-07T23:14:34.718388Z","submitted_at":"2025-08-02T09:10:15Z","title":"Multi-TW: Benchmarking Multimodal Models on Traditional Chinese Question Answering in Taiwan","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T05:49:51.608775Z"},"links":{"cited_paper":"/paper/2309.05519","citing_paper":"/paper/2508.01274"},"observation_digest":"sha256:8a0452aee0a253926585f3da719f7aef41365d5ed0ed9307b1ea801f4f6ecf35","observation_id":"9d6818eb-e463-4cf5-8a03-e44237d8a785","resolution":{"observed_at":"2026-08-06T05:49:51.608775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05519","last_updated":"2024-06-25T05:01:09Z","snapshot_observed_at":"2026-08-09T22:04:45.837713Z","submitted_at":"2023-09-11T15:02:25Z","title":"NExT-GPT: Any-to-Any Multimodal LLM","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.05519","snapshot_observed_at":"2026-08-05T15:10:31.833708Z","title":"Next-gpt: Any-to-any multimodal llm","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.20379","last_updated":"2025-08-28T03:00:30Z","snapshot_observed_at":"2026-08-08T13:26:19.436875Z","submitted_at":"2025-08-28T03:00:30Z","title":"Audio-Guided Visual Editing with Complex Multi-Modal Prompts","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:31.833708Z"},"links":{"cited_paper":"/paper/2309.05519","citing_paper":"/paper/2508.20379"},"observation_digest":"sha256:98fe7dd9c775e1a86edca384aec48ec3d80c7b53283a67aae064500fa94ee577","observation_id":"0d76b3bd-d2d5-474b-bdc9-8f2c483b45cd","resolution":{"observed_at":"2026-08-05T15:10:31.833708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05519","last_updated":"2024-06-25T05:01:09Z","snapshot_observed_at":"2026-08-09T22:04:45.837713Z","submitted_at":"2023-09-11T15:02:25Z","title":"NExT-GPT: Any-to-Any Multimodal LLM","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.05519","snapshot_observed_at":"2026-08-05T05:01:37.086887Z","title":"NExT-GPT: Any- to-Any Multimodal LLM.ArXiv, 2309.05519, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.05786","last_updated":"2025-09-06T17:42:22Z","snapshot_observed_at":"2026-08-08T09:14:25.199933Z","submitted_at":"2025-09-06T17:42:22Z","title":"Effectively obtaining acoustic, visual and textual data from videos","version":1},"reference_index":121,"source":"pdf_text","source_observed_at":"2026-08-05T05:01:37.086887Z"},"links":{"cited_paper":"/paper/2309.05519","citing_paper":"/paper/2509.05786"},"observation_digest":"sha256:1191530bf436b13b3cadcd27de3e7fc26ac9cde6278a3aa68bfb74ca2de23e21","observation_id":"85d0e4a6-b2b6-458c-a997-529ec7b49f2e","resolution":{"observed_at":"2026-08-05T05:01:37.086887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05519","last_updated":"2024-06-25T05:01:09Z","snapshot_observed_at":"2026-08-09T22:04:45.837713Z","submitted_at":"2023-09-11T15:02:25Z","title":"NExT-GPT: Any-to-Any Multimodal LLM","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.05519","snapshot_observed_at":"2026-08-04T21:25:27.343930Z","title":"NExT-GPT: Any- to-Any Multimodal LLM.ArXiv, 2309.05519, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09717","last_updated":"2025-09-09T18:57:10Z","snapshot_observed_at":"2026-08-08T11:56:25.298917Z","submitted_at":"2025-09-09T18:57:10Z","title":"Testing chatbots on the creation of encoders for audio conditioned image generation","version":1},"reference_index":110,"source":"pdf_text","source_observed_at":"2026-08-04T21:25:27.343930Z"},"links":{"cited_paper":"/paper/2309.05519","citing_paper":"/paper/2509.09717"},"observation_digest":"sha256:c280da5d781856373eb4d2410380e448b5e62224e248bd44ed55536344d07611","observation_id":"b51635ce-46ee-4444-b6c1-0933ccef8253","resolution":{"observed_at":"2026-08-04T21:25:27.343930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05519","last_updated":"2024-06-25T05:01:09Z","snapshot_observed_at":"2026-08-09T22:04:45.837713Z","submitted_at":"2023-09-11T15:02:25Z","title":"NExT-GPT: Any-to-Any Multimodal LLM","version":3},"cited_work":{"arxiv_id":"2309.05519","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.05519","snapshot_observed_at":"2026-07-04T01:19:20.350619Z","title":"Next-gpt: Any-to-any multimodal llm","venue":null,"work_id":"6a6c38ce-96cf-48b1-9f3d-a69746e904ff","year":2024},"citing_paper":{"arxiv_id":"2605.07490","last_updated":"2026-05-08T09:29:50Z","snapshot_observed_at":"2026-07-06T23:19:51.414344Z","submitted_at":"2026-05-08T09:29:50Z","title":"Cross-Modal Backdoors in Multimodal Large Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-11T01:51:11.432424Z"},"links":{"cited_paper":"/paper/2309.05519","citing_paper":"/paper/2605.07490"},"observation_digest":"sha256:6d72f54cb0cb606f42bc5796942b1486512939436d47c2c4e479df1a5abe2078","observation_id":"d8e3f15a-3507-4bad-b7e8-741d58f22007","resolution":{"observed_at":"2026-05-11T04:20:55.597232Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05519","last_updated":"2024-06-25T05:01:09Z","snapshot_observed_at":"2026-08-09T22:04:45.837713Z","submitted_at":"2023-09-11T15:02:25Z","title":"NExT-GPT: Any-to-Any Multimodal LLM","version":3},"cited_work":{"arxiv_id":"2309.05519","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.05519","snapshot_observed_at":"2026-07-04T01:19:20.350619Z","title":"Next-gpt: Any-to-any multimodal llm","venue":null,"work_id":"6a6c38ce-96cf-48b1-9f3d-a69746e904ff","year":2024},"citing_paper":{"arxiv_id":"2605.17360","last_updated":"2026-07-02T12:39:55Z","snapshot_observed_at":"2026-07-06T23:28:21.395050Z","submitted_at":"2026-05-17T09:57:01Z","title":"Omni-DuplexEval: Evaluating Real-time Duplex Omni-modal Interaction","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-20T13:36:44.071188Z"},"links":{"cited_paper":"/paper/2309.05519","citing_paper":"/paper/2605.17360"},"observation_digest":"sha256:d81c031b6b8c4dbec1cef86c39f15bc40a66fe23a5ad5fb430a07c9722952f48","observation_id":"5ed9a3ef-3f09-45c9-ac65-4cb9505567fa","resolution":{"observed_at":"2026-05-20T13:38:19.150954Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05519","last_updated":"2024-06-25T05:01:09Z","snapshot_observed_at":"2026-08-09T22:04:45.837713Z","submitted_at":"2023-09-11T15:02:25Z","title":"NExT-GPT: Any-to-Any Multimodal LLM","version":3},"cited_work":{"arxiv_id":"2309.05519","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.05519","snapshot_observed_at":"2026-07-04T01:19:20.350619Z","title":"Next-gpt: Any-to-any multimodal llm","venue":null,"work_id":"6a6c38ce-96cf-48b1-9f3d-a69746e904ff","year":2024},"citing_paper":{"arxiv_id":"2605.17360","last_updated":"2026-07-02T12:39:55Z","snapshot_observed_at":"2026-07-06T23:28:21.395050Z","submitted_at":"2026-05-17T09:57:01Z","title":"Omni-DuplexEval: Evaluating Real-time Duplex Omni-modal Interaction","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-04T01:11:42.073993Z"},"links":{"cited_paper":"/paper/2309.05519","citing_paper":"/paper/2605.17360"},"observation_digest":"sha256:42c46cb3631504a2d8c020963ffec01f033f093dcfc49db079448aefbb3fa8b0","observation_id":"cce32fc9-da56-4075-a383-346ea8e357f4","resolution":{"observed_at":"2026-07-04T01:19:20.353196Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05519","last_updated":"2024-06-25T05:01:09Z","snapshot_observed_at":"2026-08-09T22:04:45.837713Z","submitted_at":"2023-09-11T15:02:25Z","title":"NExT-GPT: Any-to-Any Multimodal LLM","version":3},"cited_work":{"arxiv_id":"2309.05519","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.05519","snapshot_observed_at":"2026-07-04T01:19:20.350619Z","title":"Next-gpt: Any-to-any multimodal llm","venue":null,"work_id":"6a6c38ce-96cf-48b1-9f3d-a69746e904ff","year":2024},"citing_paper":{"arxiv_id":"2606.12555","last_updated":"2026-07-02T19:10:03Z","snapshot_observed_at":"2026-07-12T14:16:32.755376Z","submitted_at":"2026-06-10T18:06:27Z","title":"AudioX-Turbo: A Unified Framework for Efficient Anything-to-Audio Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-27T08:04:48.283908Z"},"links":{"cited_paper":"/paper/2309.05519","citing_paper":"/paper/2606.12555"},"observation_digest":"sha256:677e90a7e7d9a1036cd26b5e7f107dd781d0793ec3ecf95a0d1ba745a651fc26","observation_id":"447a55f8-d548-43a5-b154-53f0f8606604","resolution":{"observed_at":"2026-07-03T13:28:18.747749Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05519","last_updated":"2024-06-25T05:01:09Z","snapshot_observed_at":"2026-08-09T22:04:45.837713Z","submitted_at":"2023-09-11T15:02:25Z","title":"NExT-GPT: Any-to-Any Multimodal LLM","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.05519","snapshot_observed_at":"2026-07-12T07:49:23.168452Z","title":"arXiv preprint arXiv:2309.05519 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.02674","last_updated":"2026-07-02T18:10:34Z","snapshot_observed_at":"2026-08-03T00:51:32.559379Z","submitted_at":"2026-07-02T18:10:34Z","title":"EmoteGPT: 3D Human Facial Expressions from Natural Language Descriptions","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-12T07:49:23.168452Z"},"links":{"cited_paper":"/paper/2309.05519","citing_paper":"/paper/2607.02674"},"observation_digest":"sha256:d915c507ca9950ac294dc35dccb2b63b6fb69919de0e3ca2e32b49f1eef79568","observation_id":"c54697af-3353-492b-b83d-ca682f3beb8a","resolution":{"observed_at":"2026-07-12T07:49:23.168452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05519","last_updated":"2024-06-25T05:01:09Z","snapshot_observed_at":"2026-08-09T22:04:45.837713Z","submitted_at":"2023-09-11T15:02:25Z","title":"NExT-GPT: Any-to-Any Multimodal LLM","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.05519","snapshot_observed_at":"2026-07-14T10:42:30.055074Z","title":"Next-gpt: Any-to-any multimodal llm.arXiv preprint arXiv:2309.05519,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10578","last_updated":"2026-07-12T05:28:48Z","snapshot_observed_at":"2026-08-09T13:38:15.993719Z","submitted_at":"2026-07-12T05:28:48Z","title":"Laguerre Geometry for Interpreting Large Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-14T10:42:30.055074Z"},"links":{"cited_paper":"/paper/2309.05519","citing_paper":"/paper/2607.10578"},"observation_digest":"sha256:a08e79ea0cad05a9c09e83768618a784d037a98ef7a4c6942e6c0f5336888270","observation_id":"984aec55-eda8-4a39-a2e3-559eded843aa","resolution":{"observed_at":"2026-07-14T10:42:30.055074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05519","last_updated":"2024-06-25T05:01:09Z","snapshot_observed_at":"2026-08-09T22:04:45.837713Z","submitted_at":"2023-09-11T15:02:25Z","title":"NExT-GPT: Any-to-Any Multimodal LLM","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.05519","snapshot_observed_at":"2026-08-01T22:38:27.351494Z","title":"Next-gpt: Any-to-any multimodal llm","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15686","last_updated":"2026-07-17T06:56:08Z","snapshot_observed_at":"2026-08-09T10:07:53.878771Z","submitted_at":"2026-07-17T06:56:08Z","title":"S1-Omni: A Unified Multimodal Reasoning Model for Scientific Understanding, Prediction, and Generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-01T22:38:27.351494Z"},"links":{"cited_paper":"/paper/2309.05519","citing_paper":"/paper/2607.15686"},"observation_digest":"sha256:8ccbf8f255fdc30525618fdd5062db216cf1f8bc2101604fa3a89da491ac2933","observation_id":"0f404c44-6f12-46ba-bceb-19994e9b0001","resolution":{"observed_at":"2026-08-01T22:38:27.351494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05519","last_updated":"2024-06-25T05:01:09Z","snapshot_observed_at":"2026-08-09T22:04:45.837713Z","submitted_at":"2023-09-11T15:02:25Z","title":"NExT-GPT: Any-to-Any Multimodal LLM","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.05519","snapshot_observed_at":"2026-08-03T08:35:55.978209Z","title":"Next-gpt: Any-to-any multimodal llm.arXiv preprint arXiv:2309.05519, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.29363","last_updated":"2026-07-31T12:51:24Z","snapshot_observed_at":"2026-08-05T23:15:08.967026Z","submitted_at":"2026-07-31T12:51:24Z","title":"Stable Autoregressive Speech Generation with Low-Frame-Rate High-Dimensional Continuous Tokens","version":1},"reference_index":109,"source":"pdf_text","source_observed_at":"2026-08-03T08:35:55.978209Z"},"links":{"cited_paper":"/paper/2309.05519","citing_paper":"/paper/2607.29363"},"observation_digest":"sha256:a5744e6004e27bd7f454f627caf46da8515db2575ece48678290deba96f311e3","observation_id":"d955bed7-164c-439e-ba02-5d2da90d9fc5","resolution":{"observed_at":"2026-08-03T08:35:55.978209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05519","last_updated":"2024-06-25T05:01:09Z","snapshot_observed_at":"2026-08-09T22:04:45.837713Z","submitted_at":"2023-09-11T15:02:25Z","title":"NExT-GPT: Any-to-Any Multimodal LLM","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.05519","snapshot_observed_at":"2026-08-04T00:55:47.192966Z","title":"doi:10.48550/arXiv.2309.05519 , url =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00669","last_updated":"2026-08-01T13:44:04Z","snapshot_observed_at":"2026-08-08T01:10:55.545078Z","submitted_at":"2026-08-01T13:44:04Z","title":"GARDRec: Decision-Level Graph Grounding for Large Language Model Recommendation","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-04T00:55:47.192966Z"},"links":{"cited_paper":"/paper/2309.05519","citing_paper":"/paper/2608.00669"},"observation_digest":"sha256:1f56ef4a16649c42662ec016ce8597690eb2d492407b86acb2937762c9708e40","observation_id":"3c2af9b0-811a-4563-83a0-7961af6d3030","resolution":{"observed_at":"2026-08-04T00:55:47.192966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2309.05519/citation-record","integrity":"/paper/2309.05519/integrity","json":"/paper/2309.05519/citation-record.json","paper":"/paper/2309.05519"},"outbound":[],"paper":{"arxiv_id":"2309.05519","last_updated":"2024-06-25T05:01:09Z","latest_version":3,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-09T22:04:45.837713Z","submitted_at":"2023-09-11T15:02:25Z","title":"NExT-GPT: Any-to-Any Multimodal LLM"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 46 inbound Pith citation observations for arXiv:2309.05519."}