{"as_of":"2026-08-19T06:02:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e6ddb3085a416c02f19365ab65ec9394ec27dba20345a25428abe68dee6defeb","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-13T02:29:42.157339Z","state":"measured"},{"denominator":41,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":41,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T08:44:26.876152Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.11363","last_updated":"2026-05-12T00:32:24Z","snapshot_observed_at":"2026-08-16T05:32:02.198912Z","submitted_at":"2026-05-12T00:32:24Z","title":"PresentAgent-2: Towards Generalist Multimodal Presentation Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.11363","snapshot_observed_at":"2026-08-02T08:44:26.876152Z","title":"Presentagent-2: Towards generalist multimodal presentation agents.arXiv preprint arXiv:2605.11363, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.04438","last_updated":"2026-07-19T17:59:31Z","snapshot_observed_at":"2026-08-12T14:02:27.752586Z","submitted_at":"2026-07-05T17:59:33Z","title":"ResearchStudio-Reel: Automate the Last Mile of Research from Paper to Poster, Video, and Blog","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T08:44:26.876152Z"},"links":{"cited_paper":"/paper/2605.11363","citing_paper":"/paper/2607.04438"},"observation_digest":"sha256:8f3dde443dea44bf1ec244a9dcfbbc774c240a6b7497b1162820890d5ec52fa3","observation_id":"06151ab6-5875-475d-8f3d-03475fa27c04","resolution":{"observed_at":"2026-08-02T08:44:26.876152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2605.11363/citation-record","integrity":"/paper/2605.11363/integrity","json":"/paper/2605.11363/citation-record.json","paper":"/paper/2605.11363"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.21497","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T01:09:19.186253Z","title":"Paper2poster: Towards multimodal poster automation from scientific papers,","venue":null,"work_id":"503ebe9c-09db-4d71-a0eb-a698dd8a582b","year":2025},"citing_paper":{"arxiv_id":"2605.11363","last_updated":"2026-05-12T00:32:24Z","snapshot_observed_at":"2026-08-16T05:32:02.198912Z","submitted_at":"2026-05-12T00:32:24Z","title":"PresentAgent-2: Towards Generalist Multimodal Presentation Agents","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-13T02:29:42.157339Z"},"links":{"citing_paper":"/paper/2605.11363"},"observation_digest":"sha256:3c0adca186cc31ed1daca3d1f59a920454b7670e302ad26a0c2a891011b4ca1f","observation_id":"dadcfd4b-e521-4cf0-a5f7-c6dbd12b7147","resolution":{"observed_at":"2026-05-13T02:32:06.469529Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Presentagent: Multimodal agent for presentation video generation","venue":null,"work_id":"943a35e6-f682-432c-8183-d064b30ad291","year":2025},"citing_paper":{"arxiv_id":"2605.11363","last_updated":"2026-05-12T00:32:24Z","snapshot_observed_at":"2026-08-16T05:32:02.198912Z","submitted_at":"2026-05-12T00:32:24Z","title":"PresentAgent-2: Towards Generalist Multimodal Presentation Agents","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-13T02:29:42.157339Z"},"links":{"citing_paper":"/paper/2605.11363"},"observation_digest":"sha256:3c11c2d70a5bf8b3ef134e60809d5231bfae768ee7735e47f37f67a388c9fbd4","observation_id":"dca908e0-3930-44ee-bc54-25c4166f53c7","resolution":{"observed_at":"2026-05-13T13:02:49.757200Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.05096","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T10:58:02.741963Z","title":"Q., and Shou, M","venue":null,"work_id":"5d9f35c5-146f-4405-9a1e-95d42d634101","year":2025},"citing_paper":{"arxiv_id":"2605.11363","last_updated":"2026-05-12T00:32:24Z","snapshot_observed_at":"2026-08-16T05:32:02.198912Z","submitted_at":"2026-05-12T00:32:24Z","title":"PresentAgent-2: Towards Generalist Multimodal Presentation Agents","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-13T02:29:42.157339Z"},"links":{"citing_paper":"/paper/2605.11363"},"observation_digest":"sha256:014588183c8e1aba9c2abe353a886f825c9d71fdb6a303e010396c7d694f93a5","observation_id":"bf28b32b-a132-46a0-a0c1-93e7cac92259","resolution":{"observed_at":"2026-05-13T02:32:06.475438Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.11253","last_updated":"2026-04-21T04:59:36Z","snapshot_observed_at":"2026-08-14T07:27:53.325360Z","submitted_at":"2025-09-14T12:54:21Z","title":"VideoAgent: Personalized Synthesis of Scientific Videos","version":2},"cited_work":{"arxiv_id":"2509.11253","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.11253","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"VideoAgent: Personalized Synthesis of Scientific Videos","venue":"cs.AI","work_id":"ccea2fe9-8014-480b-9d8f-f8bb584263d1","year":2025},"citing_paper":{"arxiv_id":"2605.11363","last_updated":"2026-05-12T00:32:24Z","snapshot_observed_at":"2026-08-16T05:32:02.198912Z","submitted_at":"2026-05-12T00:32:24Z","title":"PresentAgent-2: Towards Generalist Multimodal Presentation Agents","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-13T02:29:42.157339Z"},"links":{"cited_paper":"/paper/2509.11253","citing_paper":"/paper/2605.11363"},"observation_digest":"sha256:0ea4f76af60820dec2b8f1246d4181b5a3634ab83fa7ab30dfac7bb5a2668e6d","observation_id":"cc8e9da5-6959-4f1c-9338-4917e45097e1","resolution":{"observed_at":"2026-05-13T02:32:06.466432Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.11604","last_updated":"2026-05-11T04:13:00Z","snapshot_observed_at":"2026-07-30T02:16:51.207980Z","submitted_at":"2025-05-16T18:12:26Z","title":"Talk to Your Slides: High-Efficiency Slide Editing via Language-Driven Structured Data Manipulation","version":5},"cited_work":{"arxiv_id":"2505.11604","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.11604","snapshot_observed_at":"2026-07-03T17:38:44.104644Z","title":"Talk to Your Slides: High-Efficiency Slide Editing via Language-Driven Structured Data Manipulation","venue":"cs.CL","work_id":"08a8c90d-081d-45b8-b976-c759d794e8fb","year":2025},"citing_paper":{"arxiv_id":"2605.11363","last_updated":"2026-05-12T00:32:24Z","snapshot_observed_at":"2026-08-16T05:32:02.198912Z","submitted_at":"2026-05-12T00:32:24Z","title":"PresentAgent-2: Towards Generalist Multimodal Presentation Agents","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-13T02:29:42.157339Z"},"links":{"cited_paper":"/paper/2505.11604","citing_paper":"/paper/2605.11363"},"observation_digest":"sha256:1534b45e54bf010ce362c24b2be974edcb5b3362acbf6921167855bd05b276e0","observation_id":"ebd0c220-9ded-4d65-92c2-c9d60055bc7f","resolution":{"observed_at":"2026-05-13T02:32:06.472581Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T14:14:59.542426Z","title":"Pptagent: Generating and evaluating presentations beyond text-to-slides","venue":null,"work_id":"78fc4b06-54aa-4e7f-8168-67f7155f5489","year":2025},"citing_paper":{"arxiv_id":"2605.11363","last_updated":"2026-05-12T00:32:24Z","snapshot_observed_at":"2026-08-16T05:32:02.198912Z","submitted_at":"2026-05-12T00:32:24Z","title":"PresentAgent-2: Towards Generalist Multimodal Presentation Agents","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-13T02:29:42.157339Z"},"links":{"citing_paper":"/paper/2605.11363"},"observation_digest":"sha256:06811eaac308a6ff1c601c67d221ad6b945e8389f45b0355fc799b1e61c7d559","observation_id":"72818650-064f-4dcc-9249-215894a13ad0","resolution":{"observed_at":"2026-05-13T13:02:49.762408Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.11062","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T01:09:19.228225Z","title":"Auto- Slides: An interactive multi-agent system for creating and customizing research presentations","venue":null,"work_id":"2338fa2a-470d-40f4-8c01-b68534ad46c6","year":2025},"citing_paper":{"arxiv_id":"2605.11363","last_updated":"2026-05-12T00:32:24Z","snapshot_observed_at":"2026-08-16T05:32:02.198912Z","submitted_at":"2026-05-12T00:32:24Z","title":"PresentAgent-2: Towards Generalist Multimodal Presentation Agents","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-13T02:29:42.157339Z"},"links":{"citing_paper":"/paper/2605.11363"},"observation_digest":"sha256:33cf21ca16b65866af05d5e5cda8a7c37d4f37feb629cc1cf9dcf6ce2786b389","observation_id":"ab4f3b05-932f-4b06-b539-01fd8e637cc3","resolution":{"observed_at":"2026-05-13T02:32:06.478070Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.03227","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Node-based editing for multimodal generation of text, audio, image, and video","venue":null,"work_id":"eb20644b-ad06-4069-ae04-5e6a3a6f0201","year":2025},"citing_paper":{"arxiv_id":"2605.11363","last_updated":"2026-05-12T00:32:24Z","snapshot_observed_at":"2026-08-16T05:32:02.198912Z","submitted_at":"2026-05-12T00:32:24Z","title":"PresentAgent-2: Towards Generalist Multimodal Presentation Agents","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-13T02:29:42.157339Z"},"links":{"citing_paper":"/paper/2605.11363"},"observation_digest":"sha256:c6609c9acafb781792d132106927ae7571efc38612182f68e09075616d12e82b","observation_id":"371d8d01-54df-4256-8870-04a5cf958f9c","resolution":{"observed_at":"2026-05-13T02:32:06.480754Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07848","last_updated":"2025-06-09T15:11:09Z","snapshot_observed_at":"2026-08-18T01:31:05.139092Z","submitted_at":"2025-06-09T15:11:09Z","title":"PolyVivid: Vivid Multi-Subject Video Generation with Cross-Modal Interaction and Enhancement","version":1},"cited_work":{"arxiv_id":"2506.07848","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.07848","snapshot_observed_at":"2026-07-01T22:56:20.169424Z","title":"Polyvivid: Vivid multi-subject video generation with cross-modal interaction and enhancement","venue":null,"work_id":"b4a9289e-29a2-47d9-8ce8-c72eef2327b2","year":2025},"citing_paper":{"arxiv_id":"2605.11363","last_updated":"2026-05-12T00:32:24Z","snapshot_observed_at":"2026-08-16T05:32:02.198912Z","submitted_at":"2026-05-12T00:32:24Z","title":"PresentAgent-2: Towards Generalist Multimodal Presentation Agents","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-13T02:29:42.157339Z"},"links":{"cited_paper":"/paper/2506.07848","citing_paper":"/paper/2605.11363"},"observation_digest":"sha256:e760a73f97c147dd04859f60f4c0d1633d784bd87d92201cd4d88b6deca998bf","observation_id":"3d7b7d1c-4e97-49d1-9e0f-205daa78cebf","resolution":{"observed_at":"2026-05-13T02:32:06.483612Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22647","last_updated":"2025-05-28T17:57:06Z","snapshot_observed_at":"2026-08-07T20:49:17.257002Z","submitted_at":"2025-05-28T17:57:06Z","title":"Let Them Talk: Audio-Driven Multi-Person Conversational Video Generation","version":1},"cited_work":{"arxiv_id":"2505.22647","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22647","snapshot_observed_at":"2026-07-04T10:09:44.572116Z","title":"Let them talk: Audio-driven multi-person conversational video generation","venue":null,"work_id":"b6c07d96-7a45-4c6f-9ca7-641329c5a3b5","year":2025},"citing_paper":{"arxiv_id":"2605.11363","last_updated":"2026-05-12T00:32:24Z","snapshot_observed_at":"2026-08-16T05:32:02.198912Z","submitted_at":"2026-05-12T00:32:24Z","title":"PresentAgent-2: Towards Generalist Multimodal Presentation Agents","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-13T02:29:42.157339Z"},"links":{"cited_paper":"/paper/2505.22647","citing_paper":"/paper/2605.11363"},"observation_digest":"sha256:1d577a02c96f769ff23330a4a90342ca4a76be773c85b04e5b85e53c4ee9786c","observation_id":"e91fb8d3-1b09-4292-9d6b-8aa21c96918c","resolution":{"observed_at":"2026-05-13T02:32:06.441607Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Autopresent: Designing structured visuals from scratch","venue":null,"work_id":"fdaf43d6-f597-48cd-a2ec-dc1c99c5eeb9","year":2025},"citing_paper":{"arxiv_id":"2605.11363","last_updated":"2026-05-12T00:32:24Z","snapshot_observed_at":"2026-08-16T05:32:02.198912Z","submitted_at":"2026-05-12T00:32:24Z","title":"PresentAgent-2: Towards Generalist Multimodal Presentation Agents","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-13T02:29:42.157339Z"},"links":{"citing_paper":"/paper/2605.11363"},"observation_digest":"sha256:50c47c533937e8c8a5311eb5b8f45335fbd22b7d7848f9595d62124f4f60edaa","observation_id":"b49932d2-ed43-4638-8890-6fc98df6d966","resolution":{"observed_at":"2026-05-13T13:02:49.695161Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.03197","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T17:07:25.795531Z","title":"Infinity parser: Layout aware reinforcement learning for scanned document parsing","venue":null,"work_id":"d0239f58-7352-451a-8fe4-c194aa05491e","year":2025},"citing_paper":{"arxiv_id":"2605.11363","last_updated":"2026-05-12T00:32:24Z","snapshot_observed_at":"2026-08-16T05:32:02.198912Z","submitted_at":"2026-05-12T00:32:24Z","title":"PresentAgent-2: Towards Generalist Multimodal Presentation Agents","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-13T02:29:42.157339Z"},"links":{"citing_paper":"/paper/2605.11363"},"observation_digest":"sha256:fdcd0ff1f24bc48f0045e4c2b0c8e8404493b8dff0e516bef122bf0542ef5757","observation_id":"f0312a9d-97e9-4134-bf10-12baeb471f50","resolution":{"observed_at":"2026-05-13T02:32:06.415184Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Doc2ppt: Automatic presen- tation slides generation from scientific documents","venue":null,"work_id":"0530045c-3070-410a-8525-1112e63ada9e","year":2022},"citing_paper":{"arxiv_id":"2605.11363","last_updated":"2026-05-12T00:32:24Z","snapshot_observed_at":"2026-08-16T05:32:02.198912Z","submitted_at":"2026-05-12T00:32:24Z","title":"PresentAgent-2: Towards Generalist Multimodal Presentation Agents","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-13T02:29:42.157339Z"},"links":{"citing_paper":"/paper/2605.11363"},"observation_digest":"sha256:17ddd45c8b71db5f74a8ddb4689e054f1db751ce83f0c907c0904c76a4ad4df0","observation_id":"f796951f-2d8a-4733-b4bb-edcb5d882a95","resolution":{"observed_at":"2026-05-13T13:02:49.708349Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Slides agent: An intelligent agent for creating and analyzing presentations using large","venue":null,"work_id":"df2125af-0455-4145-bcad-290b6402da8b","year":2025},"citing_paper":{"arxiv_id":"2605.11363","last_updated":"2026-05-12T00:32:24Z","snapshot_observed_at":"2026-08-16T05:32:02.198912Z","submitted_at":"2026-05-12T00:32:24Z","title":"PresentAgent-2: Towards Generalist Multimodal Presentation Agents","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-13T02:29:42.157339Z"},"links":{"citing_paper":"/paper/2605.11363"},"observation_digest":"sha256:bd73b52eb1d395e27097be77e4fb56d942e7b40bab75cc0ef984839bf821f60b","observation_id":"42ef8323-5ca5-41b8-8b66-f24bdc886cb5","resolution":{"observed_at":"2026-05-13T13:02:49.690919Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.04529","doi":"10.48550/arxiv.2512.04529","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SlideGen: Collabo- rative multimodal agents for scientific slide generation","venue":"arXiv (Cornell University)","work_id":"317605f0-d2a5-4fd1-883d-aedddbcbecee","year":2025},"citing_paper":{"arxiv_id":"2605.11363","last_updated":"2026-05-12T00:32:24Z","snapshot_observed_at":"2026-08-16T05:32:02.198912Z","submitted_at":"2026-05-12T00:32:24Z","title":"PresentAgent-2: Towards Generalist Multimodal Presentation Agents","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-13T02:29:42.157339Z"},"links":{"citing_paper":"/paper/2605.11363"},"observation_digest":"sha256:50f7a9491c871bd293fa6a0a2b772d7ee8d8185cd1f99861c3093570b6781d8b","observation_id":"74429580-9ced-489c-a3c5-6da378344b90","resolution":{"observed_at":"2026-05-13T02:32:06.407697Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.05571","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T17:38:44.230654Z","title":"Presenting a paper is an art: Self-improvement aesthetic agents for academic presentations","venue":null,"work_id":"0fffe9c3-5cce-4ff3-83a0-cd33f0bf99bc","year":2025},"citing_paper":{"arxiv_id":"2605.11363","last_updated":"2026-05-12T00:32:24Z","snapshot_observed_at":"2026-08-16T05:32:02.198912Z","submitted_at":"2026-05-12T00:32:24Z","title":"PresentAgent-2: Towards Generalist Multimodal Presentation Agents","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-13T02:29:42.157339Z"},"links":{"citing_paper":"/paper/2605.11363"},"observation_digest":"sha256:55dc9a9d4942dc6f9807ebd7462655e64baa36d723898dc3a24851572df6d0e3","observation_id":"59329108-f988-4074-b80f-c1983545e8b7","resolution":{"observed_at":"2026-05-13T02:32:06.457138Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gpt4tools: Teaching large language model to use tools via self-instruction.Advances in Neural Information Processing Systems, 36:71995–72007","venue":null,"work_id":"c2caa986-1e25-4e77-82d0-cf43c9bf7a70","year":2023},"citing_paper":{"arxiv_id":"2605.11363","last_updated":"2026-05-12T00:32:24Z","snapshot_observed_at":"2026-08-16T05:32:02.198912Z","submitted_at":"2026-05-12T00:32:24Z","title":"PresentAgent-2: Towards Generalist Multimodal Presentation Agents","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-13T02:29:42.157339Z"},"links":{"citing_paper":"/paper/2605.11363"},"observation_digest":"sha256:2f967366897a2d2dddeb18ace8b231d8ba3b21639601a4792e129554084e7345","observation_id":"cf498312-75c4-42dd-92e9-6958df28398c","resolution":{"observed_at":"2026-05-13T13:02:49.727964Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.11381","last_updated":"2023-03-20T18:31:47Z","snapshot_observed_at":"2026-08-16T13:20:46.785210Z","submitted_at":"2023-03-20T18:31:47Z","title":"MM-REACT: Prompting ChatGPT for Multimodal Reasoning and Action","version":1},"cited_work":{"arxiv_id":"2303.11381","doi":"10.48550/arxiv.2303.11381","metadata_source":"pith","pith_arxiv_id":"2303.11381","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MM-REACT: Prompting ChatGPT for Multimodal Reasoning and Action","venue":"cs.CV","work_id":"6dc43db8-227d-438e-8658-0c8acecba08a","year":2023},"citing_paper":{"arxiv_id":"2605.11363","last_updated":"2026-05-12T00:32:24Z","snapshot_observed_at":"2026-08-16T05:32:02.198912Z","submitted_at":"2026-05-12T00:32:24Z","title":"PresentAgent-2: Towards Generalist Multimodal Presentation Agents","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-13T02:29:42.157339Z"},"links":{"cited_paper":"/paper/2303.11381","citing_paper":"/paper/2605.11363"},"observation_digest":"sha256:b5934cf497b0c8b15c404c1ceea86bc351e47162539bb48ee634c674bd8aac88","observation_id":"c0c735ad-5fb9-4cee-b0d3-93f8f5adc520","resolution":{"observed_at":"2026-05-14T01:17:58.977376Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Os-genesis: Automating gui agent trajectory construction via reverse task synthesis","venue":null,"work_id":"2c20a654-b7e5-4036-9580-84fdbbcce6d3","year":2025},"citing_paper":{"arxiv_id":"2605.11363","last_updated":"2026-05-12T00:32:24Z","snapshot_observed_at":"2026-08-16T05:32:02.198912Z","submitted_at":"2026-05-12T00:32:24Z","title":"PresentAgent-2: Towards Generalist Multimodal Presentation Agents","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-13T02:29:42.157339Z"},"links":{"citing_paper":"/paper/2605.11363"},"observation_digest":"sha256:2e22b7ef5c0ffca0c75c9c964c2bf97926affc682c3125cc5c699ef1e87185f1","observation_id":"ca5e12fd-76b9-45a0-9e7f-7bd3e36c8ec3","resolution":{"observed_at":"2026-05-13T13:02:49.680217Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00398","last_updated":"2023-09-07T08:11:01Z","snapshot_observed_at":"2026-08-16T15:04:02.343598Z","submitted_at":"2023-09-01T11:14:43Z","title":"VideoGen: A Reference-Guided Latent Diffusion Approach for High Definition Text-to-Video Generation","version":2},"cited_work":{"arxiv_id":"2309.00398","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.00398","snapshot_observed_at":"2026-07-04T14:59:55.947520Z","title":"arXiv preprint arXiv:2309.00398 (2023) 6, 1","venue":null,"work_id":"3e0e2f45-9789-4c06-9f52-59d98e898afc","year":2023},"citing_paper":{"arxiv_id":"2605.11363","last_updated":"2026-05-12T00:32:24Z","snapshot_observed_at":"2026-08-16T05:32:02.198912Z","submitted_at":"2026-05-12T00:32:24Z","title":"PresentAgent-2: Towards Generalist Multimodal Presentation Agents","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-13T02:29:42.157339Z"},"links":{"cited_paper":"/paper/2309.00398","citing_paper":"/paper/2605.11363"},"observation_digest":"sha256:2161000b55cc541ea3b1ace01bf3953c1bbfc66557da8dd581c89eb015853e2b","observation_id":"72a6e0f9-afd5-412c-990e-12fad2d59c2d","resolution":{"observed_at":"2026-05-13T02:32:06.435877Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T16:33:56.494303Z","title":"Phyt2v: Llm-guided iterative self- refinement for physics-grounded text-to-video generation","venue":null,"work_id":"e7e163ce-9a71-481a-b586-bdccc43cfd75","year":2025},"citing_paper":{"arxiv_id":"2605.11363","last_updated":"2026-05-12T00:32:24Z","snapshot_observed_at":"2026-08-16T05:32:02.198912Z","submitted_at":"2026-05-12T00:32:24Z","title":"PresentAgent-2: Towards Generalist Multimodal Presentation Agents","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-13T02:29:42.157339Z"},"links":{"citing_paper":"/paper/2605.11363"},"observation_digest":"sha256:36cbf864b6a628e665c19b129afad96aeedf6ac6ffcbe9bc80c8717083d51bf9","observation_id":"e788e6dc-dcf5-4cb9-b020-29fe7d053bc7","resolution":{"observed_at":"2026-05-13T13:02:49.738177Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-08-15T19:52:28.153954Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":"2408.06072","doi":"10.48550/arxiv.2408.06072","metadata_source":"pith","pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","venue":"cs.CV","work_id":"f38fc088-12aa-4bf4-9ecd-08d3e797ccb7","year":2024},"citing_paper":{"arxiv_id":"2605.11363","last_updated":"2026-05-12T00:32:24Z","snapshot_observed_at":"2026-08-16T05:32:02.198912Z","submitted_at":"2026-05-12T00:32:24Z","title":"PresentAgent-2: Towards Generalist Multimodal Presentation Agents","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-13T02:29:42.157339Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2605.11363"},"observation_digest":"sha256:5497033bd418b3e36ffaf8a5187e55aaa3a98d7854d49c740731646570c478a1","observation_id":"9a6fdb57-0869-4d03-92ee-a2f67503722a","resolution":{"observed_at":"2026-05-13T02:32:06.444424Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.02567","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T07:36:58.031623Z","title":"Unified multimodal understanding and generation models: Advances, challenges, and opportunities.arXiv preprint arXiv:2505.02567","venue":null,"work_id":"b2e70f99-2155-4021-82c3-540574140c6a","year":2025},"citing_paper":{"arxiv_id":"2605.11363","last_updated":"2026-05-12T00:32:24Z","snapshot_observed_at":"2026-08-16T05:32:02.198912Z","submitted_at":"2026-05-12T00:32:24Z","title":"PresentAgent-2: Towards Generalist Multimodal Presentation Agents","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-13T02:29:42.157339Z"},"links":{"citing_paper":"/paper/2605.11363"},"observation_digest":"sha256:b6e8ec98fd2f766b762a27c7f00f706634e6b647d216604a30d7cedfb4cd3270","observation_id":"2f886056-ac37-44db-abbc-fb5d28659806","resolution":{"observed_at":"2026-05-13T02:32:06.447724Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.15804","last_updated":"2026-04-21T03:35:14Z","snapshot_observed_at":"2026-08-14T13:05:43.952056Z","submitted_at":"2026-04-17T08:05:46Z","title":"Qwen3.5-Omni Technical Report","version":2},"cited_work":{"arxiv_id":"2604.15804","doi":"10.48550/arxiv.2604.15804","metadata_source":"pith","pith_arxiv_id":"2604.15804","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Qwen3.5-Omni Technical Report","venue":"cs.CL","work_id":"9d0aeac4-3b94-4a09-af62-5e32286fdf5f","year":2026},"citing_paper":{"arxiv_id":"2605.11363","last_updated":"2026-05-12T00:32:24Z","snapshot_observed_at":"2026-08-16T05:32:02.198912Z","submitted_at":"2026-05-12T00:32:24Z","title":"PresentAgent-2: Towards Generalist Multimodal Presentation Agents","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-13T02:29:42.157339Z"},"links":{"cited_paper":"/paper/2604.15804","citing_paper":"/paper/2605.11363"},"observation_digest":"sha256:1fbf4fed05f2e96f6286b3b206447b3dd8f63965682eef069ec127f8d7954a9f","observation_id":"5d738567-e7c6-46ff-91ca-6589dbf51a03","resolution":{"observed_at":"2026-05-13T02:32:06.418990Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06955","last_updated":"2025-03-12T01:45:04Z","snapshot_observed_at":"2026-08-16T12:51:39.630420Z","submitted_at":"2025-03-10T06:04:31Z","title":"Motion Anything: Any to Motion Generation","version":2},"cited_work":{"arxiv_id":"2503.06955","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.06955","snapshot_observed_at":"2026-07-01T21:56:16.181986Z","title":"Motion anything: Any to motion generation","venue":null,"work_id":"7afe7b27-c2cf-41f9-8832-e4f5cc9f0e3b","year":2025},"citing_paper":{"arxiv_id":"2605.11363","last_updated":"2026-05-12T00:32:24Z","snapshot_observed_at":"2026-08-16T05:32:02.198912Z","submitted_at":"2026-05-12T00:32:24Z","title":"PresentAgent-2: Towards Generalist Multimodal Presentation Agents","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-13T02:29:42.157339Z"},"links":{"cited_paper":"/paper/2503.06955","citing_paper":"/paper/2605.11363"},"observation_digest":"sha256:af6eb645818fd705a1735f6337e74c9082285a5153397a5d3cba81656a5122fd","observation_id":"f6643a88-8a2c-42d7-8a54-82467eabc718","resolution":{"observed_at":"2026-05-13T02:32:06.423233Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10061","last_updated":"2024-07-14T03:12:19Z","snapshot_observed_at":"2026-08-16T13:34:26.769167Z","submitted_at":"2024-07-14T03:12:19Z","title":"InfiniMotion: Mamba Boosts Memory in Transformer for Arbitrary Long Motion Generation","version":1},"cited_work":{"arxiv_id":"2407.10061","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.10061","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Infinimotion: Mamba boosts memory in transformer for arbitrary long motion generation","venue":null,"work_id":"34218c16-39e9-4032-8b72-69cf6faf57ff","year":2024},"citing_paper":{"arxiv_id":"2605.11363","last_updated":"2026-05-12T00:32:24Z","snapshot_observed_at":"2026-08-16T05:32:02.198912Z","submitted_at":"2026-05-12T00:32:24Z","title":"PresentAgent-2: Towards Generalist Multimodal Presentation Agents","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-13T02:29:42.157339Z"},"links":{"cited_paper":"/paper/2407.10061","citing_paper":"/paper/2605.11363"},"observation_digest":"sha256:fa02f43e1fab08bc0d58d00e162a2129924b68e35dba196406d1527b36fe1e79","observation_id":"497a87b8-55f1-42c9-9016-e07f2be068d3","resolution":{"observed_at":"2026-05-13T02:32:06.430047Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.06481","last_updated":"2025-04-16T16:45:12Z","snapshot_observed_at":"2026-08-16T13:01:24.495131Z","submitted_at":"2024-11-10T14:41:38Z","title":"KMM: Key Frame Mask Mamba for Extended Motion Generation","version":2},"cited_work":{"arxiv_id":"2411.06481","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.06481","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Kmm: Key frame mask mamba for extended motion generation","venue":null,"work_id":"ff2e0ac7-c42f-406b-9e0e-4ca2e82e021d","year":2024},"citing_paper":{"arxiv_id":"2605.11363","last_updated":"2026-05-12T00:32:24Z","snapshot_observed_at":"2026-08-16T05:32:02.198912Z","submitted_at":"2026-05-12T00:32:24Z","title":"PresentAgent-2: Towards Generalist Multimodal Presentation Agents","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-13T02:29:42.157339Z"},"links":{"cited_paper":"/paper/2411.06481","citing_paper":"/paper/2605.11363"},"observation_digest":"sha256:b6090490ac7de9382c1e7ac2775e35371240a7c9e798bf27276364ad8a285478","observation_id":"192b69c6-c65c-4666-9e76-c46796326fb2","resolution":{"observed_at":"2026-05-13T02:32:06.463488Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Motion mamba: Efficient and long sequence motion generation","venue":null,"work_id":"105fc4db-893e-4ff8-9f51-d0a649a7cc63","year":2024},"citing_paper":{"arxiv_id":"2605.11363","last_updated":"2026-05-12T00:32:24Z","snapshot_observed_at":"2026-08-16T05:32:02.198912Z","submitted_at":"2026-05-12T00:32:24Z","title":"PresentAgent-2: Towards Generalist Multimodal Presentation Agents","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-13T02:29:42.157339Z"},"links":{"citing_paper":"/paper/2605.11363"},"observation_digest":"sha256:2c0fa5bdfa90b1b345653c196b9de6be47216181ce12751315c1fca9eb7a2c26","observation_id":"39adb5c7-7403-4651-b8b3-72cef9de1c0f","resolution":{"observed_at":"2026-05-13T13:02:49.685930Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Evaluating object hallucination in large vision-language models","venue":null,"work_id":"ccf417c6-61bf-4c14-bde4-7d461fce27e8","year":2023},"citing_paper":{"arxiv_id":"2605.11363","last_updated":"2026-05-12T00:32:24Z","snapshot_observed_at":"2026-08-16T05:32:02.198912Z","submitted_at":"2026-05-12T00:32:24Z","title":"PresentAgent-2: Towards Generalist Multimodal Presentation Agents","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-13T02:29:42.157339Z"},"links":{"citing_paper":"/paper/2605.11363"},"observation_digest":"sha256:7734d4902cee924bd4a335ec0bd22f03ed854da6c4af63605060bfc5ef7229ce","observation_id":"629962e1-8b72-465e-ae00-3cdf44883a88","resolution":{"observed_at":"2026-05-13T13:02:49.699752Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Towards generalist foundation model for radiology by leveraging web-scale 2d&3d medical data.Nature Communications, 16(1):7866","venue":null,"work_id":"d6e7a7a7-a0f3-4b5b-883c-a78c2ac644e2","year":2025},"citing_paper":{"arxiv_id":"2605.11363","last_updated":"2026-05-12T00:32:24Z","snapshot_observed_at":"2026-08-16T05:32:02.198912Z","submitted_at":"2026-05-12T00:32:24Z","title":"PresentAgent-2: Towards Generalist Multimodal Presentation Agents","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-13T02:29:42.157339Z"},"links":{"citing_paper":"/paper/2605.11363"},"observation_digest":"sha256:2ba33024c9946dee25775e96f5320bd23e240b3af06cba36d89934801985c00d","observation_id":"4bcdc1dd-94f4-4e24-ac6f-01404c611947","resolution":{"observed_at":"2026-05-13T13:02:49.720574Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mavis: A multi-agent framework for long-sequence video storytelling","venue":null,"work_id":"0c42e827-da8b-4df5-951d-ddee3fa83d45","year":2026},"citing_paper":{"arxiv_id":"2605.11363","last_updated":"2026-05-12T00:32:24Z","snapshot_observed_at":"2026-08-16T05:32:02.198912Z","submitted_at":"2026-05-12T00:32:24Z","title":"PresentAgent-2: Towards Generalist Multimodal Presentation Agents","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-13T02:29:42.157339Z"},"links":{"citing_paper":"/paper/2605.11363"},"observation_digest":"sha256:ccb8788152906e6c1e616cb268ccb46640e9f7b5a3510e3cac720de887f480cb","observation_id":"7479da98-217e-44fa-a73a-b5e9b42c56b1","resolution":{"observed_at":"2026-05-13T13:02:49.748374Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Multimodal content alignment with llm for visual presentation of papers","venue":null,"work_id":"49d487e7-3ca2-47a4-ba3a-4c46dbba49c5","year":2025},"citing_paper":{"arxiv_id":"2605.11363","last_updated":"2026-05-12T00:32:24Z","snapshot_observed_at":"2026-08-16T05:32:02.198912Z","submitted_at":"2026-05-12T00:32:24Z","title":"PresentAgent-2: Towards Generalist Multimodal Presentation Agents","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-13T02:29:42.157339Z"},"links":{"citing_paper":"/paper/2605.11363"},"observation_digest":"sha256:77c15d53d4b544c18d1ab69b69459d66291848a999a370cb0a5db52003227247","observation_id":"073d4230-c1cc-4e16-9ade-febcb4b5aecb","resolution":{"observed_at":"2026-05-13T13:02:49.673644Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21660","last_updated":"2025-08-31T00:34:05Z","snapshot_observed_at":"2026-08-17T01:06:56.592374Z","submitted_at":"2025-05-27T18:36:19Z","title":"PreGenie: An Agentic Framework for High-quality Visual Presentation Generation","version":2},"cited_work":{"arxiv_id":"2505.21660","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.21660","snapshot_observed_at":"2026-07-02T13:16:58.286178Z","title":"Pregenie: An agentic framework for high-quality visual presentation generation","venue":null,"work_id":"d194d864-6082-40f8-9283-d7792b0a348c","year":2025},"citing_paper":{"arxiv_id":"2605.11363","last_updated":"2026-05-12T00:32:24Z","snapshot_observed_at":"2026-08-16T05:32:02.198912Z","submitted_at":"2026-05-12T00:32:24Z","title":"PresentAgent-2: Towards Generalist Multimodal Presentation Agents","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-13T02:29:42.157339Z"},"links":{"cited_paper":"/paper/2505.21660","citing_paper":"/paper/2605.11363"},"observation_digest":"sha256:487e4e62f7aa0865f1b9d487aebd5709fca74d29abc658b4362591fe56083be6","observation_id":"beb96f69-932c-425c-b445-7a1bdeb29323","resolution":{"observed_at":"2026-05-13T02:32:06.453852Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.15253","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-01T14:15:47.512780Z","title":"Present- coach: Dual-agent presentation coaching through exemplars and interactive feedback","venue":null,"work_id":"c658ced1-8dd9-431c-b384-c9655f33b172","year":2025},"citing_paper":{"arxiv_id":"2605.11363","last_updated":"2026-05-12T00:32:24Z","snapshot_observed_at":"2026-08-16T05:32:02.198912Z","submitted_at":"2026-05-12T00:32:24Z","title":"PresentAgent-2: Towards Generalist Multimodal Presentation Agents","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-13T02:29:42.157339Z"},"links":{"citing_paper":"/paper/2605.11363"},"observation_digest":"sha256:c0d89077f4cf12fac19923a973ab935313f610878891b7f2eaeead725be073c8","observation_id":"da205164-c5ba-401f-a8c7-a3238b697d56","resolution":{"observed_at":"2026-05-13T02:32:06.460526Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14683","last_updated":"2025-07-27T11:45:16Z","snapshot_observed_at":"2026-08-17T01:11:44.872398Z","submitted_at":"2025-05-20T17:59:30Z","title":"Emerging Properties in Unified Multimodal Pretraining","version":3},"cited_work":{"arxiv_id":"2505.14683","doi":"10.48550/arxiv.2505.14683","metadata_source":"pith","pith_arxiv_id":"2505.14683","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Emerging Properties in Unified Multimodal Pretraining","venue":"cs.CV","work_id":"e0cfd82c-f5d4-44fd-b531-ec73ab0a805b","year":2025},"citing_paper":{"arxiv_id":"2605.11363","last_updated":"2026-05-12T00:32:24Z","snapshot_observed_at":"2026-08-16T05:32:02.198912Z","submitted_at":"2026-05-12T00:32:24Z","title":"PresentAgent-2: Towards Generalist Multimodal Presentation Agents","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-13T02:29:42.157339Z"},"links":{"cited_paper":"/paper/2505.14683","citing_paper":"/paper/2605.11363"},"observation_digest":"sha256:0ede97d170c00a0c34697cd805def8fc55782afce90ccc0bc9eebfd5f6235c9d","observation_id":"9ffebeec-3f56-426a-8cb1-7dddfbadebf8","resolution":{"observed_at":"2026-05-13T02:32:06.426637Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12528","last_updated":"2025-09-08T02:42:57Z","snapshot_observed_at":"2026-08-18T17:34:44.890427Z","submitted_at":"2024-08-22T16:32:32Z","title":"Show-o: One Single Transformer to Unify Multimodal Understanding and Generation","version":7},"cited_work":{"arxiv_id":"2408.12528","doi":"10.48550/arxiv.2408.12528","metadata_source":"pith","pith_arxiv_id":"2408.12528","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Show-o: One Single Transformer to Unify Multimodal Understanding and Generation","venue":"cs.CV","work_id":"1393dc24-a6b2-44e1-b5d7-7009d1fa4811","year":2024},"citing_paper":{"arxiv_id":"2605.11363","last_updated":"2026-05-12T00:32:24Z","snapshot_observed_at":"2026-08-16T05:32:02.198912Z","submitted_at":"2026-05-12T00:32:24Z","title":"PresentAgent-2: Towards Generalist Multimodal Presentation Agents","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-13T02:29:42.157339Z"},"links":{"cited_paper":"/paper/2408.12528","citing_paper":"/paper/2605.11363"},"observation_digest":"sha256:c218babaca02a35519c87e559a1d6cdf90b58fa127c22b74e573bbe82c89e8d7","observation_id":"8c6ce789-a5c0-4e4a-889c-b4dc7ac5ed4b","resolution":{"observed_at":"2026-05-13T02:32:06.438819Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Showui: One vision-language-action model for gui visual agent","venue":null,"work_id":"2e523eed-21fc-4668-b9b1-f908d6df6247","year":2025},"citing_paper":{"arxiv_id":"2605.11363","last_updated":"2026-05-12T00:32:24Z","snapshot_observed_at":"2026-08-16T05:32:02.198912Z","submitted_at":"2026-05-12T00:32:24Z","title":"PresentAgent-2: Towards Generalist Multimodal Presentation Agents","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-13T02:29:42.157339Z"},"links":{"citing_paper":"/paper/2605.11363"},"observation_digest":"sha256:4034db2f083dfdae6314ba7f61d2075b1ca044e5c87c5aeff407e02a013d8e5d","observation_id":"248d91e6-138a-4823-9b10-dbb823043333","resolution":{"observed_at":"2026-05-13T13:02:49.743426Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15091","last_updated":"2024-07-12T18:03:29Z","snapshot_observed_at":"2026-08-16T14:57:26.944781Z","submitted_at":"2023-09-26T17:36:26Z","title":"VideoDirectorGPT: Consistent Multi-scene Video Generation via LLM-Guided Planning","version":2},"cited_work":{"arxiv_id":"2309.15091","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.15091","snapshot_observed_at":"2026-07-04T14:59:55.973287Z","title":"Videodirectorgpt: Consistent multi-scene video generation via llm-guided planning","venue":null,"work_id":"386fe0af-d0c9-4b38-a690-55b83415dbe2","year":2023},"citing_paper":{"arxiv_id":"2605.11363","last_updated":"2026-05-12T00:32:24Z","snapshot_observed_at":"2026-08-16T05:32:02.198912Z","submitted_at":"2026-05-12T00:32:24Z","title":"PresentAgent-2: Towards Generalist Multimodal Presentation Agents","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-13T02:29:42.157339Z"},"links":{"cited_paper":"/paper/2309.15091","citing_paper":"/paper/2605.11363"},"observation_digest":"sha256:8fcb34a77fecf036ff80cee7bf7bd456d06fb36c8bb5619b0451ff7478ce2e6a","observation_id":"eb0ae429-ec71-4d5e-aea3-5c5c84b69a8e","resolution":{"observed_at":"2026-05-13T02:32:06.450743Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Videostudio: Generating consistent-content and multi-scene videos","venue":null,"work_id":"b2810075-c1a6-4992-a319-4ac585bc33ac","year":2024},"citing_paper":{"arxiv_id":"2605.11363","last_updated":"2026-05-12T00:32:24Z","snapshot_observed_at":"2026-08-16T05:32:02.198912Z","submitted_at":"2026-05-12T00:32:24Z","title":"PresentAgent-2: Towards Generalist Multimodal Presentation Agents","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-13T02:29:42.157339Z"},"links":{"citing_paper":"/paper/2605.11363"},"observation_digest":"sha256:2321cf909d2d0685449514eb920125ab37fa17bcc43af3c9adf64215b3830531","observation_id":"c1cd4cc8-e650-4584-975c-21b4dfa43538","resolution":{"observed_at":"2026-05-13T13:02:49.668443Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17444","last_updated":"2024-05-04T19:28:10Z","snapshot_observed_at":"2026-08-16T14:56:25.243355Z","submitted_at":"2023-09-29T17:54:46Z","title":"LLM-grounded Video Diffusion Models","version":3},"cited_work":{"arxiv_id":"2309.17444","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.17444","snapshot_observed_at":"2026-07-04T16:39:57.572622Z","title":"LLM -grounded video diffusion models","venue":null,"work_id":"11e16a9e-29d3-4409-b6a2-0fd470cefd02","year":2023},"citing_paper":{"arxiv_id":"2605.11363","last_updated":"2026-05-12T00:32:24Z","snapshot_observed_at":"2026-08-16T05:32:02.198912Z","submitted_at":"2026-05-12T00:32:24Z","title":"PresentAgent-2: Towards Generalist Multimodal Presentation Agents","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-13T02:29:42.157339Z"},"links":{"cited_paper":"/paper/2309.17444","citing_paper":"/paper/2605.11363"},"observation_digest":"sha256:1cf164478c806e25ea67ab39f19e7d3f96cbf3b677e6e7f693f41c575c4391a5","observation_id":"4de520cb-cae8-439d-bf54-36ae52f0b2c4","resolution":{"observed_at":"2026-05-13T02:32:06.411311Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.11363","last_updated":"2026-05-12T00:32:24Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T05:32:02.198912Z","submitted_at":"2026-05-12T00:32:24Z","title":"PresentAgent-2: Towards Generalist Multimodal Presentation Agents"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":0,"verified_exact":24,"verified_fuzzy":15},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 1 inbound Pith citation observation for arXiv:2605.11363."}