[
  {
    "Paper_ID": "GS02",
    "BID": "GS02",
    "CiteKey": "qian2024chatdev",
    "Title": "ChatDev: Communicative Agents for Software Development",
    "Authors_Year": "Chen Qian and others, 2024",
    "Venue_Tier": "ACL 2024 Long",
    "DOI_URL": "10.18653/v1/2024.acl-long.810",
    "Core_Problem": "Pengembangan perangkat lunak kolaboratif oleh agen komunikatif berbasis peran; cakupan greenfield multi-berkas skala kecil, bukan maintenance repo besar.",
    "Scope": "SE development scope (greenfield multi-file, non-SWE-bench)",
    "Proposed_Architecture": "Waterfall role-play komunikatif (CEO, CTO, CPO, Programmer, Reviewer, Tester) via chat chain.",
    "Coordination_Control": "Orkestrasi waterfall linier antar-peran; otonom antar-agen, tanpa supervisor dinamis dan tanpa approval gate selektif.",
    "Foundation_Model": "LLM umum era 2024 (laporan facet-map subagent: durasi ~7 mnt, biaya $0.18-$0.30, code completeness di SRDD — BELUM jangkar PDF).",
    "Benchmark_Dataset": "SRDD (aplikasi/game creation skala kecil).",
    "Artifact_Type": "OpenBMB/ChatDev.",
    "Primary_Metrics_Exact": "UNDOCUMENTED di SSOT jalur baru (QA/DEF korpus baru OPEN); landmark waterfall role-based.",
    "Secondary_Metrics": "Durasi/biaya generasi per rilis kecil (lihat naskah sumber).",
    "Failure_Modes": "Cascading error + halusinasi berantai tanpa gerbang pemutus.",
    "Threats_Validity": "UNDOCUMENTED (QA korpus baru OPEN).",
    "Provenance_Tag": "EVIDENCED-FACT (GS_quasi_gold.md GS02; CrossRef DOI resolve; Scopus-769 HIT DOI eksak via micro-fix P2 v2.2).",
    "QA_Score": "-",
    "Decision": "QGS-ELIGIBLE",
    "Role": "QGS (penguji recall P1+P2)",
    "Extraction_Level": "metadata-calibration",
    "txt_path": "",
    "year_derived": 2024,
    "tags_derived": [
      "qgs",
      "role-based",
      "waterfall"
    ]
  },
  {
    "Paper_ID": "GS05",
    "BID": "GS05",
    "CiteKey": "tao2024magis",
    "Title": "MAGIS: LLM-Based Multi-Agent Framework for GitHub Issue Resolution",
    "Authors_Year": "Wei Tao and others, 2024",
    "Venue_Tier": "NeurIPS 2024 (Vol 37)",
    "DOI_URL": "10.52202/079017-1647",
    "Core_Problem": "Resolusi GitHub issue repo-level secara otonom.",
    "Scope": "Repository-level GitHub issue resolution (SWE-bench 500 instances).",
    "Proposed_Architecture": "Hierarki 4 agen: Manager, Custodian, Developer, QA (supervisor-worker).",
    "Coordination_Control": "Manager membagi tugas dan mengarahkan agen lain; Custodian membatasi search space berkas; 100% otonom tanpa HITL gate.",
    "Foundation_Model": "GPT-4 era.",
    "Benchmark_Dataset": "SWE-bench (500 issue repo-level).",
    "Artifact_Type": "weitao92/MAGIS.",
    "Primary_Metrics_Exact": "Resolved rate 13.94% = 8x GPT-4 1.74% (PDF hal 1+7/Table 2 hal 7).",
    "Secondary_Metrics": "-",
    "Failure_Modes": "86% isu gagal terselesaikan tanpa batas eskalasi terukur.",
    "Threats_Validity": "UNDOCUMENTED (QA korpus baru OPEN).",
    "Provenance_Tag": "EVIDENCED-FACT (GS_quasi_gold.md GS05; Scopus-769 HIT judul eksak; arXiv 2403.17927v2 HIT).",
    "QA_Score": "-",
    "Decision": "QGS-ELIGIBLE",
    "Role": "QGS (penguji recall P1+P2)",
    "Extraction_Level": "metadata-calibration",
    "txt_path": "gs_pdfs/MAGIS_NeurIPS2024.pdf",
    "year_derived": 2024,
    "tags_derived": [
      "qgs",
      "supervisor-worker",
      "swe-bench"
    ]
  },
  {
    "Paper_ID": "GS06",
    "BID": "GS06",
    "CiteKey": "zhang2026sgagent",
    "Title": "SGAgent: Suggestion-Guided LLM-Based Multi-Agent Framework for Repository-Level Software Repair",
    "Authors_Year": "Zhang and others (NJU), 2026",
    "Venue_Tier": "ACM TOSEM (Q1) 2026",
    "DOI_URL": "10.1145/3818617",
    "Core_Problem": "Repository-level software repair.",
    "Scope": "SWE-bench Lite (300 instances) & VUL4J.",
    "Proposed_Architecture": "Localize-suggest-fix berfase (Localizer, Suggester, Fixer) + RepoGraph KG.",
    "Coordination_Control": "Koordinasi sekuensial suggestion-guided berbasis graf pengetahuan; otonom penuh tanpa hierarki komando dan tanpa approval gate.",
    "Foundation_Model": "Claude-3.5 / Claude-4 (evaluasi).",
    "Benchmark_Dataset": "SWE-bench Lite + VUL4J.",
    "Artifact_Type": "NJU-Seq/SGAgent.",
    "Primary_Metrics_Exact": "Lite 51.3% (Claude-3.5) s.d. 60.7% (Claude-4) + VUL4J 48.0% (abstrak resmi CrossRef; PDF paywalled ACM, BELUM jangkar halaman).",
    "Secondary_Metrics": "-",
    "Failure_Modes": "Gagal bila saran awal menyesatkan fixer tanpa verifikasi eksternal.",
    "Threats_Validity": "0 sitasi (umur 3,5 bln); PDF paywalled ACM.",
    "Provenance_Tag": "EVIDENCED-FACT (GS_quasi_gold.md GS06; CrossRef resolve; arXiv 2602.23647v2 HIT; Scopus MISS = lag indeks TOSEM 2026).",
    "QA_Score": "-",
    "Decision": "QGS-ELIGIBLE",
    "Role": "QGS (penguji recall P1+P2)",
    "Extraction_Level": "metadata-calibration",
    "txt_path": "",
    "year_derived": 2026,
    "tags_derived": [
      "qgs",
      "knowledge-graph",
      "swe-bench"
    ]
  },
  {
    "Paper_ID": "GS07",
    "BID": "GS07",
    "CiteKey": "islam2024mapcoder",
    "Title": "MapCoder: Multi-Agent Code Generation for Competitive Problem Solving",
    "Authors_Year": "Md Ashraful Islam and others (BUET & Rochester), 2024",
    "Venue_Tier": "ACL 2024 Long",
    "DOI_URL": "10.18653/v1/2024.acl-long.269",
    "Core_Problem": "Generasi kode problem-solving kompetitif via multi-agen.",
    "Scope": "Competitive problem solving (HumanEval, MBPP, APPS, CodeContests) — function-level, bukan repo.",
    "Proposed_Architecture": "4 agen (Retrieval, Planning, Coding, Debugging); siklus plan-code-debug retrieval-augmented.",
    "Coordination_Control": "Siklik retrieval-planning; otonom penuh tanpa hierarki formal dan tanpa gate.",
    "Foundation_Model": "LLM umum era 2024.",
    "Benchmark_Dataset": "HumanEval, MBPP, APPS, CodeContests.",
    "Artifact_Type": "ideis/MapCoder.",
    "Primary_Metrics_Exact": "UNDOCUMENTED di SSOT jalur baru (QA/DEF korpus baru OPEN).",
    "Secondary_Metrics": "-",
    "Failure_Modes": "Generalisasi ke repo skala besar belum terbukti.",
    "Threats_Validity": "UNDOCUMENTED (QA korpus baru OPEN).",
    "Provenance_Tag": "EVIDENCED-FACT (GS_quasi_gold.md GS07; Scopus-769 HIT DOI eksak; arXiv 2405.11403v1 HIT).",
    "QA_Score": "-",
    "Decision": "QGS-ELIGIBLE",
    "Role": "QGS (penguji recall P1+P2)",
    "Extraction_Level": "metadata-calibration",
    "txt_path": "",
    "year_derived": 2024,
    "tags_derived": [
      "qgs",
      "retrieval-planning"
    ]
  },
  {
    "Paper_ID": "GS10",
    "BID": "GS10",
    "CiteKey": "lee2025unidebugger",
    "Title": "UniDebugger: Hierarchical Multi-Agent Framework for Unified Software Debugging",
    "Authors_Year": "Cheryl Lee and others (CUHK & UIUC), 2025",
    "Venue_Tier": "EMNLP 2025 Main",
    "DOI_URL": "10.18653/v1/2025.emnlp-main.921",
    "Core_Problem": "Unified software debugging multi-berkas.",
    "Scope": "APR multi-berkas Defects4J v1.2 & v2.0 (bukan open-ended issue resolving).",
    "Proposed_Architecture": "Hierarki adaptif 3 level (L1 simple, L2 single-file, L3 cross-file MAS).",
    "Coordination_Control": "Eskalasi penugasan L1-L2-L3 sesuai kesulitan bug; 100% otonom tanpa gate manusia.",
    "Foundation_Model": "LLM umum era 2025.",
    "Benchmark_Dataset": "Defects4J (197 correct / 286 plausible).",
    "Artifact_Type": "Cheryl-Lee/UniDebugger.",
    "Primary_Metrics_Exact": "197 correct / 286 plausible = +25.48% vs ChatRepair + 42 unik (Figure 5 hal 7).",
    "Secondary_Metrics": "-",
    "Failure_Modes": "Patch plausible-but-incorrect lolos tanpa verifikasi manusia.",
    "Threats_Validity": "Sitasi 2 (prosiding baru).",
    "Provenance_Tag": "EVIDENCED-FACT (GS_quasi_gold.md GS10; Scopus-769 HIT DOI eksak; arXiv 2404.17153v3 HIT).",
    "QA_Score": "-",
    "Decision": "QGS-ELIGIBLE",
    "Role": "QGS (penguji recall P1+P2)",
    "Extraction_Level": "metadata-calibration",
    "txt_path": "gs_pdfs/UniDebugger_EMNLP2025.pdf",
    "year_derived": 2025,
    "tags_derived": [
      "qgs",
      "hierarchical",
      "debugging"
    ]
  },
  {
    "Paper_ID": "GS11",
    "BID": "GS11",
    "CiteKey": "kumar2026balancing",
    "Title": "Balancing autonomy and oversight in reliable agentic AI through adaptive human interaction architectures",
    "Authors_Year": "Madhvesh Kumar, Deepika Singh, 2026",
    "Venue_Tier": "Discover Artificial Intelligence (Springer) Vol 6",
    "DOI_URL": "10.1007/s44163-026-01373-2",
    "Core_Problem": "Adaptive human interaction: kapan agen jalan mandiri vs eskalasi ke operator.",
    "Scope": "Enterprise code generation & workflow automation (5.000 tugas terstruktur).",
    "Proposed_Architecture": "Supervisor-Worker multi-agent + Dynamic Intervention Framework (Contextual Confidence Score).",
    "Coordination_Control": "Supervisor menilai tiap langkah worker; skor > ambang atas auto-approve, zona tengah post-hoc audit flag, di bawah ambang bawah halt-eskalasi ke operator manusia.",
    "Foundation_Model": "LLM umum + DPO feedback.",
    "Benchmark_Dataset": "5.000 tugas terstruktur (codegen + finance/services).",
    "Artifact_Type": "- (UNDOCUMENTED).",
    "Primary_Metrics_Exact": "Intervensi 21.0%->11.5% + success 98.2% (abstrak Scopus; PDF paywalled, BELUM jangkar halaman).",
    "Secondary_Metrics": "Hanya 14.5% langkah keputusan butuh intervensi.",
    "Failure_Modes": "- (UNDOCUMENTED).",
    "Threats_Validity": "0 sitasi (umur 3,5 bln); jurnal AI umum, bukan flagship SE.",
    "Provenance_Tag": "EVIDENCED-FACT (CrossRef resolve 2026-09-12; disjoint-47; Scopus-769 HIT EID 2-s2.0-105045578545).",
    "QA_Score": "-",
    "Decision": "QGS-ELIGIBLE",
    "Role": "QGS (penutup lubang I-gate)",
    "Extraction_Level": "metadata-calibration",
    "txt_path": "",
    "year_derived": 2026,
    "tags_derived": [
      "qgs",
      "selective-gate",
      "supervisor-worker"
    ]
  },
  {
    "Paper_ID": "GS01",
    "BID": "GS01",
    "CiteKey": "li2023camel",
    "Title": "CAMEL: Communicative Agents for \"Mind\" Exploration of Large Language Model Society",
    "Authors_Year": "Guohao Li and others, 2023",
    "Venue_Tier": "NeurIPS 2023",
    "DOI_URL": "10.52202/075280-2264",
    "Core_Problem": "Role-play kolaboratif multi-agen komunikatif.",
    "Scope": "Fondasi umum (di luar SE-spesifik).",
    "Proposed_Architecture": "Communicative agents role-play.",
    "Coordination_Control": "Koordinasi komunikatif antar-peran.",
    "Foundation_Model": "LLM umum era 2023.",
    "Benchmark_Dataset": "- (fondasi umum).",
    "Artifact_Type": "- (UNDOCUMENTED).",
    "Primary_Metrics_Exact": "UNDOCUMENTED di SSOT jalur baru.",
    "Secondary_Metrics": "-",
    "Failure_Modes": "-",
    "Threats_Validity": "UNDOCUMENTED (QA korpus baru OPEN).",
    "Provenance_Tag": "EVIDENCED-FACT (GS_quasi_gold.md GS01; pembanding-C, bukan denominator recall).",
    "QA_Score": "-",
    "Decision": "COMPARISON-C",
    "Role": "pembanding-C (fondasi Bab 2)",
    "Extraction_Level": "metadata-calibration",
    "txt_path": "",
    "year_derived": 2023,
    "tags_derived": [
      "pembanding-c",
      "fondasi"
    ]
  },
  {
    "Paper_ID": "GS03",
    "BID": "GS03",
    "CiteKey": "yang2024sweagent",
    "Title": "SWE-agent: Agent-Computer Interfaces Enable Automated Software Engineering",
    "Authors_Year": "John Yang and others, 2024",
    "Venue_Tier": "NeurIPS 2024",
    "DOI_URL": "10.52202/079017-1601",
    "Core_Problem": "Baseline single-agent repo-level via agent-computer interface.",
    "Scope": "Repo-level SE (single-agent, gagal P1 multi-agent).",
    "Proposed_Architecture": "Single-agent ACI.",
    "Coordination_Control": "Otonom tunggal; tanpa koordinasi multi-agen.",
    "Foundation_Model": "LLM umum era 2024.",
    "Benchmark_Dataset": "SWE-bench.",
    "Artifact_Type": "- (UNDOCUMENTED).",
    "Primary_Metrics_Exact": "UNDOCUMENTED di SSOT jalur baru.",
    "Secondary_Metrics": "-",
    "Failure_Modes": "-",
    "Threats_Validity": "UNDOCUMENTED (QA korpus baru OPEN).",
    "Provenance_Tag": "EVIDENCED-FACT (GS_quasi_gold.md GS03; baseline-C RQ4, gagal P1 sejak awal).",
    "QA_Score": "-",
    "Decision": "COMPARISON-C",
    "Role": "pembanding-C (baseline RQ4)",
    "Extraction_Level": "metadata-calibration",
    "txt_path": "",
    "year_derived": 2024,
    "tags_derived": [
      "pembanding-c",
      "baseline",
      "single-agent"
    ]
  },
  {
    "Paper_ID": "GS04",
    "BID": "GS04",
    "CiteKey": "zhang2024autocoderover",
    "Title": "AutoCodeRover: Autonomous Program Improvement",
    "Authors_Year": "Yuntong Zhang and others, 2024",
    "Venue_Tier": "ISSTA 2024",
    "DOI_URL": "10.1145/3650212.3680384",
    "Core_Problem": "Baseline autonomous program repair (AST-search, single-agent).",
    "Scope": "Repo-level APR (single-agent, gagal P1 multi-agent).",
    "Proposed_Architecture": "Autonomous AST-search.",
    "Coordination_Control": "Otonom tunggal; tanpa koordinasi multi-agen.",
    "Foundation_Model": "LLM umum era 2024.",
    "Benchmark_Dataset": "SWE-bench (repo-level APR).",
    "Artifact_Type": "- (UNDOCUMENTED).",
    "Primary_Metrics_Exact": "UNDOCUMENTED di SSOT jalur baru.",
    "Secondary_Metrics": "-",
    "Failure_Modes": "-",
    "Threats_Validity": "UNDOCUMENTED (QA korpus baru OPEN).",
    "Provenance_Tag": "EVIDENCED-FACT (GS_quasi_gold.md GS04; baseline-C RQ4, gagal P1 sejak awal).",
    "QA_Score": "-",
    "Decision": "COMPARISON-C",
    "Role": "pembanding-C (baseline RQ4)",
    "Extraction_Level": "metadata-calibration",
    "txt_path": "",
    "year_derived": 2024,
    "tags_derived": [
      "pembanding-c",
      "baseline",
      "single-agent"
    ]
  },
  {
    "Paper_ID": "GS08",
    "BID": "GS08",
    "CiteKey": "shinn2023reflexion",
    "Title": "Reflexion: Language Agents with Verbal Reinforcement Learning",
    "Authors_Year": "Noah Shinn and others, 2023",
    "Venue_Tier": "NeurIPS 2023",
    "DOI_URL": "10.52202/075280-0377",
    "Core_Problem": "Fondasi feedback-loop / self-reflection agen bahasa.",
    "Scope": "Fondasi umum (di luar SE-spesifik).",
    "Proposed_Architecture": "Verbal reinforcement learning (self-reflection loop).",
    "Coordination_Control": "Loop refleksi verbal mandiri.",
    "Foundation_Model": "LLM umum era 2023.",
    "Benchmark_Dataset": "- (fondasi umum).",
    "Artifact_Type": "- (UNDOCUMENTED).",
    "Primary_Metrics_Exact": "UNDOCUMENTED di SSOT jalur baru.",
    "Secondary_Metrics": "-",
    "Failure_Modes": "-",
    "Threats_Validity": "UNDOCUMENTED (QA korpus baru OPEN).",
    "Provenance_Tag": "EVIDENCED-FACT (GS_quasi_gold.md GS08; pembanding-C, bukan denominator recall).",
    "QA_Score": "-",
    "Decision": "COMPARISON-C",
    "Role": "pembanding-C (fondasi Bab 2)",
    "Extraction_Level": "metadata-calibration",
    "txt_path": "",
    "year_derived": 2023,
    "tags_derived": [
      "pembanding-c",
      "fondasi"
    ]
  },
  {
    "Paper_ID": "GS09",
    "BID": "GS09",
    "CiteKey": "fakhoury2024ticoder",
    "Title": "TiCoder: Test-Driven Interactive Code Generation",
    "Authors_Year": "Sarah Fakhoury and others, 2024",
    "Venue_Tier": "IEEE TSE 2024 Vol 50 Issue 9",
    "DOI_URL": "10.1109/tse.2024.3428972",
    "Core_Problem": "Selective interaction gate (test-driven) pada code generation single-interactive.",
    "Scope": "Codegen test-driven + user study (gagal P1 multi-agent by-design).",
    "Proposed_Architecture": "Single-interactive agent via LLM + test-driven gate (m=1..5).",
    "Coordination_Control": "Gerbang interaksi selektif test-driven; bukan orkestrasi multi-agen.",
    "Foundation_Model": "LLM umum era 2024.",
    "Benchmark_Dataset": "Codegen test-driven + user study 15 devs.",
    "Artifact_Type": "- (UNDOCUMENTED).",
    "Primary_Metrics_Exact": "+45.97% pass@1 + user study 15 devs (TABLE IV preprint v2; BELUM jangkar halaman published).",
    "Secondary_Metrics": "-",
    "Failure_Modes": "-",
    "Threats_Validity": "Single-interactive (P1 via LLM, bukan multi-agent strict).",
    "Provenance_Tag": "EVIDENCED-FACT (GS_quasi_gold.md GS09; pembanding-C selective-gate Bab 2/3).",
    "QA_Score": "-",
    "Decision": "COMPARISON-C",
    "Role": "pembanding-C (selective-gate Bab 2/3)",
    "Extraction_Level": "metadata-calibration",
    "txt_path": "gs_pdfs/TiCoder_TSE2024_preprint.pdf",
    "year_derived": 2024,
    "tags_derived": [
      "pembanding-c",
      "selective-gate"
    ]
  }
]
